Kyutai का भावनात्मक रूप से अभिव्यंजक बहुभाषी टेक्स्ट-टू-स्पीच (TTS) को बड़े पैमाने पर ले जाने का सफर
जानें कि Kyutai ने अभिव्यक्तिपूर्ण TTS के लिए प्रोडक्शन-रेडी बहुभाषी वॉयस डेटा कैसे तैयार किया
September 1, 2026 | संयुक्त राज्य अमेरिका
कार्यकारी सारांश
जैसे-जैसे ओपन-साइंस एआई लैब Kyutai ने मल्टीलिंगुअल टेक्स्ट-टू-स्पीच मॉडल्स को आगे बढ़ाया, उसे ऐसी ट्रेनिंग डेटा की ज़रूरत थी जो केवल स्पष्ट बोलचाल से कहीं अधिक हो। इन मॉडलों के लिए स्टूडियो-ग्रेड रिकॉर्डिंग्स चाहिए थीं, जिनमें कई भाषाओं में उच्चारण, लय, भावनाओं और एनोटेशन की निरंतरता हो।
Uber AI Solutions (UAIS) के साथ साझेदारी करके, Kyutai ने एक संपूर्ण स्पीच डेटा प्रोग्राम स्थापित किया जिसमें वॉयस टैलेंट, रिकॉर्डिंग, ट्रांसक्रिप्शन, एनोटेशन, मेटाडेटा और गुणवत्ता सुनिश्चित करना शामिल है। इस सहयोग से एक दोहराए जा सकने वाला बहुभाषी पाइपलाइन तैयार हुई, जो उन्नत वॉयस AI सिस्टम्स के लिए उच्च गुणवत्ता वाला, भावनात्मक रूप से अभिव्यक्तिपूर्ण प्रशिक्षण डेटा तैयार करने में सक्षम है।
मुख्य परिणाम
500 घंटे
पाँच भाषाओं में तैयार किए गए स्टूडियो-ग्रेड स्पीच डेटा
95%+
मुख्य QA मानकों में गुणवत्ता के स्तर प्राप्त किए गए हैं
25%
जटिल मामलों में TTS विफलता दर में कमी
उत्पादन-स्तरीय वॉयस एआई के लिए केवल स्पीच कलेक्शन ही पर्याप्त नहीं है
Kyutai ओपन वॉयस और मल्टीमॉडल AI की सीमाओं को आगे बढ़ा रहा था, जिसमें रियल-टाइम संवादात्मक मॉडल और उन्नत स्पीच जनरेशन शामिल थे। जैसे-जैसे लैब भावनात्मक रूप से अभिव्यक्तिपूर्ण टेक्स्ट-टू-स्पीच की ओर बढ़ी, उपलब्ध डाटासेट्स एक सीमा बन गए। मूलभूत स्पीच डाटाबेस समझ में आने वाली आवाज़ के लिए तो पर्याप्त थे, लेकिन उनमें अक्सर वह भावनात्मक गहराई, संवाद में विविधता और बहुभाषी स्थिरता नहीं होती थी, जो स्वाभाविक लगने वाली आवाज़ें तैयार करने के लिए ज़रूरी है।
डेटासेट्स तैयार करना एक जटिल संचालन प्रक्रिया थी। वक्ताओं को हर सत्र में अपनी पहचान और रिकॉर्डिंग की गुणवत्ता बनाए रखते हुए अलग-अलग भावनाएँ और बोलने की शैलियाँ प्रस्तुत करनी थीं। ट्रांसक्रिप्ट, भावनाओं के लेबल, गैर-वाचिक घटनाएँ, उच्चारण और मेटाडेटा को भी सभी भाषाओं और रिकॉर्डिंग बैचों में सटीक बनाए रखना जरूरी था। बड़े स्तर पर काम करने के लिए, Kyutai को एक सुव्यवस्थित उत्पादन प्रक्रिया की आवश्यकता थी, जो लगातार अभिव्यक्तिपूर्ण बहुभाषी डेटा तैयार कर सके।
बहुभाषी वॉयस डेटा के लिए एकीकृत प्रोडक्शन पाइपलाइन तैयार करना
Kyutai ने Uber AI Solutions के साथ मिलकर वॉयस डेटा निर्माण को एक समन्वित सिस्टम के रूप में लागू किया, ताकि रिकॉर्डिंग, ट्रांसक्रिप्शन, एनोटेशन और QA को अलग-अलग प्रबंधित करने के बजाय एक साथ प्रबंधित किया जा सके।
“
Uber AI Solutions हमारे सबसे भरोसेमंद डेटा प्रदाताओं और एनोटेटरों में से एक है। वे नए उपयोग मामलों और विनिर्देशों के अनुसार तेजी से अनुकूलित होते हैं, समय पर डिलीवरी करते हैं और उत्कृष्ट गुणवत्ता प्रदान करते हैं।
”
Alexandre Défossez
मुख्य एक्सप्लोरेशन अधिकारी, Kyutai
UAIS ने फ्रेंच, ब्राज़ीलियाई पुर्तगाली, यूरोपीय और लैटिन अमेरिकी स्पेनिश, और जर्मन में बहुभाषी रिकॉर्डिंग कार्यक्रमों का समन्वय किया। वॉयस टैलेंट को संरचित मार्गदर्शन दिया गया, जिसका उद्देश्य उनकी भावनात्मक और स्वरगत विविधता को बढ़ाना था, जिसमें सहानुभूति, व्यंग्य, गुस्सा, उदासी, रोना और अन्य उच्च-तीव्रता वाली बोलने की शैलियाँ शामिल थीं।
AI-सहायता प्राप्त ट्रांसक्रिप्शन को मानव सत्यापन के साथ जोड़ा गया, जिसमें शब्दशः ट्रांसक्रिप्ट, भावनाओं के लेबल, गैर-वाचिक घटनाएँ और अन्य मेटाडेटा शामिल थे। मानकीकृत गुणवत्ता मानदंड सभी वक्ताओं और रिकॉर्डिंग बैचों पर लागू किए गए, जिससे गुणवत्ता जांच उत्पादन की सतत प्रक्रिया बन गई, न कि केवल अंतिम चरण।
इस संचालन मॉडल ने Kyutai को तब भी एकरूपता बनाए रखने में मदद की जब कार्यक्रम विभिन्न भाषाओं, वक्ताओं और लगातार बदलती आवाज़ की आवश्यकताओं के साथ विस्तारित हुआ।
एक्सप्रेसिव मल्टीलिंगुअल TTS के लिए विस्तृत डेटा सेट प्रदान करना
इस सहयोग ने Kyutai की अभिव्यक्तिपूर्ण TTS आवश्यकताओं के लिए बहुभाषी प्रशिक्षण डेटा का एक संरचित स्रोत तैयार किया।
डेटासेट के अलावा, इस सहयोग ने टैलेंट प्रबंधन, गुणवत्ता रिकॉर्डिंग, एनोटेशन और स्वीकृति मानदंडों को विभिन्न भाषाई कार्यक्रमों में संभालने के लिए एक दोहराने योग्य प्रक्रिया स्थापित की। इस आधार ने मॉडल प्रशिक्षण में डेटा आने से पहले विविधता को कम किया और Kyutai को भविष्य में बदलती आवश्यकताओं के अनुसार स्पीच डेटासेट तैयार करने का एक अधिक सुसंगत तरीका दिया।
केपीआई | एक्सेप्टेंस रेट | रिपोर्टिंग की आवृत्ति |
|---|---|---|
ऑडियो गुणवत्ता स्कोर | 95%+ | हर बैच स बमिशन के साथ |
उच्चारण और स्वर-लय की एकरूपता | 95%+ | हर बैच सबमिशन के साथ |
शब्दशः ट्रांसक्रिप्शन की शुद्धता | 95%+ | हर बैच सबमिशन के साथ |
एनोटेशन की सटीकता (भावना और गैर-वाचिक टैग) | 95%+ | हर बैच सबमिशन के साथ |
वर्तनी और विराम चिह्न | 95%+ | हर बैच सबमिशन के साथ |
एक्सप्रेसिव एआई वॉयस जनरेशन के लिए डेटा की मजबूत नींव तैयार करना
एक स्केलेबल बहुभाषी स्पीच डेटा पाइपलाइन स्थापित होने के बाद, Kyutai ने अपने कार्य को अतिरिक्त भाषाओं, बोलियों, भावनात्मक शैलियों और उन्नत संवादात्मक वॉयस एप्लिकेशन तक विस्तारित किया। Kyutai के लिए, इस साझेदारी ने अभिव्यक्तिपूर्ण, उच्च-गुणवत्ता वाले मानव स्पीच डेटा के निर्माण के लिए संचालनात्मक आधार तैयार किया, जो लगातार अधिक स्वाभाविक वॉयस एआई सिस्टम को आगे बढ़ाने के लिए आवश्यक है।
जानें कि Uber AI Solutions आपके एंटरप्राइज़ के साथ मिलकर आपकी AI को आगे बढ़ाने में कैसे सहयोग कर सकता है।
ग्राहकों की राय व्यक्तिगत परिणामों को दर्शाती है। व्यक्तिगत परिणाम किसी भी ग्राहक के लिए एक समान परिणाम की गारंटी नहीं हैं, और ग्राहक अनुभव भिन्न-भिन्न हो स कते हैं।