मुख्य सामग्रीवर जा

Kyutai च्या भावनिक अभिव्यक्ती असलेल्या बहुभाषिक मजकूर-ते-भाषण (TTS) च्या प्रमाणवृद्धीचा मार्ग

क्युताईने अभिव्यक्तिपूर्ण TTS साठी उत्पादन-योग्य बहुभाषिक व्हॉइस डेटा कसा तयार केला हे जाणून घ्या

September 1, 2026 | संयुक्त राज्य अमेरिका

पांढऱ्या पार्श्वभूमीवर काळ्या रंगात 'kyutai' मजकूर आणि हिरव्या रंगाचा फॉरवर्ड स्लॅश.

कार्यकारी सारांश

जेव्हा ओपन-सायन्स AI लॅब Kyutai ने बहुभाषिक टेक्स्ट-टू-स्पीच मॉडेल्स विकसित केली, तेव्हा त्यांना केवळ स्पष्ट भाषणापेक्षा अधिक काही टिपणारे प्रशिक्षण डेटा आवश्यक होते. या मॉडेल्ससाठी स्टुडिओ-ग्रेड रेकॉर्डिंग्स लागल्या ज्यामध्ये उच्चार, स्वर, भावना आणि विविध भाषांमध्ये एकसारखी टीपण्या सातत्याने असाव्यात.

Uber AI Solutions (UAIS) सोबत भागीदारी करून, Kyutai ने एक पूर्ण-स्टॅक स्पीच डेटा कार्यक्रम स्थापन केला ज्यामध्ये व्हॉइस टॅलेंट, रेकॉर्डिंग, ट्रान्सक्रिप्शन, अ‍ॅनोटेशन, मेटाडेटा आणि गुणवत्ता हमी यांचा समावेश आहे. या सहकार्यामुळे एक पुनरावृत्तीयोग्य बहुभाषिक पाइपलाइन तयार झाली जी प्रगत व्हॉइस AI सिस्टीम्ससाठी उच्च-गुणवत्तेचा, भावनिक अभिव्यक्ती असलेला प्रशिक्षण डेटा तयार करू शकते.

मुख्य परिणाम

500 तास

पाच भाषांमध्ये तयार केलेल्या स्टुडिओ-ग्रेड भाषण डेटाचा

95%+

मुख्य QA मापदंडांमध्ये गुणवत्ता निकष गाठले आहेत

25%

कठीण प्रकरणांमध्ये TTS अपयश दरात घट

Production-grade voice AI requires more than speech collection


Kyutai was pushing the boundaries of open voice and multimodal AI, including real-time conversational models and advanced speech generation.As the lab moved toward emotionally expressive text-to-speech, available datasets presented a limitation. Basic speech databases could support intelligibility, but they often lacked the emotional nuance, conversational variation, and multilingual consistency needed to produce natural-sounding voices.

Building the datasets introduced significant operational complexity. Speakers needed to maintain consistent identities and recording quality across sessions while delivering varied emotions and speaking styles. Transcripts, emotion labels, non-speech events, pronunciation, and metadata also had to remain accurate across languages and recording batches. To scale, Kyutai needed a governed production process capable of creating expressive multilingual data consistently.

अनेक भाषांतील व्हॉइस डेटासाठी एकसंध उत्पादन पाइपलाइन तयार करणे


Kyutai ने Uber AI Solutions सोबत भागीदारी केली आहे जेणेकरून व्हॉइस डेटा निर्मिती स्वतंत्रपणे रेकॉर्डिंग, ट्रान्सक्रिप्शन, अ‍ॅनोटेशन आणि QA व्यवस्थापित करण्याऐवजी एक समन्वित प्रणाली म्हणून कार्यान्वित करता येईल.

Uber AI Solutions हे आमचे सर्वात विश्वासार्ह डेटा पुरवठादार आणि अ‍ॅनोटेटर्सपैकी एक आहेत. ते नवीन वापर प्रकरणे आणि तपशीलांनुसार जलद जुळवून घेतात, वेळेत डिलिव्हर करतात आणि उत्कृष्ट दर्जासह काम करतात.


Alexandre Défossez
मुख्य अन्वेषण अधिकारी, Kyutai

UAIS ने फ्रेंच, ब्राझिलियन पोर्तुगीज, युरोपियन आणि लॅटिन अमेरिकन स्पॅनिश, तसेच जर्मन या भाषांमध्ये समन्वित बहुभाषिक रेकॉर्डिंग कार्यक्रम राबवले. व्हॉइस टॅलेंटना भावनिक आणि स्वरातील विविधता वाढवण्यासाठी रचनात्मक मार्गदर्शन दिले गेले, ज्यामध्ये सहानुभूतीपूर्ण, उपरोधिक, रागावलेले, दुःखी, रडणारे आणि इतर उच्च-तीव्रतेच्या बोलण्याच्या शैलींचा समावेश होता.

AI-सहाय्यित ट्रान्सक्रिप्शन आणि मानवी पडताळणी यांचा संगम करून, अक्षरशः ट्रान्सक्रिप्ट्स, भावना लेबले, नॉन-स्पीच इव्हेंट्स आणि इतर मेटाडेटा तयार करण्यात आले. मानक गुणवत्ता निकष सर्व स्पीकर्स आणि रेकॉर्डिंग बॅचेसमध्ये लागू करण्यात आले, ज्यामुळे QA हा उत्पादन प्रक्रियेचा सातत्यपूर्ण भाग बनला, अंतिम तपासणीऐवजी.

हे ऑपरेटिंग मॉडेल Kyutai ला कार्यक्रम विविध भाषा, वक्ते आणि अधिक सूक्ष्म आवाजाच्या गरजांसह विस्तारत असताना सातत्य राखण्यास मदत झाली.

एक्सप्रेसिव बहुभाषिक TTS साठी सविस्तर डेटासेट प्रदान करणे


या सहभागामुळे Kyutai च्या अभिव्यक्त TTS गरजांसाठी अनुरूप अशा बहुभाषिक प्रशिक्षण डेटाचा संरचित स्रोत तयार झाला.

डेटासेटच्या पलीकडे, या सहकार्यामुळे प्रतिभा व्यवस्थापन, गुणवत्ता नोंदणी, एनोटेशन आणि स्वीकार्यता निकषांसाठी एक पुनरावृत्तीयोग्य प्रक्रिया स्थापन झाली, जी वितरित भाषा कार्यक्रमांमध्ये लागू केली गेली. या पायाभरणीमुळे डेटामध्ये मॉडेल प्रशिक्षणापूर्वी असलेली विविधता कमी झाली आणि आवश्यकतांमध्ये बदल होत असताना Kyutai ला भविष्यातील भाषण डेटासेट्स तयार करण्यासाठी अधिक सुसंगत मार्ग मिळाला.

केपीआय

स्वीकार दर

अहवाल देण्याची वारंवारिता

ऑडिओ गुणवत्ता गुण

95%+

प्रत्येक बॅच सबमिशनसह

उच्चार आणि स्वरयोजन सुसंगती

95%+

प्रत्येक बॅच सबमिशनसह

शब्दशः लिप्यंतरणाची अचूकता

95%+

प्रत्येक बॅच सबमिशनसह

एनोटेशन अचूकता (भावना आणि गैर-भाषण टॅग्स)

95%+

प्रत्येक बॅच सबमिशनसह

स्पेलिंग आणि विरामचिन्ह

95%+

प्रत्येक बॅच सबमिशनसह

एक्सप्रेसिव AI व्हॉइस जनरेशनसाठी डेटा फाउंडेशन तयार करणे


स्केलेबल बहुभाषिक स्पीच डेटा पाइपलाइन उपलब्ध झाल्यामुळे, Kyutai ने आपले कार्य इतर भाषांमध्ये, बोलीभाषांमध्ये, भावनिक शैलींमध्ये आणि प्रगत संवादात्मक व्हॉइस अनुप्रयोगांमध्ये विस्तारले. Kyutai साठी, या भागीदारीमुळे अधिक नैसर्गिक व्हॉइस AI प्रणाली विकसित करण्यासाठी आवश्यक असलेल्या अभिव्यक्त, उच्च-गुणवत्तेच्या मानवी स्पीच डेटाच्या निर्मितीसाठी कार्यात्मक पाया तयार झाला.

जाणून घ्या की Uber AI Solutions तुमच्या एंटरप्राइझसोबत भागीदारी करून तुमच्या AI ला कसे पुढे नेऊ शकतात.

प्रशंसापत्रांमध्ये वैयक्तिक परिणाम दर्शवले आहेत. प्रत्येक ग्राहकासाठी परिणाम हमीशीर असतीलच असे नाही, आणि ग्राहकांचा अनुभव वेगवेगळा असू शकतो.