Kyutaiගේ සංවේදී හැඟීම් ප්රකාශ කළ හැකි බහුභාෂා පාඨ-වචන (TTS) පද්ධතිය විශාල කිරීමේ මාර්ගය
Kyutai කණ්ඩායම ප්රකාශන-සූදානම් බහුභාෂා හඬ දත්ත ප්රකාශනශීලි TTS සඳහා කෙසේ නිර්මාණය කළේදැයි ඉගෙන ගන්න
September 1, 2026 | එක්සත් ජනපදය
ප්රධාන සාරාංශය
විවෘත විද්යා AI රසායනාගාරයක් වන කියුටයි බහුභාෂා පෙළ-කට-කථන ආකෘති දියුණු කළ බැවින්, එයට තේරුම්ගත හැකි කථනයට වඩා වැඩි යමක් ග්රහණය කර ගන්නා පුහුණු දත්ත අවශ්ය විය. ආකෘති සඳහා බහු භාෂා හරහා ස්ථාවර උච්චාරණය, ප්රොසොඩි, හැඟීම් සහ විවරණ සහිත ස්ටුඩියෝ-ශ්රේණියේ පටිගත කිරීම් අවශ්ය විය.
Uber AI Solutions (UAIS) සමඟ හවුල් වීමෙන්, Kyutai සම්පූර්ණ පද්ධති කථන දත්ත වැඩසටහනක් පිහිටුවා තිබුණි, මෙය හඬ දක්ෂතා, සවන්ගැනීම, ලිපිගොනු කිරීම, සටහන් තැබීම, දත්ත විස්තර, සහ ගුණාත්මකභාවය සහතික කිරීම ආදිය ආවරණය කරයි. මෙම සහයෝගිතාව මඟින්, උසස් හඬ AI පද්ධති සඳහා උසස් තත්ත්වයේ, සංවේදී හැඟීම් සහිත පුහුණු දත්ත නිපදවිය හැකි, නැවත නැවත භාවිතා කළ හැකි බහුභාෂාමය නලයක් නිර්මාණය විය.
ප්රධාන ප්රතිඵල
500 පැය
භාෂා පහක් හරහා නිපදවන ලද ස්ටුඩියෝ තත්ත්වයේ කථන දත්ත
95%+
ප්රධාන තත්ත්ව සහතික මාන දර්ශක හරහා ගුණාත්මකත්ව සීමා ඉටු කර ඇත
25%
සංකීර්ණ අවස්ථාවල TTS අසාර්ථකතා අනුපාතය අඩු කිරීම
Production-grade voice AI requires more than speech collection
Kyutai was pushing the boundaries of open voice and multimodal AI, including real-time conversational models and advanced speech generation.As the lab moved toward emotionally expressive text-to-speech, available datasets presented a limitation. Basic speech databases could support intelligibility, but they often lacked the emotional nuance, conversational variation, and multilingual consistency needed to produce natural-sounding voices.
Building the datasets introduced significant operational complexity. Speakers needed to maintain consistent identities and recording quality across sessions while delivering varied emotions and speaking styles. Transcripts, emotion labels, non-speech events, pronunciation, and metadata also had to remain accurate across languages and recording batches. To scale, Kyutai needed a governed production process capable of creating expressive multilingual data consistently.
බහුභාෂා හඬ දත්ත සඳහා ඒකාබද්ධ නිෂ්පාදන නලයක් සෑදීම
Kyutai, Uber AI Solutions සමඟ හවුල් වී, වෙන්ව වෙන්ව පාලනය කිරීම වෙනුවට, ශ්රව්ය දත්ත නිර්මාණය එක් සමනාත්මක පද්ධතියක් ලෙස ක්රියාත්මක කිරීමට කටයුතු කළේය; මෙය වාර්තා කිරීම, පරිවර්තනය, සටහන් කිරීම සහ තත්ත්ව සහතික කිරීම වෙන වෙනම කළ නොහැකි බවයි.
“
Uber AI Solutions අපගේ විශ්වාසදායකම දත්ත සැපයුම්කරුවන් සහ සටහන් සටහන්කරුවන් අතරින් එකකි. ඔවුන් නව භාවිතා කේස් සහ පිරිවිතරවලට ඉතා වේගයෙන් හැඩගස්වා ගනී, කාලයට අනුකූලව ලබාදෙයි, සහ නිපුණත්වයෙන් යුත් උසස් තත්ත්වයක් රැගෙන එයි.
”
Alexandre Défossez
ප්රධාන ගවේෂණ නිලධාරී, Kyutai
UAIS විසින් ප්රංශ, බ්රසීලියානු පෘතුගීසි, යුරෝපීය සහ ලතින් ඇමරිකානු ස්පාඤ්ඤ සහ ජර්මානු භාෂා හරහා බහුභාෂා පටිගත කිරීමේ වැඩසටහන් සම්බන්ධීකරණය කරන ලදී. හඬ කුසලතාවන්ට සංවේදී, උපහාසාත්මක, කෝපය, දුක, හැඬීම සහ අනෙකුත් ඉහළ තීව්රතාවයකින් යුත් කථන විලාසයන් ඇතුළුව චිත්තවේගීය සහ ප්රොසෝඩික් පරාසය පුළුල් කිරීම සඳහා නිර්මාණය කර ඇති ව්යුහගත මග පෙන්වීමක් ලැබුණි.
වාචික පිටපත්, හැඟීම් ලේබල, කථන නොවන සිදුවීම් සහ අනෙකුත් පාර-දත්ත සඳහා මානව සත්යාපනය සමඟ AI සහාය ඇතිව පිටපත් කිරීමේ ක්රියාවලිය ඒකාබද්ධ කරන ලදී. කථිකයන් සහ පටිගත කිරීමේ කාණ්ඩ හරහා ප්රමිතිගත ගුණාත්මක නිර්ණායක යොදන ලද අතර, QA අවසාන මුරපොලකට වඩා නිෂ්පාදනයේ අඛණ්ඩ කොටසක් බවට පත් කළේය.
මෙම මෙහෙයුම් ආකෘතිය Kyutai වෙත වැඩසටහන භාෂා, කථිකයන් සහ වැඩි විස්තර සහිත හඬ අවශ්යතා වෙත විහිදෙන විටත් ස්ථාවරතාවය පවත්වාගෙන යාමට උපකාර විය.
ප්රකාශනීය බහුභාෂා TTS සඳහා විස්තරාත්මක දත්ත කට්ටලයක් ලබාදීම
මෙම සම්බන්ධතාවය Kyutaiගේ ප්රකාශනීය TTS අවශ්යතා සඳහා අභිරුචිකරණය කළ බහුභාෂා පුහුණු දත්ත සඳහා ව්යුහගත මූලාශ්රයක් නිපදවා ඇත.
දත්ත කට්ටලයට අමතරව, බෙදා හරින ලද භාෂා වැඩසටහන් හරහා කුසලතා කළමනාකරණය, පටිගත කිරීමේ ගුණාත්මකභාවය, විවරණ සහ පිළිගැනීමේ නිර්ණායක සඳහා සහයෝගීතාවය පුනරාවර්තනය කළ හැකි ක්රියාවලියක් ස්ථාපිත කළේය. එම පදනම දත්ත ආකෘති පුහුණුවට ඇතුළු වීමට පෙර විචල්යතාවය අඩු කළ අතර අවශ්යතා පරිණාමය වන විට අනාගත කථන දත්ත කට්ටල ජනනය කිරීමට වඩාත් ස්ථාවර ක්රමයක් කියුටායිට ලබා දුන්නේය.
KPIs | පිළිගැනීමේ අනුපාතය | වාර්තා කිරීමේ සංඛ්යාතය |
|---|---|---|
ශ්රව්ය ගුණාත්මකත්ව ලකුණු | 95%+ | එක් එක් කාණ්ඩය ඉදිරිපත් කිරීම සමඟ |
ඇසීමේ රීතිය සහ ප්රසෝදිය අඛණ්ඩවීම | 95%+ | එක් එක් කාණ්ඩය ඉදිරිපත් කිරීම සමඟ |
වචන හැරවීමේ නිවැරදිභාවය | 95%+ | එක් එක් කාණ්ඩය ඉදිරිපත් කිරීම සමඟ |
සටහන් කිරීමේ නිවැරදිත්වය (භාවනාව සහ නොවන කථන ටැග්) | 95%+ | එක් එක් කාණ්ඩය ඉදිරිපත් කිරීම සමඟ |
අක්ෂර වින්යාසය සහ විරාම ලකුණු | 95%+ | එක් එක් කාණ්ඩය ඉදිරිපත් කිරීම සමඟ |
ප්රකාශනීය AI හඬ ජනනය සඳහා දත්ත පදනම ස්ථාපනය කිරීම
පරිමාණය කළ හැකි බහුභාෂා කථන දත්ත නල මා ර්ගයක් සමඟින්, කියුටායි එහි කාර්යය අතිරේක භාෂා, උපභාෂා, චිත්තවේගීය විලාසයන් සහ උසස් සංවාදාත්මක හඬ යෙදුම් දක්වා ව්යාප්ත කළේය. කියුටායි සඳහා, හවුල්කාරිත්වය මගින් වැඩි වැඩියෙන් ස්වාභාවික හඬ AI පද්ධති දියුණු කිරීම සඳහා අත්යවශ්ය ප්රකාශන, උසස් තත්ත්වයේ මානව කථන දත්ත ජනනය කිරීම සඳහා මෙහෙයුම් පදනම නිර්මාණය කරන ලදී.
ඔබගේ ව්යාපාරය සඳහා ඔබේ AI තාක්ෂණය ඉදිරියට ගෙන යාමට Uber AI Solutions සමඟ හවුල් වීමට හැකි ආකාරය ඉගෙන ගන්න.
ප්රතිචාරයන් ව්යක්තිගත ප්රතිඵලයන් පෙන්වයි. ව්යක්තිගත ප්රතිඵලයන් කිසිදු පාරිභෝග ිකයෙකුට ලබාගත හැකි ප්රතිඵලයක් සඳහා සහතිකයක් නොවන අතර, පාරිභෝගික අත්දැකීම් වෙනස් විය හැක.
විධාන
කර්මාන්ත
සම්පත්
අනාවරණය කරන්න