ప్రధాన కంటెంట్‌కు దాటవేయి

Kyutai యొక్క భావోద్వేగాలను వ్యక్తీకరించే బహుభాషా టెక్స్ట్-టు-స్పీచ్ (TTS) ను విస్తరించడానికి తీసుకున్న మార్గం

ఎలా క్యూటై ఉత్పత్తికి సిద్ధమైన బహుభాషా వాయిస్ డేటాను వ్యక్తీకరణాత్మక TTS కోసం నిర్మించిందో తెలుసుకోండి

September 1, 2026 | యునైటెడ్ స్టేట్స్

తెలుపు నేపథ్యంపై ఆకుపచ్చ ముందుకు వెళ్లే గీతతో నలుపు అక్షరాలలో 'kyutai'.

ఎగ్జిక్యూటివ్ సారాంశం

ఓపెన్-సైన్స్ AI ప్రయోగశాల అయిన క్యూటై బహుభాషా టెక్స్ట్-టు-స్పీచ్ మోడళ్లను అభివృద్ధి చేసినప్పుడు, అవి కేవలం స్పష్టమైన మాటలకంటే ఎక్కువను పట్టుకునే శిక్షణ డేటాను అవసరపడింది. ఆ మోడళ్లకు అనేక భాషల్లో స్థిరమైన ఉచ్చారణ, స్వరపాట, భావోద్వేగం, మరియు వ్యాఖ్యానంతో కూడిన స్టూడియో-స్థాయి రికార్డింగ్స్ అవసరమయ్యాయి.

Uber AI Solutions (UAIS)తో భాగస్వామ్యం ద్వారా, Kyutai పూర్తి స్థాయి స్పీచ్ డేటా ప్రోగ్రామ్‌ను ఏర్పాటు చేసింది, ఇందులో వాయిస్ టాలెంట్, రికార్డింగ్, ట్రాన్స్‌క్రిప్షన్, అనోటేషన్, మెటాడేటా మరియు నాణ్యత హామీ ఉన్నాయి. ఈ సహకారం పునరావృతంగా ఉపయోగించదగిన బహుభాషా పైప్‌లైన్‌ను రూపొందించింది, ఇది అధునాతన వాయిస్ AI సిస్టమ్‌ల కోసం అధిక నాణ్యత, భావోద్వేగాలను వ్యక్తపరిచే శిక్షణ డేటాను ఉత్పత్తి చేయగలదు.

ప్రధాన ఫలితాలు

500 గంటలు

ఐదు భాషల్లో రూపొందించిన స్టూడియో-స్థాయి మాటల డేటా

95%+

ప్రధాన QA పరిమాణాలలో నాణ్యత ప్రమాణాలు సాధించబడ్డాయి

25%

సంక్లిష్టమైన సందర్భాలలో TTS విఫలమైన రేటు తగ్గింపు

Production-grade voice AI requires more than speech collection


Kyutai was pushing the boundaries of open voice and multimodal AI, including real-time conversational models and advanced speech generation.As the lab moved toward emotionally expressive text-to-speech, available datasets presented a limitation. Basic speech databases could support intelligibility, but they often lacked the emotional nuance, conversational variation, and multilingual consistency needed to produce natural-sounding voices.

Building the datasets introduced significant operational complexity. Speakers needed to maintain consistent identities and recording quality across sessions while delivering varied emotions and speaking styles. Transcripts, emotion labels, non-speech events, pronunciation, and metadata also had to remain accurate across languages and recording batches. To scale, Kyutai needed a governed production process capable of creating expressive multilingual data consistently.

బహుభాషా వాయిస్ డేటా కోసం ఏకీకృత ఉత్పత్తి పైప్లైన్ సృష్టించడం


Kyutai, రికార్డింగ్, ట్రాన్స్క్రిప్షన్, అనోటేషన్, QAలను విడివిడిగా నిర్వహించకుండా, వాటన్నింటినీ ఒకే సమన్వయిత వ్యవస్థగా అమలు చేయడానికి Uber AI Solutionsతో భాగస్వామ్యం చేసుకుంది.

Uber AI Solutions మా అత్యంత నమ్మకమైన డేటా ప్రొవైడర్లు మరియు అనోటేటర్లు. వారు కొత్త వినియోగ సందర్భాలు మరియు స్పెసిఫికేషన్లకు త్వరగా అనుగుణంగా మారతారు, సమయానికి డెలివరీ చేస్తారు, మరియు నిర్దోషమైన నాణ్యతను అందిస్తారు.


Alexandre Défossez
చీఫ్ ఎక్స్‌ప్లోరేషన్ ఆఫీసర్, క్యూటై

UAIS ఫ్రెంచ్, బ్రెజిలియన్ పోర్చుగీస్, యూరోపియన్ మరియు లాటిన్ అమెరికన్ స్పానిష్, జర్మన్ భాషల్లో బహుభాషా రికార్డింగ్ కార్యక్రమాలను సమన్వయించింది. వాయిస్ టాలెంట్‌కు భావోద్వేగాలు మరియు స్వరపాటిని విస్తరించేందుకు రూపొందించిన నిర్మిత మార్గదర్శకత్వాన్ని అందించారు, ఇందులో అనుభూతిపూర్వకమైన, వ్యంగ్యమైన, కోపంగా, దుఃఖంగా, ఏడుస్తూ మరియు ఇతర అధిక తీవ్రత కలిగిన మాట్లాడే శైలులు ఉన్నాయి.

AI సహాయంతో ట్రాన్స్క్రిప్షన్‌ను మానవ ధృవీకరణతో కలిపిన వర్క్‌ఫ్లో వర్బాటిమ్ ట్రాన్స్క్రిప్ట్‌లు, భావోద్వేగ లేబుల్‌లు, మాట్లాడని సంఘటనలు మరియు ఇతర మెటాడేటా కోసం ఉపయోగించబడింది. ప్రమాణిత నాణ్యత ప్రమాణాలు అన్ని స్పీకర్లు మరియు రికార్డింగ్ బ్యాచ్‌లలో వర్తించబడ్డాయి, QAని తుది చెక్‌పాయింట్‌గా కాకుండా ఉత్పత్తి యొక్క నిరంతర భాగంగా మార్చాయి.

ఈ ఆపరేటింగ్ మోడల్ ప్రోగ్రామ్ భాషలు, మాట్లాడేవారు, మరియు మరింత సూక్ష్మమైన వాయిస్ అవసరాలు పెరిగే కొద్దీ, క్యూతై స్థిరత్వాన్ని కొనసాగించడంలో సహాయపడింది.

వ్యాఖ్యాత్మక బహుభాషా వాయిస్ టెక్స్ట్ టు స్పీచ్ కోసం సమగ్ర డేటాసెట్‌ను అందించడం


ఈ భాగస్వామ్యం ద్వారా Kyutai యొక్క వ్యక్తీకరణ TTS అవసరాలకు అనుగుణంగా నిర్మితమైన బహుభాషా శిక్షణ డేటా యొక్క నిర్మిత మూలాన్ని అందించింది.

డేటాసెట్‌కి మించి, ఈ సహకారం ప్రతిసారి పునరావృతం చేయగలిగే విధానాన్ని స్థాపించింది, ఇది ప్రతిభ నిర్వహణ, నాణ్యత నమోదు, వ్యాఖ్యానాలు, మరియు పంపిణీ చేయబడిన భాషా ప్రోగ్రామ్‌లలో అంగీకార ప్రమాణాలను నిర్వహించేందుకు ఉపయోగపడింది. ఆ పునాది డేటా మోడల్ శిక్షణలోకి ప్రవేశించే ముందు వైవిధ్యాన్ని తగ్గించింది మరియు అవసరాలు మారుతున్నప్పుడు భవిష్యత్తులో స్పీచ్ డేటాసెట్‌లను రూపొందించేందుకు క్యూటైకి మరింత స్థిరమైన మార్గాన్ని అందించింది.

KPIలు

అంగీకార రేటు

నివేదిక సమర్పణ తరచుదనం

ఆడియో నాణ్యత స్కోరు

95%+

ప్రతి బ్యాచ్ సమర్పణతో

ఉచ్చారణ & ప్రాసొడి స్థిరత్వం

95%+

ప్రతి బ్యాచ్ సమర్పణతో

వర్బాటిమ్ ట్రాన్స్క్రిప్షన్ ఖచ్చితత్వం

95%+

ప్రతి బ్యాచ్ సమర్పణతో

వ్యాఖ్యాన ఖచ్చితత్వం (భావోద్వేగం & మాట్లాడని ట్యాగులు)

95%+

ప్రతి బ్యాచ్ సమర్పణతో

వర్ణక్రమం & విరామచిహ్నాలు

95%+

ప్రతి బ్యాచ్ సమర్పణతో

వ్యక్తీకరణాత్మక AI వాయిస్ జనరేషన్ కోసం డేటా పునాది స్థాపించడం


స్కేలబుల్ బహుభాషా స్పీచ్ డేటా పైప్‌లైన్‌ను అమలు చేసిన తర్వాత, Kyutai తన పనిని మరిన్ని భాషలు, ఉపభాషలు, భావోద్వేగ శైలులు మరియు ఆధునిక సంభాషణ వాయిస్ అప్లికేషన్‌లకు విస్తరించింది. Kyutai కోసం, ఈ భాగస్వామ్యం వ్యక్తీకరణతో కూడిన, అధిక-నాణ్యత గల మానవ స్పీచ్ డేటాను రూపొందించడానికి ఆపరేషన్ పునాది ఏర్పరిచింది, ఇది మరింత సహజమైన వాయిస్ AI వ్యవస్థలను అభివృద్ధి చేయడంలో కీలకమైనది.

మీ AI అభివృద్ధిని ముందుకు తీసుకెళ్లేందుకు Uber AI Solutions మీ సంస్థతో భాగస్వామ్యం చేయగలిగే విధానాన్ని తెలుసుకోండి.

సాక్ష్యాలు వ్యక్తిగత ఫలితాలను ప్రతిబింబిస్తాయి. ప్రతి వినియోగదారునికి ఫలితాలు భిన్నంగా ఉండవచ్చు; ఒక నిర్దిష్ట వినియోగదారునికి ఫలితాలు గ్యారంటీ చేయబడవు, మరియు వినియోగదారుల అనుభవం మారవచ్చు.