Mine põhisisu juurde

Kyutai tee emotsionaalselt väljendusrikka mitmekeelse kõnetuvastuse (TTS) skaleerimiseni

Uuri, kuidas Kyutai lõi tootmiskõlbuliku mitmekeelse hääleandmestiku väljendusrikka TTS-i jaoks

1. september 2026 | Ameerika Ühendriigid

Must tekst 'kyutai' koos rohelise kaldkriipsuga valgel taustal.

Kokkuvõte

Kuna avatud teaduse AI-labor Kyutai arendas mitmekeelseid tekstist kõneks mudeleid, vajas see treeningandmeid, mis hõlmaksid enamat kui lihtsalt arusaadav kõne. Mudelid vajasid stuudiokvaliteediga salvestisi, kus hääldus, prosoodia, emotsioon ja märgendus oleksid mitmes keeles ühtlased.

Tehes koostööd Uber AI Solutionsiga (UAIS), lõi Kyutai täieliku kõneandmete programmi, mis hõlmab hääletalente, salvestamist, transkribeerimist, märgendamist, metaandmeid ja kvaliteedikontrolli. Koostöö tulemusel loodi korduvkasutatav mitmekeelne töövoog, mis võimaldab toota kõrgekvaliteedilist ja emotsionaalselt väljendusrikast treeningandmestikku arenenud hääle tehisintellekti süsteemidele.

Põhitulemused

500 tundi

Viies keeles loodud stuudiokvaliteediga kõneandmed

95%+

Kvaliteediläved saavutatud kõigi oluliste kvaliteedimõõdikute lõikes

25%

TTS-i tõrgete vähenemine keerukate juhtumite korral

Production-grade voice AI requires more than speech collection


Kyutai was pushing the boundaries of open voice and multimodal AI, including real-time conversational models and advanced speech generation.As the lab moved toward emotionally expressive text-to-speech, available datasets presented a limitation. Basic speech databases could support intelligibility, but they often lacked the emotional nuance, conversational variation, and multilingual consistency needed to produce natural-sounding voices.

Building the datasets introduced significant operational complexity. Speakers needed to maintain consistent identities and recording quality across sessions while delivering varied emotions and speaking styles. Transcripts, emotion labels, non-speech events, pronunciation, and metadata also had to remain accurate across languages and recording batches. To scale, Kyutai needed a governed production process capable of creating expressive multilingual data consistently.

Mitmekeelse häälandmete tootmise ühtse tootmisahela loomine


Kyutai tegi koostööd Uber AI Solutionsiga, et muuta häälandmete loomine üheks koordineeritud süsteemiks, selle asemel et hallata salvestamist, transkribeerimist, märgendamist ja kvaliteedikontrolli eraldi.

Uber AI Solutions on üks meie kõige usaldusväärsemaid andmepakkujaid ja märgendajaid. Nad kohanevad kiiresti uute kasutusjuhtude ja spetsifikatsioonidega, täidavad ülesanded õigeaegselt ning tagavad laitmatu kvaliteedi.


Alexandre Défossez
Peamine uurimisjuht, Kyutai

UAIS koordineeris mitmekeelsete salvestusprogrammide läbiviimist prantsuse, Brasiilia portugali, Euroopa ja Ladina-Ameerika hispaania ning saksa keeles. Hääletalendid said struktureeritud juhiseid, mis olid mõeldud emotsionaalse ja prosoodilise väljendusulatuse laiendamiseks, hõlmates empaatilist, sarkastilist, vihast, kurba, nutvat ja muid kõrge intensiivsusega kõneviise.

Töövoog ühendas tehisintellekti abil tehtud transkribeerimise inimliku kontrolliga, et tagada sõnasõnalised ärakirjad, emotsioonide märgendid, kõnevälised sündmused ja muu metaandmestik. Standardiseeritud kvaliteedikriteeriume rakendati kõigi kõnelejate ja salvestuspartiide puhul, muutes kvaliteedikontrolli tootmisprotsessi pidevaks osaks, mitte lõplikuks kontrollpunktiks.

See töömudel aitas Kyutail säilitada järjepidevust, kui programm laienes erinevatesse keeltesse, kõnelejatele ja üha keerukamatele häälenõuetele.

Üksikasjaliku andmekogumi edastamine väljendusrikka mitmekeelse kõnesünteesi jaoks


Koostöö tulemusel loodi struktureeritud mitmekeelne koolitusandmestik, mis on kohandatud Kyutai väljendusvõimelise TTS-i vajadustele.

Lisaks andmekogule endale lõi koostöö korduvkasutatava protsessi talendi haldamiseks, kvaliteedi salvestamiseks, märgistamiseks ja vastuvõtukriteeriumide määramiseks erinevates hajutatud keeleprogrammides. See alus vähendas muutlikkust enne, kui andmed jõudsid mudeli koolitusse, ning andis Kyutaile järjepidevama viisi tulevaste kõneandmekogude loomiseks vastavalt muutuvatele nõuetele.

KPI-d

Vastuvõtuprotsent

Aruandluse sagedus

Heli kvaliteedi hinne

95%+

Iga partii esitamisega

Häälduse ja prosoodia ühtlus

95%+

Iga partii esitamisega

Sõnasõnalise transkriptsiooni täpsus

95%+

Iga partii esitamisega

Annotatsiooni täpsus (emotsioonid ja mitte-kõne sildid)

95%+

Iga partii esitamisega

Õigekiri ja kirjavahemärgid

95%+

Iga partii esitamisega

Andmete aluse loomine väljendusrikka tehisintellekti häälegeneratsiooni jaoks


Kui skaleeritav mitmekeelne kõneandmete töövoog oli paigas, laiendas Kyutai oma tegevust täiendavatesse keeltesse, murretesse, emotsionaalsetesse stiilidesse ja arenenud vestlusliku hääle rakendustesse. Kyutai jaoks lõi see koostöö operatiivse aluse väljendusrikka ja kvaliteetse inimkõne andmete loomiseks, mis on hädavajalik üha loomulikumate hääle tehisintellekti süsteemide arendamiseks.

Uuri, kuidas Uber AI Solutions saab teha koostööd sinu ettevõttega, et viia sinu tehisintellekti lahendused järgmisele tasemele.

Iseloomustused kajastavad üksikisikute kogemusi. Igaühe kogemus võib olla erinev ning tulemused võivad klientidel erineda; konkreetset tulemust ei saa tagada.