O percurso da Kyutai para escalar a conversão de texto em fala (TTS) multilíngue emocionalmente expressiva
Saiba como a Kyutai criou dados de voz multilíngues prontos para produção para TTS expressiva
1 de setembro de 2026 | Estados Unidos
Sumário executivo
À medida que o laboratório de IA de ciência aberta Kyutai avançava nos modelos multilingues de conversão de texto em discurso, precisava de dados de formação que capturassem mais do que discurso inteligível. Os modelos exigiam gravações de nível de estúdio com pronúncia, prosódia, emoção e anotação consistentes em vários idiomas.
Ao fazer uma parceria com a Uber AI Solutions (UAIS), a Kyutai estabeleceu um programa completo de dados de discurso que abrange talentos de voz, gravação, transcrição, anotação, metadados e garantia de qualidade. A colaboração criou um fluxo multilíngue repetível, capaz de produzir dados de treino de elevada qualidade e emocionalmente expressivos para sistemas avançados de IA de voz.
Principais resultados
500 horas
Dados de fala com qualidade de estúdio produzidos em cinco línguas
Mais de 95%
Limites de qualidade alcançados nas principais dimensões de garantia de qualidade
25%
Redução da taxa de falhas do TTS em casos complexos
Production-grade voice AI requires more than speech collection
Kyutai was pushing the boundaries of open voice and multimodal AI, including real-time conversational models and advanced speech generation.As the lab moved toward emotionally expressive text-to-speech, available datasets presented a limitation. Basic speech databases could support intelligibility, but they often lacked the emotional nuance, conversational variation, and multilingual consistency needed to produce natural-sounding voices.
Building the datasets introduced significant operational complexity. Speakers needed to maintain consistent identities and recording quality across sessions while delivering varied emotions and speaking styles. Transcripts, emotion labels, non-speech events, pronunciation, and metadata also had to remain accurate across languages and recording batches. To scale, Kyutai needed a governed production process capable of creating expressive multilingual data consistently.
Criação de um pipeline de produção unificado para dados de voz multilingues.
A Kyutai estabeleceu uma parceria com a Uber AI Solutions para operacionalizar a criação de dados de voz como um sistema coordenado, em vez de gerir a gravação, transcrição, anotação e controlo de qualidade de forma independente.
"
A Uber AI Solutions é um dos nossos fornecedores de dados e anotadores mais fiáveis. Adaptam-se rapidamente a novos casos de utilização e especificações, entregam dentro do prazo e com uma qualidade impec ável.
"
Alexandre Défossez
Diretor de Exploração, Kyutai
A UAIS coordenou programas de gravação multilingue em francês, português brasileiro, espanhol europeu e latino-americano e alemão. Os locutores receberam orientações estruturadas concebidas para expandir a gama emocional e prosódica, incluindo estilos de discurso empáticos, sarcásticos, zangados, tristes, chorosos e outros estilos de discurso de elevada intensidade.
O fluxo de trabalho combinou a transcrição assistida por IA com a verificação humana de transcrições literais, etiquetas de emoção, eventos sem fala e outros metadados. Foram aplicados critérios de qualidade padronizados a todos os locutores e lotes de gravação, tornando o controlo de qualidade uma parte contínua da produção e não um ponto de verificação final.
Este modelo operacional ajudou a Kyutai a manter a consistência à medida que o programa se expandia para vários idiomas, locutores e requisitos de voz cada vez mais diferenciados.
Fornecer um conjunto de dados detalhado para TTS multilíngue expressivo
O compromisso produziu uma fonte estruturada de dados de formação multilingues adaptados aos requisitos de TTS expressiva da Kyutai.
Para além do conjunto de dados em si, a colaboração estabeleceu um processo repetível para a gestão de talentos, qualidade de gravação, anotação e critérios de aceitação em todos os programas de idiomas distribuídos. Essa base reduziu a variabilidade antes de os dados entrarem na formação do modelo e deu à Kyutai uma forma mais consistente de gerar futuros conjuntos de dados de discurso à medida que os requisitos evoluíam.
Indicadores-chave de desempenho (KPIs) | Taxa de aceitação | Frequência dos relatórios |
|---|---|---|
Pontuação de qualidade de áudio | 95%+ | Com cada envio em lote |
Consistência de pronúncia e prosódia | 95%+ | Com cada envio em lote |
Precisão da transcrição literal | 95%+ | Com cada envio em lote |
Annotation accuracy (emotion & non speech tags) | 95%+ | Com cada envio em lote |
Ortografia e pontuação | 95%+ | Com cada envio em lote |
Estabelecer a base de dados para a geração de voz expressiva por IA
Com um fluxo de dados de discurso multilíngue escalável implementado, a Kyutai alargou o seu trabalho a mais idiomas, dialetos, estilos emocionais e aplicações avançadas de voz conversacional. Para a Kyutai, a parceria criou a base operacional para gerar os dados de discurso humano expressivos e de elevada qualidade, essenciais para o avanço de sistemas de IA de voz cada vez mais naturais.
Saiba como as Soluções de IA da Uber podem colaborar com a sua empresa para impulsionar a sua IA.
Os testemunhos refletem resultados individuais. Os resultados individuais não garantem o mesmo resultado para cada utilizador e a experiência de cada utilizador pode variar.
Soluções
Indústrias
Recursos
Explorar