Saltar al contenido principal

El camino de Kyutai para escalar la síntesis de voz multilingüe (TTS) con expresividad emocional

Descubrí cómo Kyutai creó datos de voz multilingües listos para producción para TTS expresivo

September 1, 2026 | Estados Unidos

Texto negro 'kyutai' con una barra diagonal verde sobre un fondo blanco.

Resumen ejecutivo

A medida que el laboratorio de IA de ciencia abierta Kyutai avanzaba en modelos multilingües de texto a voz, necesitaba datos de entrenamiento que capturaran más que un habla inteligible. Los modelos requerían grabaciones de calidad de estudio con pronunciación, prosodia, emoción y anotaciones consistentes en varios idiomas.

Al asociarse con Uber AI Solutions (UAIS), Kyutai estableció un programa integral de datos de voz que abarca talentos de voz, grabación, transcripción, anotación, metadatos y control de calidad. La colaboración creó un flujo de trabajo multilingüe repetible, capaz de generar datos de entrenamiento de alta calidad y con expresividad emocional para sistemas avanzados de IA de voz.

Resultados clave

500 horas

De datos de voz de calidad de estudio producidos en cinco idiomas

95%+

Se alcanzaron los umbrales de calidad en las principales dimensiones de control de calidad

25%

Reducción en la tasa de fallos de TTS en casos complejos

Production-grade voice AI requires more than speech collection


Kyutai was pushing the boundaries of open voice and multimodal AI, including real-time conversational models and advanced speech generation.As the lab moved toward emotionally expressive text-to-speech, available datasets presented a limitation. Basic speech databases could support intelligibility, but they often lacked the emotional nuance, conversational variation, and multilingual consistency needed to produce natural-sounding voices.

Building the datasets introduced significant operational complexity. Speakers needed to maintain consistent identities and recording quality across sessions while delivering varied emotions and speaking styles. Transcripts, emotion labels, non-speech events, pronunciation, and metadata also had to remain accurate across languages and recording batches. To scale, Kyutai needed a governed production process capable of creating expressive multilingual data consistently.

Creando una cadena de producción unificada para datos de voz multilingües


Kyutai se asoció con Uber AI Solutions para operacionalizar la creación de datos de voz como un sistema coordinado, en lugar de gestionar la grabación, transcripción, anotación y control de calidad de forma independiente.

Uber AI Solutions es uno de nuestros proveedores y anotadores de datos más confiables. Se adaptan rápidamente a nuevos casos de uso y especificaciones, entregan a tiempo y con una calidad impecable.


Alexandre Défossez
Director de Exploración, Kyutai

UAIS coordinó programas de grabación multilingües en francés, portugués de Brasil, español de España y de Latinoamérica, y alemán. Los locutores recibieron una guía estructurada diseñada para ampliar el rango emocional y prosódico, incluyendo estilos de habla empáticos, sarcásticos, enojados, tristes, llorosos y otros de alta intensidad.

El flujo de trabajo combinó la transcripción asistida por IA con la verificación humana para obtener transcripciones literales, etiquetas de emociones, eventos no verbales y otros metadatos. Se aplicaron criterios de calidad estandarizados en todos los hablantes y lotes de grabación, haciendo que el control de calidad fuera una parte continua de la producción en lugar de un control final.

Este modelo operativo ayudó a Kyutai a mantener la coherencia a medida que el programa se expandía a través de diferentes idiomas, hablantes y requisitos de voz cada vez más específicos.

Entregando un conjunto de datos detallado para TTS multilingüe expresivo


La colaboración produjo una fuente estructurada de datos de entrenamiento multilingües adaptada a los requisitos expresivos de TTS de Kyutai.

Más allá del propio conjunto de datos, la colaboración estableció un proceso repetible para gestionar el talento, registrar la calidad, la anotación y los criterios de aceptación en programas de idiomas distribuidos. Esa base redujo la variabilidad antes de que los datos ingresaran al entrenamiento del modelo y le dio a Kyutai una forma más consistente de generar futuros conjuntos de datos de voz a medida que evolucionaban los requisitos.

Indicadores clave de rendimiento (KPI)

Tasa de aceptación

Frecuencia de informes

Puntaje de calidad de audio

95%+

Con cada envío grupal

Consistencia en la pronunciación y la prosodia

95%+

Con cada envío grupal

Precisión de la transcripción literal

95%+

Con cada envío grupal

Precisión de la anotación (emociones y etiquetas de no habla)

95%+

Con cada envío grupal

Ortografía y puntuación

95%+

Con cada envío grupal

Estableciendo la base de datos para la generación de voz de IA expresiva


Con una canalización escalable de datos de voz multilingüe implementada, Kyutai amplió su trabajo a más idiomas, dialectos, estilos emocionales y aplicaciones avanzadas de voz conversacional. Para Kyutai, la asociación creó la base operativa para generar los datos de voz humana expresivos y de alta calidad esenciales para el avance de sistemas de IA de voz cada vez más naturales.

Descubrí cómo las Soluciones de IA de Uber pueden asociarse con tu empresa para impulsar tu inteligencia artificial.

Los testimonios reflejan resultados individuales. Los resultados individuales no garantizan el resultado para cada cliente, y la experiencia de cada cliente puede variar.