Saltar al contenido principal

El camino de Kyutai hacia la ampliación de la síntesis de voz (TTS) multilingüe con expresividad emocional

Conoce cómo Kyutai desarrolló datos de voz multilingües listos para producción para la síntesis de voz (TTS) expresiva

1 de septiembre de 2026 | Estados Unidos

Texto negro 'kyutai' con una barra diagonal verde sobre un fondo blanco.

Resumen ejecutivo

Como laboratorio de IA de código abierto, Kyutai avanzaba en el desarrollo de modelos multilingües de texto a voz y necesitaba datos de entrenamiento que capturaran mucho más que un habla comprensible. Los modelos requerían grabaciones de calidad profesional con pronunciación, prosodia, emoción y anotaciones coherentes en varios idiomas.

Al asociarse con Uber AI Solutions (UAIS), Kyutai estableció un programa integral de datos de voz que abarcaba los intérpretes de voz, la grabación, la transcripción, la anotación, los metadatos y el control de calidad. La colaboración creó un proceso multilingüe reproducible capaz de generar datos de entrenamiento de alta calidad y con una expresividad emocional adecuada para sistemas avanzados de IA de voz.

Resultados principales

500 horas

Datos de voz de calidad de estudio producidos en cinco idiomas

Más del 95%

Umbrales de calidad alcanzados en las principales dimensiones del control de calidad

25%

Reducción en la tasa de fallos de TTS en casos complejos

Production-grade voice AI requires more than speech collection


Kyutai was pushing the boundaries of open voice and multimodal AI, including real-time conversational models and advanced speech generation.As the lab moved toward emotionally expressive text-to-speech, available datasets presented a limitation. Basic speech databases could support intelligibility, but they often lacked the emotional nuance, conversational variation, and multilingual consistency needed to produce natural-sounding voices.

Building the datasets introduced significant operational complexity. Speakers needed to maintain consistent identities and recording quality across sessions while delivering varied emotions and speaking styles. Transcripts, emotion labels, non-speech events, pronunciation, and metadata also had to remain accurate across languages and recording batches. To scale, Kyutai needed a governed production process capable of creating expressive multilingual data consistently.

Creación de proceso de producción unificado para datos de voz multilingües


Kyutai se asoció con Uber AI Solutions para gestionar la creación de datos de voz como un único sistema coordinado, en lugar de administrar la grabación, la transcripción, la anotación y el control de calidad de forma independiente.

Uber AI Solutions es uno de nuestros proveedores de datos y anotadores más fiables. Se adapta rápidamente a nuevos casos de uso y especificaciones, cumple con los plazos de entrega y ofrece una calidad impecable.


Alexandre Défossez
Jefe de Exploración, Kyutai

UAIS coordinó programas de grabación multilingües en francés, portugués brasileño, español europeo y latinoamericano, y alemán. Los intérpretes de voz recibieron indicaciones estructuradas diseñadas para ampliar su rango emocional y prosódico, incluidos estilos de habla empáticos, sarcásticos, enojados, tristes, con llanto y otros de alta intensidad.

El proceso combinó la transcripción asistida por IA con la verificación humana de las transcripciones literales, las etiquetas de emociones, los eventos no verbales y otros metadatos. Se aplicaron criterios de calidad estandarizados a todos los hablantes y lotes de grabación, de modo que el control de calidad fuera una parte continua de la producción y no una revisión final.

Este modelo operativo ayudó a Kyutai a mantener la coherencia a medida que el programa se expandió a más idiomas y hablantes, y a requisitos de voz cada vez más específicos.

Proporcionar un conjunto de datos detallado para la síntesis de voz multilingüe expresiva


Este proyecto generó una fuente estructurada de datos de preparación multilingües, adaptada a los requisitos expresivos de síntesis de voz de Kyutai.

Más allá del conjunto de datos en sí, la colaboración estableció un proceso reproducible para gestionar el talento, la calidad de las grabaciones, la anotación y los criterios de aceptación en programas lingüísticos distribuidos. Esa base redujo la variabilidad antes de que los datos ingresaran al entrenamiento de los modelos y permitió a Kyutai contar con una forma más consistente de generar futuros conjuntos de datos de voz a medida que evolucionaban los requisitos.

Indicadores clave de rendimiento (KPI)

Tasa de aceptación

Frecuencia de informes

Calificación de calidad de audio

95%+

Con cada envío de lote

Consistencia en la pronunciación y la prosodia

95%+

Con cada envío de lote

Precisión en la transcripción literal

95%+

Con cada envío de lote

Precisión de la anotación (emociones y etiquetas de no habla)

95%+

Con cada envío de lote

Ortografía y puntuación

95%+

Con cada envío de lote

Establecer la base de datos para la generación de voz expresiva mediante IA


Gracias a una plataforma escalable de datos de voz multilingüe, Kyutai amplió su actividad a otros idiomas, dialectos, estilos emocionales y aplicaciones avanzadas de voz conversacional. Para Kyutai, esta colaboración sentó las bases operativas para generar datos de voz humana expresivos y de alta calidad, esenciales para el desarrollo de sistemas de IA de voz cada vez más naturales.

Descubre cómo Uber AI Solutions puede asociarse con tu empresa para impulsar tu inteligencia artificial.

Los testimonios reflejan resultados individuales. Los resultados individuales no aseguran el mismo resultado para ningún usuario en particular, y la experiencia de cada usuario puede variar.