Le parcours de Kyutai pour l'augmentation des capacités de la synthèse vocale multilingue émotionnellement expressive
Découvrez comment Kyutai a créé des données vocales multilingues prêtes à la production pour la synthèse vocale expressive
1er septembre 2026 | États-Unis
Executive Summary
Alors que le laboratoire d'IA en science ouverte Kyutai faisait progresser les modèles multilingues de synthèse vocale, il avait besoin de données d'entraînement qui captaient plus que la parole intelligible. Les modèles nécessitaient des enregistrements de qualité studio avec une prononciation, une prosodie, une émotion et une annotation cohérentes dans plusieurs langues.
En s'associant à Uber AI Solutions (UAIS), Kyutai a mis en place un programme complet de données vocales couvrant les acteurs vocaux, l'enregistrement, la transcription, l'annotation, les métadonnées et l'assurance qualité. La collaboration a créé un pipeline multilingue reproductible capable de produire des données d'entraînement de haute qualité et émotionnellement expressives pour les systèmes d'IA vocale sophistiqués.
Résultats clés
500 heures
De données vocales de qualité studio produites dans cinq langues
Plus de 95 %
Seuils de qualité atteints dans toutes les dimensions clés de l'assurance qualité
25%
Réduction du taux d'échec de la synthèse vocale sur les cas complexes
Production-grade voice AI requires more than speech collection
Kyutai was pushing the boundaries of open voice and multimodal AI, including real-time conversational models and advanced speech generation.As the lab moved toward emotionally expressive text-to-speech, available datasets presented a limitation. Basic speech databases could support intelligibility, but they often lacked the emotional nuance, conversational variation, and multilingual consistency needed to produce natural-sounding voices.
Building the datasets introduced significant operational complexity. Speakers needed to maintain consistent identities and recording quality across sessions while delivering varied emotions and speaking styles. Transcripts, emotion labels, non-speech events, pronunciation, and metadata also had to remain accurate across languages and recording batches. To scale, Kyutai needed a governed production process capable of creating expressive multilingual data consistently.
Création d'un pipeline de production unifié pour les données vocales multilingues
Kyutai s'est associée à Uber AI Solutions pour opérationnaliser la création de données vocales en un seul système coordonné plutôt que de gérer séparément l'enregistrement, la transcription, l'annotation et l'assurance qualité.
«
Uber AI Solutions compte parmi nos fournisseurs de données et d'annotation de données les plus fiables. Elle s'adapte rapidement aux nouveaux cas d'utilisation et aux nouvelles spécifications, livre dans les délais et avec une qualité irréprochable.
»
Alexandre Défossez
Directeur de l'exploration, Kyutai
UAIS a coordonné des programmes d'enregistrement multilingues en français, portugais brésilien, espagnol européen, espagnol américain et allemand. Les acteurs vocaux ont reçu des conseils structurés conçus pour élargir la gamme émotionnelle et prosodique, notamment les styles de parole empathique, sarcastique, en colère, triste, en pleurs et d'autres styles de parole émotionnels.
Le flux de travail combinait la transcription assistée par l'IA et la vérification humaine pour les transcriptions textuelles, les étiquettes d'émotion, les événements non vocaux et d'autres métadonnées. Des critères de qualité standardisés ont été appliqués à tous les locuteurs et à tous les lots d'enregistrement, faisant de l'assurance qualité une partie continue de la production plutôt qu'une simple vérification en fin de course.
Ce modèle opérationnel a aidé Kyutai à maintenir la cohérence alors que le programme s'étendait à d'autres langues, à d'autres locuteurs et à des exigences vocales de plus en plus nuancées.
Fournir un ensemble de données détaillé pour la synthèse vocale multilingue expressive
La mission a produit une source structurée de données d'entraînement multilingues adaptées aux exigences de Kyutai en matière de synthèse vocale expressive.
Au-delà de l'ensemble de données lui-même, la collaboration a permis de mettre en place un processus reproductible pour la gestion des talents, la qualité de l'enregistrement, l'annotation et les critères d'acceptation dans l'ensemble des programmes linguistiques distribués. Cette base a réduit la variabilité avant que les données n'entrent dans l'entraînement du modèle et a donné à Kyutai un moyen plus cohérent de générer de futurs ensembles de données vocales à mesure que les exigences évoluaient.
Indicateurs clés de performance | Taux d'acceptation | Fréquence des rapports |
|---|---|---|
note de qualité audio | Plus de 95 % | À chaque envoi de lot |
Cohérence de la prononciation & de la prosodie | Plus de 95 % | À chaque envoi de lot |
Précision de la transcription verbatim | Plus de 95 % | À chaque envoi de lot |
Précision des annotations (étiquettes émotionnelles et non vocales) | Plus de 95 % | À chaque envoi de lot |
Orthographe et ponctuation | Plus de 95 % | À chaque envoi de lot |
Établir la base de données pour la génération de voix expressive par IA
Après avoir mis en place un pipeline évolutif de données vocales multilingue, Kyutai a étendu son travail à d'autres langues, dialectes, styles émotionnels et applications vocales conversationnelles sophistiquées. Pour Kyutai, le partenariat a créé la base opérationnelle pour générer les données de parole humaine expressives et de haute qualité essentielles à l'avancement de systèmes d'IA vocale de plus en plus naturels.
Découvrez comment Uber AI Solutions peut s'associer à votre entreprise pour faire progresser votre IA.
Les témoignages sont le reflet de résultats individuels. Les résultats individuels ne constituent pas une garantie de résultat pour un client donné, et l'expérience client peut varier d'un commerçant à l'autre.
Solutions
Secteurs d'activité
Ressources
Explore