L'approche de Kyutai pour mettre à l'échelle une synthèse vocale multilingue capable d'exprimer des émotions (TTS)
Découvrez comment Kyutai a constitué un corpus vocal multilingue prêt pour la production en vue d'une synthèse vocale expressive
septembre 1, 2026 | États-Unis
Sommaire exécutif
À mesure que le laboratoire d’IA en science ouverte Kyutai perfectionnait des modèles de synthèse vocale multilingues, il avait besoin de données d’entraînement qui allaient au-delà d’une simple parole intelligible. Ces modèles nécessitaient des enregistrements de qualité studio, avec une prononciation, une prosodie, une émotion et une annotation cohérentes dans plusieurs langues.
En collaboration avec Uber AI Solutions (UAIS), Kyutai a mis en place un programme de données vocales de bout en bout couvrant les talents vocaux, l’enregistrement, la transcription, l’annotation, les métadonnées et l’assurance de la qualité. La collaboration a créé un pipeline multilingue reproductible, capable de produire des données d’entraînement de haute qualité, expressives sur le plan émotionnel, pour des systèmes d’IA vocale avancés.
Résultats clés
500 heures
Des données vocales de calibre studio produites dans cinq langues
95%+
Seuil de qualité atteint dans les dimensions clés de l'assurance qualité
25%
Diminution du taux d’échec de TTS sur les cas complexes
Une IA vocale prête pour la production nécessite plus que la simple collecte de données vocales.
Kyutai repoussait les limites des technologies vocales ouvertes et de l’IA multimodale, notamment les modèles conversationnels en temps réel et la génération vocale avancée.Alors que le laboratoire s’orientait vers une synthèse vocale capable d’exprimer des émotions, les jeux de données disponibles représentaient une contrainte. Les bases de données vocales élémentaires pouvaient assurer l’intelligibilité, mais elles manquaient souvent de nuances émotionnelles, de variation conversationnelle et de cohérence multilingue nécessaires pour produire des voix au rendu naturel.
La création des ensembles de données a introduit une importante complexité opérationnelle. Les locuteurs devaient maintenir des identités cohérentes et une qualité d’enregistrement uniforme d’une séance à l’autre, tout en exprimant des émotions et des styles de parole variés. Les transcriptions, les étiquettes d’émotions, les événements non verbaux, la prononciation et les métadonnées devaient aussi rester précis d’une langue à l’autre et d’un lot d’enregistrements à l’autre. Pour passer à l’échelle, Kyutai avait besoin d’un processus de production encadré, capable de produire de manière constante des données multilingues expressives.
Création d’un pipeline de production unifié pour des données vocales multilingues
Kyutai a collaboré avec Uber AI Solutions pour mettre en place un système coordonné unique de création de données vocales, plutôt que de gérer séparément l’enregistrement, la transcription, l’annotation et l’assurance qualité.
“
Uber AI Solutions est l’un de nos fournisseurs de données et annotateurs les plus fiables. Ils s’adaptent rapidement aux nouveaux cas d’utilisation et aux spécifications, livrent dans les délais et fournissent des résultats impeccables.
”
Alexandre Défossez
Chef de l'exploration, Kyutai
UAIS a coordonné des programmes d’enregistrement multilingues en français, en portugais brésilien, en espagnol européen et latino-américain, ainsi qu’en allemand. Les talents vocaux ont reçu des directives structurées visant à élargir leur palette émotionnelle et prosodique, notamment des styles de parole empathique, sarcastique, en colère, triste, en pleurs et d’autres styles à haute intensité.
Le flux de travail alliait transcription assistée par IA et vérification humaine pour les transcriptions mot à mot, les étiquettes d’émotion, les événements non parlés et d’autres métadonnées. Des critères de qualité normalisés ont été appliqués pour l’ensemble des locuteurs et des lots d’enregistrements, faisant de l’assurance qualité une composante continue de la production plutôt qu’un point de contrôle final.
Ce modèle opérationnel a permis à Kyutai de maintenir la cohérence à mesure que le programme s'étendait à un nombre croissant de langues et de locuteurs, ainsi qu'à des exigences vocales de plus en plus nuancées.
Mise à disposition d’un jeu de données détaillé pour la synthèse vocale multilingue expressive
Ce mandat a produit une source structurée de données d'entraînement multilingues adaptées aux exigences de TTS expressif de Kyutai.
Au-delà du jeu de données lui-même, la collaboration a établi un processus reproductible pour la gestion des talents, la qualité des enregistrements, l’annotation et les critères d’acceptation dans des programmes linguistiques répartis. Cette base a réduit la variabilité avant que les données ne soient utilisées pour l’entraînement des modèles et a donné à Kyutai une façon plus cohérente de générer de futurs ensembles de données vocales à mesure que les exigences évoluaient.
Indicateurs clés de performance (KPI) | Taux d’acceptation | Fréquence des rapports |
|---|---|---|
Indice de qualité audio | 95%+ | À chaque soumission par lot |
Cohérence de la prononciation et de la prosodie | 95%+ | À chaque soumission par lot |
Exactitude de la transcription mot à mot | 95%+ | À chaque soumission par lot |
Exactitude des annotations (émotions & balises de non-parole) | 95%+ | À chaque soumission par lot |
Orthographe & ponctuation | 95%+ | À chaque soumission par lot |
Mise en place de l’infrastructure de données pour la synthèse vocale expressive par IA
Avec un pipeline de données vocales multilingues évolutif en place, Kyutai a étendu ses travaux à d'autres langues, dialectes, styles émotionnels et à des applications vocales conversationnelles avancées. Pour Kyutai, la collaboration a établi les bases opérationnelles permettant de générer des données vocales humaines expressives et de haut niveau, indispensables pour faire progresser des systèmes d'IA vocale de plus en plus naturels.
Découvrez comment Uber AI Solutions peut collaborer avec votre entreprise pour faire progresser votre IA.
Les témoignages reflètent des résultats individuels. Ces résultats n’assurent pas une issue particulière pour un utilisateur donné, et l’expérience des utilisateurs peut varier.
Solutions
Secteurs d’activité
Ressources
Explorer