Passer au contenu principal

Le parcours de Kyutai pour l'augmentation des capacités de la synthèse vocale multilingue émotionnellement expressive

Découvrez comment Kyutai a créé des données vocales multilingues prêtes à la production pour la synthèse vocale expressive

1er septembre 2026 | États-Unis

Le texte « kyutai » en noir avec une barre oblique verte sur un fond blanc.

Executive Summary

Alors que le laboratoire d'IA en science ouverte Kyutai faisait progresser les modèles multilingues de synthèse vocale, il avait besoin de données d'entraînement qui captaient plus que la parole intelligible. Les modèles nécessitaient des enregistrements de qualité studio avec une prononciation, une prosodie, une émotion et une annotation cohérentes dans plusieurs langues.

En s'associant à Uber AI Solutions (UAIS), Kyutai a mis en place un programme complet de données vocales couvrant les acteurs vocaux, l'enregistrement, la transcription, l'annotation, les métadonnées et l'assurance qualité. La collaboration a créé un pipeline multilingue reproductible capable de produire des données d'entraînement de haute qualité et émotionnellement expressives pour les systèmes d'IA vocale sophistiqués.

Résultats clés

500 heures

De données vocales de qualité studio produites dans cinq langues

Plus de 95 %

Seuils de qualité atteints dans toutes les dimensions clés de l'assurance qualité

25%

Réduction du taux d'échec de la synthèse vocale sur les cas complexes

Production-grade voice AI requires more than speech collection


Kyutai was pushing the boundaries of open voice and multimodal AI, including real-time conversational models and advanced speech generation.As the lab moved toward emotionally expressive text-to-speech, available datasets presented a limitation. Basic speech databases could support intelligibility, but they often lacked the emotional nuance, conversational variation, and multilingual consistency needed to produce natural-sounding voices.

Building the datasets introduced significant operational complexity. Speakers needed to maintain consistent identities and recording quality across sessions while delivering varied emotions and speaking styles. Transcripts, emotion labels, non-speech events, pronunciation, and metadata also had to remain accurate across languages and recording batches. To scale, Kyutai needed a governed production process capable of creating expressive multilingual data consistently.

Création d'un pipeline de production unifié pour les données vocales multilingues


Kyutai s'est associée à Uber AI Solutions pour opérationnaliser la création de données vocales en un seul système coordonné plutôt que de gérer séparément l'enregistrement, la transcription, l'annotation et l'assurance qualité.

« 

Uber AI Solutions compte parmi nos fournisseurs de données et d'annotation de données les plus fiables. Elle s'adapte rapidement aux nouveaux cas d'utilisation et aux nouvelles spécifications, livre dans les délais et avec une qualité irréprochable.

 »


Alexandre Défossez
Directeur de l'exploration, Kyutai

UAIS a coordonné des programmes d'enregistrement multilingues en français, portugais brésilien, espagnol européen, espagnol américain et allemand. Les acteurs vocaux ont reçu des conseils structurés conçus pour élargir la gamme émotionnelle et prosodique, notamment les styles de parole empathique, sarcastique, en colère, triste, en pleurs et d'autres styles de parole émotionnels.

Le flux de travail combinait la transcription assistée par l'IA et la vérification humaine pour les transcriptions textuelles, les étiquettes d'émotion, les événements non vocaux et d'autres métadonnées. Des critères de qualité standardisés ont été appliqués à tous les locuteurs et à tous les lots d'enregistrement, faisant de l'assurance qualité une partie continue de la production plutôt qu'une simple vérification en fin de course.

Ce modèle opérationnel a aidé Kyutai à maintenir la cohérence alors que le programme s'étendait à d'autres langues, à d'autres locuteurs et à des exigences vocales de plus en plus nuancées.

Fournir un ensemble de données détaillé pour la synthèse vocale multilingue expressive


La mission a produit une source structurée de données d'entraînement multilingues adaptées aux exigences de Kyutai en matière de synthèse vocale expressive.

Au-delà de l'ensemble de données lui-même, la collaboration a permis de mettre en place un processus reproductible pour la gestion des talents, la qualité de l'enregistrement, l'annotation et les critères d'acceptation dans l'ensemble des programmes linguistiques distribués. Cette base a réduit la variabilité avant que les données n'entrent dans l'entraînement du modèle et a donné à Kyutai un moyen plus cohérent de générer de futurs ensembles de données vocales à mesure que les exigences évoluaient.

Indicateurs clés de performance

Taux d'acceptation

Fréquence des rapports

note de qualité audio

Plus de 95 %

À chaque envoi de lot

Cohérence de la prononciation & de la prosodie

Plus de 95 %

À chaque envoi de lot

Précision de la transcription verbatim

Plus de 95 %

À chaque envoi de lot

Précision des annotations (étiquettes émotionnelles et non vocales)

Plus de 95 %

À chaque envoi de lot

Orthographe et ponctuation

Plus de 95 %

À chaque envoi de lot

Établir la base de données pour la génération de voix expressive par IA


Après avoir mis en place un pipeline évolutif de données vocales multilingue, Kyutai a étendu son travail à d'autres langues, dialectes, styles émotionnels et applications vocales conversationnelles sophistiquées. Pour Kyutai, le partenariat a créé la base opérationnelle pour générer les données de parole humaine expressives et de haute qualité essentielles à l'avancement de systèmes d'IA vocale de plus en plus naturels.

Découvrez comment Uber AI Solutions peut s'associer à votre entreprise pour faire progresser votre IA.

Les témoignages sont le reflet de résultats individuels. Les résultats individuels ne constituent pas une garantie de résultat pour un client donné, et l'expérience client peut varier d'un commerçant à l'autre.