跳到主要內容

Kyutai 擴展多語言情感語音合成(TTS)的發展之路

了解 Kyutai 如何打造可用於生產環境的多語音表達語音資料,用於高表現力語音合成(TTS)

2026 年 9 月 1 日|美國

白色背景上,黑色文字「kyutai」旁邊有一個綠色正斜線。

Executive Summary

隨著開放科學 AI 實驗室 Kyutai 開發多語言的文字轉語音模型,他們需要的訓練資料不僅僅是可理解的語音。這些模型需要錄音室等級的錄製內容,且在多種語言中保持一致的發音、韻律、情緒和註解。

透過與 Uber 人工智慧團隊解決方案 (UAIS) 合作,Kyutai 建立了一個全端語音資料計畫,涵蓋語音人才、錄音、轉錄、註解、中繼資料和品質保證。這種合作關係建立了可重複的多語言管道,能夠為先進的 AI 語音系統,生成高品質、富有情感表現力的訓練資料。

主要成果

500 小時

以五種語言產生的錄音室等級語音資料

95% 以上

在主要品質保證指標上已達到品質門檻

25%

降低複雜案例的 TTS 失敗率

Production-grade voice AI requires more than speech collection


Kyutai was pushing the boundaries of open voice and multimodal AI, including real-time conversational models and advanced speech generation.As the lab moved toward emotionally expressive text-to-speech, available datasets presented a limitation. Basic speech databases could support intelligibility, but they often lacked the emotional nuance, conversational variation, and multilingual consistency needed to produce natural-sounding voices.

Building the datasets introduced significant operational complexity. Speakers needed to maintain consistent identities and recording quality across sessions while delivering varied emotions and speaking styles. Transcripts, emotion labels, non-speech events, pronunciation, and metadata also had to remain accurate across languages and recording batches. To scale, Kyutai needed a governed production process capable of creating expressive multilingual data consistently.

建立多語言語音資料的統一製作流程


Kyutai 與 Uber AI Solutions 合作,將語音資料建立流程整合為一套協同作業系統,而非分別獨立管理錄音、轉錄、標註及品質檢查等作業。

Uber 人工智慧團隊解決方案是我們最可靠的資料提供者和註解者之一。他們能迅速適應新的使用案例和規格、準時交付,且品質完美無缺。


Alexandre Défossez
Kyutai 探索長

UAIS 協調了多語言錄音計畫,涵蓋法語、巴西葡萄牙語、歐洲和拉丁美洲西班牙語,以及德語。語音配音員接受了結構化指導,旨在擴大情緒和韻律範圍,包括同理心、諷刺、憤怒、悲傷、哭泣和其他高強度的語音風格。

工作流程結合 AI 輔助轉錄與人工驗證,以獲得逐字逐句的文字紀錄、情緒標籤、非語音事件和其他中繼資料。所有講者和錄製批次都採用標準化品質條件,使品質保證成為生產過程中的持續環節,而非最終檢查點。

隨著計畫擴展到不同語言和講者,以及日益細微的語音要求,這種運作模式有助於 Kyutai 維持一致性。

提供詳細的資料集,用於富有表現力的多語言 TTS


此次合作產生了一個結構化的多語言訓練資料來源,專為 Kyutai 富有表現力的 TTS 要求量身打造。

除了資料集本身,此次合作還建立了一個可重複的流程,用於管理人才、錄音品質、註解和分散式語言計畫的驗收標準。在資料進入模型訓練之前,這個基礎降低了變異性,並為 Kyutai 提供了一個更一致的方式,以便在未來需求變動時生成語音資料集。

KPI

接受率

報告頻率

音訊品質分數

95%+

每次批次提交時

發音與語調一致性

95%+

每次批次提交時

逐字轉錄準確度

95%+

每次批次提交時

Annotation accuracy (emotion & non speech tags)

95%+

每次批次提交時

拼字與標點符號

95%+

每次批次提交時

為富有表現力的 AI 語音生成奠定資料基礎


建立可擴展的多語言語音資料管道後,Kyutai 將其工作擴展至更多語言、方言、情感風格和進階對話語音應用程式。對 Kyutai 來說,這種合作關係奠定了營運基礎,可生成富有表現力的高品質人類語音資料,這對於推進越趨自然的 AI 語音系統來說至關重要。

瞭解 Uber AI 解決方案如何與貴企業合作,攜手推動 AI 發展。

客戶推薦內容反映個別成效。個別成效無法保證任何特定客戶皆能達到相同結果,實際體驗可能因客戶而異。