Kyutai 实现情感丰富多语言文本转语音(TTS)规模化的路径
了解 Kyutai 如何构建可用于生产的多语言语音数据,以实现富 有表现力的语音合成
2026年9月1日 | 美国
执行摘要
作为开放科学 AI 实验室 Kyutai 推进多语言文本转语音模型时,需要的不仅仅是清晰可懂的语音训练数据。这些模型还要求具备一致发音、语调、情感和多语言注释的录音室级别音频数据。
通过与优步 AI 解决方案(UAIS)合作,Kyutai 建立了一个涵盖配音人才、录音、转写、标注、元数据和质量保障的 全流程语音数据项目。此次合作打造了可复用的多语言流程,能够为先进语音 AI 系统生成高质量、富有情感表达的训练数据。
关键结果
500 小时
涵盖五种语言的专业级语音数据
95%+
在主要质量保证维度上已达到质量标准
25%
复杂案例中TTS失败率的降低
Production-grade voice AI requires more than speech collection
Kyutai was pushing the boundaries of open voice and multimodal AI, including real-time conversational models and advanced speech generation.As the lab moved toward emotionally expressive text-to-speech, available datasets presented a limitation. Basic speech databases could support intelligibility, but they often lacked the emotional nuance, conversational variation, and multilingual consistency needed to produce natural-sounding voices.
Building the datasets introduced significant operational complexity. Speakers needed to maintain consistent identities and recording quality across sessions while delivering varied emotions and speaking styles. Transcripts, emotion labels, non-speech events, pronunciation, and metadata also had to remain accurate across languages and recording batches. To scale, Kyutai needed a governed production process capable of creating expressive multilingual data consistently.
为多语言语音数据创建统一的生产流程
Kyutai 与优步 AI 解决方案合作,将语音数据的创建流程整合为一个协同系统,而不是分别独立管理录音、转写、标注和质检。
“
Uber AI 解决方案是我们最值得信赖的数据提供方和标注团队之一。他们能够迅速适应新的使用场景和规范,按时交付,并且质量始终如一。
”
Alexandre Défossez
首席探索官,Kyutai
UAIS 协调了涵盖法语、巴西葡萄牙语、欧洲和拉丁美洲西班牙语以及德语的多语言录音项目。配音演员获得了系统化的指导,旨在拓展情感和语调的表现力,包括富有同理心、讽刺、愤怒、悲伤、哭泣等高强度的说话风格。
该流程将 AI 辅助转录与人工校对相结合,用于生成逐字稿、情感标签、非语音事件及其他元数据。在所有说话人和录音批次中均采用统一的质量标准,使质检成为生产过程中的持续环节,而非最终检查点。
这种运营模式帮助 Kyutai 在项目扩展到更多语言、说话者以及日益复杂的语音需求时,始终保持了一致性。
为多语言表达型语音合成提供详尽数据集
此次合作为 Kyutai 的高表现力语音合成需求量身打造了一套结构化的多语言学习数据源。
除了数据集本身之外,此次协作还建立了一套可复用的流程,用于管理人才、记录质量、标注和验收标准,覆盖分布式语言项目。这样的基础在数据进入模型训练前就降低了差异性,并为 Kyutai 在需求变化时,持续高效地生成后续语音数据集提供了更一致的方法。
关键绩效指标 | 接单确认率 | 报告频率 |
|---|---|---|
音频质量评分 | 95%+ | 每次批量提交 |
发音和语调一致性 | 95%+ | 每次批量提交 |
Verbatim transcription accuracy | 95%+ | 每次批量提交 |
Annotation accuracy (emotion & non speech tags) | 95%+ | 每次批量提交 |
Spelling & punctuation | 95%+ | 每次批量提交 |
为表达型 AI 语音生成建立数据基础
在建立了可扩展的多语言语音数据流程后,Kyutai 将其工作拓展到更多语言、方言、情感风格以及先进的对话语音应用。对于 Kyutai 来说,这一合作为生成富有表现力、高质量的人类语音数据奠定了运营基础,这对于推动更加自然的语音 AI 系统发展至关重要。
了解 Uber AI 解决方案如何与您的企业合作,共同推动您的人工智能发展。
用户评价仅代表个人体验。每位用户的体验可能不同,实际效果因人而异,无法作为结果的承诺。