Kyutai의 감정 표현이 풍부한 다국어 텍스트 음성 변환(TTS) 확장 여정
Kyutai가 감정 표현이 풍부한 TTS를 위해 실제 서비스에 적용 가능한 다국어 음성 데이터를 어떻게 구축했는지 알아보세요
2026년 9월 1일 | 미국
요약 보고
오픈 사이언스 AI 연구소 Kyutai가 다국어 텍스트-음성 변환 모델을 발전시키면서, 단순히 알아들을 수 있는 음성 이상의 훈련 데이터가 필요했습니다. 이 모델들은 여러 언어에 걸쳐 일관된 발음, 운율, 감정, 그리고 주석이 포함된 스튜디오급 녹음이 요구되었습니다.
Uber AI Solutions(UAIS)와 협력하여 Kyutai는 성우, 녹음, 전사, 주석, 메타데이터, 품질 보증에 이르는 풀스택 음성 데이터 프로그램을 구축했습니다. 이 협업을 통해 고급 음성 AI 시스템을 위한 고품질의 감정 표현이 풍부한 학습 데이터를 반복적으로 생성할 수 있는 다국어 파이프라인이 마련되었습니다.
핵심 결과
500시간
다섯 개 언어로 제작된 스튜디오급 음성 데이터
95%+
주요 QA 항목 전반에 걸쳐 품질 기준을 달성했습니다
25%
복잡한 사례에서 TTS 실패율 감소
Production-grade voice AI requires more than speech collection
Kyutai was pushing the boundaries of open voice and multimodal AI, including real-time conversational models and advanced speech generation.As the lab moved toward emotionally expressive text-to-speech, available datasets presented a limitation. Basic speech databases could support intelligibility, but they often lacked the emotional nuance, conversational variation, and multilingual consistency needed to produce natural-sounding voices.
Building the datasets introduced significant operational complexity. Speakers needed to maintain consistent identities and recording quality across sessions while delivering varied emotions and speaking styles. Transcripts, emotion labels, non-speech events, pronunciation, and metadata also had to remain accurate across languages and recording batches. To scale, Kyutai needed a governed production process capable of creating expressive multilingual data consistently.
다국어 음성 데이터를 위한 통합 제작 파이프라인 구축
Kyutai는 Uber AI Solutions와 협력하여 녹음, 전사, 주석 달기, QA를 각각 따로 관리하는 대신, 음성 데이터 생성을 하나의 통합된 시스템으로 운영했습니다.
“
Uber AI Solutions는 저희가 가장 신뢰하는 데이터 제공자이자 주석 작업자 중 하나입니다. 새로운 사용 사례와 사양에 신속하게 적응하며, 항상 제시간에 흠잡을 데 없는 품질로 결과물을 제공합니 다.
”
Alexandre Défossez
최고 탐험 책임자, Kyutai
UAIS는 프랑스어, 브라질 포르투갈어, 유럽 및 라틴 아메리카 스페인어, 독일어 등 여러 언어에 걸쳐 다국어 녹음 프로그램을 조율했습니다. 성우들은 공감, 냉소, 분노, 슬픔, 울음 등 다양한 고강도 감정 표현을 포함하여 감정 및 운율 범위를 확장할 수 있도록 체계적인 지침을 받았습니다.
이 워크플로우는 AI 지원 전사와 인간 검증을 결합하여, 완전한 전사본, 감정 라벨, 비언어적 이벤트 및 기타 메타데이터를 처리했습니다. 표준화된 품질 기준이 화자와 녹음 배치 전반에 적용되어, QA가 최종 점검이 아닌 생산 과정의 지속적인 일부가 되었습니다.
이 운영 모델은 프로그램이 다양한 언 어, 화자, 그리고 점점 더 세밀해지는 음성 요구 사항으로 확장됨에 따라 Kyutai가 일관성을 유지하는 데 도움이 되었습니다.
표현력 있는 다국어 TTS를 위한 상세 데이터셋 제공
이번 협업을 통해 Kyutai의 표현력 있는 TTS 요구 사항에 맞춘 체계적인 다국어 학습 데이터 소스를 마련할 수 있었습니다.
데이터셋 자체를 넘어서, 이번 협업을 통해 분산된 언어 프로그램 전반에 걸쳐 인재 관리, 품질 기록, 주석 작업, 승인 기준을 체계적으로 관리할 수 있는 반복 가능한 프로세스가 구축되었습니다. 이러한 기반 덕분에 데이터가 모델 학습에 투입되기 전에 변동성이 줄어들었고, 요구 사항이 변화하더라도 Kyutai가 앞으로 음성 데이터셋을 보다 일관되게 생성할 수 있는 방법을 마련할 수 있었습니다.
KPI | 수락률 | 보고 빈도 |
|---|---|---|
오디오 품질 점수 | 95%+ | 각 배치 제출 시 |
발음 및 운율 일관성 | 95%+ | 각 배치 제출 시 |
원문 전사 정확도 | 95%+ | 각 배치 제출 시 |
Annotation accuracy (emotion & non speech tags) | 95%+ | 각 배치 제출 시 |
Spelling & punctuation | 95%+ | 각 배치 제출 시 |
표현력 있는 AI 음성 생성을 위한 데이터 기반 구축
확장 가능한 다국어 음성 데이터 파이프라인을 구축한 Kyutai는 추가 언어, 방언, 감정 스타일, 그리고 고급 대화형 음성 애플리케이션으로 작업 범위를 넓혔습니다. Kyutai에게 이번 파트너십은 점점 더 자연스러운 음성 AI 시스템 발전에 필수적인, 표현력 있고 고품질의 인간 음성 데이터를 생성할 수 있는 운영 기반을 마련해 주었습니다.
Uber AI 솔루션이 귀사의 기업과 협력하여 AI를 발전시킬 수 있는 방법을 알아보세요.
후기는 개인의 결과를 반영합니다. 개인별 결과는 모든 고객에게 동일한 결과를 보장하지 않 으며, 고객 경험은 다를 수 있습니다.