Путь Kyutai к масштабированию многозвучного синтеза речи (TTS) с эмоциональной выразительностью
Узнайте, как Kyutai создала многоязычные голосовые данные, готовые к использованию в выразительном синтезе речи
1 сентября 2026 г. | Соединённые Штаты
Краткое содержание
Когда лаборатория искусственного интеллекта Kyutai, работающая в области открытой науки, совершенствовала многоязычные модели преобразования текста в речь, ей понадобились обучающие данные, отражающие не только разборчивую речь. Для моделей требовались студийные записи с единообразным произношением, интонацией, эмоциональной окраской и аннотацией на разных языках.
Сотрудничая с Uber AI Solutions (UAIS), Kyutai создала комплексную программу работы с речевыми данными, охватывающую подбор дикторов, запись, транскрипцию, аннотирование, работу с метаданными и контроль качества. В результате сотрудничества была разработана масштабируемая многоязычная система, позволяющая получать высококачественные, эмоционально выразительные обучающие данные для современных голосовых ИИ-систем.
Ключевые результаты
500 часов
студийные аудиозаписи речи, созданные на пяти языках
95%+
Достигнуты целевые показатели качества по основным направлениям контроля
25%
Снижение частоты сбоев TTS в сложных случаях
Для создания голосового ИИ промышленного уровня требуется не только сбор речевых данных
Kyutai расширял границы открытых голосовых и мультимодальных ИИ, включая модели для общения в реальном времени и продвинутую генерацию речи. По мере того как лаборатория переходила к созданию эмоционально выразительного синтеза речи, доступные наборы данных становились ограничивающим фактором. Базовые базы данных речи обеспечивали разборчивость, но часто не хватало эмоциональных оттенков, разнообразия в диалогах и многоязыковой согласованности, необходимых для создания естественно звучащих голосов.
Создание этих наборов данных привело к значительным операционным сложностям. Спикерам необходимо было сохранять постоянство идентичности и качества записи на протяжении всех сессий, при этом демонстрируя разнообразные эмоции и стили речи. Транскрипты, метки эмоций, несвязанные с речью события, произношение и метаданные также должны были оставаться точными во всех языках и партиях записей. Для масштабирования Kyutai потребовался управляемый производственный процесс, способный стабильно создавать выразительные многоязычные данные.
Создание единого производственного процесса для многоязычных голосовых данных
Kyutai объединила усилия с Uber AI Solutions, чтобы организовать создание голосовых данных как единую скоординированную систему вместо раздельного управления записью, расшифровкой, аннотированием и контролем качества.
“
Uber AI Solutions — один из самых надежных наших поставщиков данных и аннотаторов. Они быстро адаптируются к новым сценариям использования и требованиям, выполняют задачи в срок и обеспечивают безупречное качество.
”
Александр Дефоссэ
Директор по исследованиям, Kyutai
UAIS координировала многоязычные программы записи на французском, бразильском португальском, европейском и латиноамериканском испанском, а также немецком языках. Актёры озвучивания получали структурированные рекомендации, направленные на расширение эмоционального и просодического диапазона, включая эмпатичные, саркастические, сердитые, грустные, плачущие и другие высокоинтенсивные стили речи.
Рабочий процесс сочетал автоматическую транскрипцию с помощью ИИ и проверку человеком для получения дословных транскриптов, маркировки эмоций, несвязанных с речью событий и другой метаинформации. Единые критерии качества применялись ко всем дикторам и партиям записей, что делало контроль качества постоянной частью производства, а не финальным этапом.
Эта модель работы помогла Kyutai сохранять последовательность по мере расширения программы на новые языки, спикеров и всё более сложные требования к голосу.
Предоставление детализированного набора данных для выразительного многоязычного синтеза речи
В результате сотрудничества был создан структурированный источник многоязычных обучающих данных, адаптированных под требования Kyutai к выразительному синтезу речи.
Помимо самого набора данных, сотрудничество позволило создать воспроизводимый процесс управления специалистами, контроля качества, аннотирования и определения критериев приемки в распределённых языковых программах. Эта основа снизила вариативность до поступления данных на этап обучения модели и обеспечила Kyutai более стабильный способ формирования будущих наборов данных для распознавания речи по мере изменения требований.
Ключевые показатели эффективности (KPI) | Коэффициент принятия | Частота отчетности |
|---|---|---|
Оценка качества звука | 95%+ | С каждой отправкой партии |
Согласованность произношения и просодии | 95%+ | С каждой отправкой партии |
Точность дословной расшифровки | 95%+ | С каждой отправкой партии |
Точность аннотирования (эмоции и теги несвязанные с речью) | 95%+ | С каждой отправкой партии |
Орфография и пунктуация | 95%+ | С каждой отправкой партии |
Создание надежной базы данных для выразительной генерации голосов с помощью искусственного интеллекта
Благодаря масштабируемому многоязычному пайплайну обработки речевых данных Kyutai расширила свою работу на дополнительные языки, диалекты, эмоциональные стили и передовые приложения для голосового общения. Для Kyutai это партнерство создало операционную основу для генерации выразительных, высококачественных речевых данных, необходимых для развития всё более естественных голосовых ИИ-систем.
Узнайте, как Uber AI Solutions может сотрудничать с вашей компанией для развития ваших технологий искусственного интеллекта.
Отзывы отражают индивидуальные результаты. Результаты могут отличаться для каждого клиента, и опыт использования будет разным.