Пропустить и перейти к основному содержимому

Путь Kyutai к масштабированию многозвучного синтеза речи (TTS) с эмоциональной выразительностью

Узнайте, как Kyutai создала многоязычные голосовые данные, готовые к использованию в выразительном синтезе речи

1 сентября 2026 г. | Соединённые Штаты

Чёрный текст «kyutai» с зелёной косой чертой на белом фоне.

Краткое содержание

Когда лаборатория искусственного интеллекта Kyutai, работающая в области открытой науки, совершенствовала многоязычные модели преобразования текста в речь, ей понадобились обучающие данные, отражающие не только разборчивую речь. Для моделей требовались студийные записи с единообразным произношением, интонацией, эмоциональной окраской и аннотацией на разных языках.

Сотрудничая с Uber AI Solutions (UAIS), Kyutai создала комплексную программу работы с речевыми данными, охватывающую подбор дикторов, запись, транскрипцию, аннотирование, работу с метаданными и контроль качества. В результате сотрудничества была разработана масштабируемая многоязычная система, позволяющая получать высококачественные, эмоционально выразительные обучающие данные для современных голосовых ИИ-систем.

Ключевые результаты

500 часов

студийные аудиозаписи речи, созданные на пяти языках

95%+

Достигнуты целевые показатели качества по основным направлениям контроля

25%

Снижение частоты сбоев TTS в сложных случаях

Для создания голосового ИИ промышленного уровня требуется не только сбор речевых данных


Kyutai расширял границы открытых голосовых и мультимодальных ИИ, включая модели для общения в реальном времени и продвинутую генерацию речи. По мере того как лаборатория переходила к созданию эмоционально выразительного синтеза речи, доступные наборы данных становились ограничивающим фактором. Базовые базы данных речи обеспечивали разборчивость, но часто не хватало эмоциональных оттенков, разнообразия в диалогах и многоязыковой согласованности, необходимых для создания естественно звучащих голосов.

Создание этих наборов данных привело к значительным операционным сложностям. Спикерам необходимо было сохранять постоянство идентичности и качества записи на протяжении всех сессий, при этом демонстрируя разнообразные эмоции и стили речи. Транскрипты, метки эмоций, несвязанные с речью события, произношение и метаданные также должны были оставаться точными во всех языках и партиях записей. Для масштабирования Kyutai потребовался управляемый производственный процесс, способный стабильно создавать выразительные многоязычные данные.

Создание единого производственного процесса для многоязычных голосовых данных


Kyutai объединила усилия с Uber AI Solutions, чтобы организовать создание голосовых данных как единую скоординированную систему вместо раздельного управления записью, расшифровкой, аннотированием и контролем качества.

Uber AI Solutions — один из самых надежных наших поставщиков данных и аннотаторов. Они быстро адаптируются к новым сценариям использования и требованиям, выполняют задачи в срок и обеспечивают безупречное качество.


Александр Дефоссэ
Директор по исследованиям, Kyutai

UAIS координировала многоязычные программы записи на французском, бразильском португальском, европейском и латиноамериканском испанском, а также немецком языках. Актёры озвучивания получали структурированные рекомендации, направленные на расширение эмоционального и просодического диапазона, включая эмпатичные, саркастические, сердитые, грустные, плачущие и другие высокоинтенсивные стили речи.

Рабочий процесс сочетал автоматическую транскрипцию с помощью ИИ и проверку человеком для получения дословных транскриптов, маркировки эмоций, несвязанных с речью событий и другой метаинформации. Единые критерии качества применялись ко всем дикторам и партиям записей, что делало контроль качества постоянной частью производства, а не финальным этапом.

Эта модель работы помогла Kyutai сохранять последовательность по мере расширения программы на новые языки, спикеров и всё более сложные требования к голосу.

Предоставление детализированного набора данных для выразительного многоязычного синтеза речи


В результате сотрудничества был создан структурированный источник многоязычных обучающих данных, адаптированных под требования Kyutai к выразительному синтезу речи.

Помимо самого набора данных, сотрудничество позволило создать воспроизводимый процесс управления специалистами, контроля качества, аннотирования и определения критериев приемки в распределённых языковых программах. Эта основа снизила вариативность до поступления данных на этап обучения модели и обеспечила Kyutai более стабильный способ формирования будущих наборов данных для распознавания речи по мере изменения требований.

Ключевые показатели эффективности (KPI)

Коэффициент принятия

Частота отчетности

Оценка качества звука

95%+

С каждой отправкой партии

Согласованность произношения и просодии

95%+

С каждой отправкой партии

Точность дословной расшифровки

95%+

С каждой отправкой партии

Точность аннотирования (эмоции и теги несвязанные с речью)

95%+

С каждой отправкой партии

Орфография и пунктуация

95%+

С каждой отправкой партии

Создание надежной базы данных для выразительной генерации голосов с помощью искусственного интеллекта


Благодаря масштабируемому многоязычному пайплайну обработки речевых данных Kyutai расширила свою работу на дополнительные языки, диалекты, эмоциональные стили и передовые приложения для голосового общения. Для Kyutai это партнерство создало операционную основу для генерации выразительных, высококачественных речевых данных, необходимых для развития всё более естественных голосовых ИИ-систем.

Узнайте, как Uber AI Solutions может сотрудничать с вашей компанией для развития ваших технологий искусственного интеллекта.

Отзывы отражают индивидуальные результаты. Результаты могут отличаться для каждого клиента, и опыт использования будет разным.