تخطٍ للوصول إلى المحتوى الرئيسي

مسار كيوتاي نحو توسيع نطاق تقنيات تحويل النص إلى كلام (TTS) متعددة اللغات وذات الطابع التعبيري

تعرَّف على كيفية إنشاء كيوتاي لبيانات صوتية متعددة اللغات ملائمة للنشر الفعلي لتقنيات تحويل النص إلى كلام (TTS) التي تتميز بالطابع التعبيري

1 سبتمبر 2026 | الولايات المتحدة

تُعرض كلمة "kyutai" بنص أسود يتوسطه خط مائل أخضر، وذلك على خلفية بيضاء.

الملخص التنفيذي

مع تطور مختبر كيوتاي للذكاء الاصطناعي، الذي يتبنى نهج العلوم المفتوحة، في تطوير نماذجه متعددة اللغات لتحويل النص إلى كلام، احتاج إلى بيانات تدريبية تتجاوز مجرد الكلام المفهوم. تطلبت هذه النماذج تسجيلات بجودة استوديو احترافية تتميز بنطق ونبرة وتعبير عاطفي متسقين عبر لغات متعددة، بالإضافة إلى شروح تفصيلية متعددة.

بالتعاون مع شركة Uber AI Solutions (UAIS)، أنشأت كيوتاي برنامجاً متكاملاً لبيانات الكلام يشمل المواهب الصوتية، والتسجيل، والنسخ، والشرح، والبيانات الوصفية، وضمان الجودة. وقد أدت هذه الشراكة إلى إنشاء مسار متعدد اللغات قادر على توليد بيانات تدريبية عالية الجودة ومعبرة عاطفياً بشكل متكرر لأنظمة الذكاء الاصطناعي الصوتية المتقدمة.

النتائج الرئيسية

500 ساعة

بيانات كلامية بمستوى احترافي تغطي خمس لغات

+%95

تم استيفاء معايير الجودة عبر الأبعاد الرئيسية لضمان الجودة

25%

انخفاض مُعدل فشل تقنية تحويل النص إلى كلام (TTS) في الحالات المعقدة

Production-grade voice AI requires more than speech collection


Kyutai was pushing the boundaries of open voice and multimodal AI, including real-time conversational models and advanced speech generation.As the lab moved toward emotionally expressive text-to-speech, available datasets presented a limitation. Basic speech databases could support intelligibility, but they often lacked the emotional nuance, conversational variation, and multilingual consistency needed to produce natural-sounding voices.

Building the datasets introduced significant operational complexity. Speakers needed to maintain consistent identities and recording quality across sessions while delivering varied emotions and speaking styles. Transcripts, emotion labels, non-speech events, pronunciation, and metadata also had to remain accurate across languages and recording batches. To scale, Kyutai needed a governed production process capable of creating expressive multilingual data consistently.

إنشاء مسار إنتاج موحد للبيانات الصوتية متعددة اللغات


بالتعاون مع Uber AI Solutions، أدارت كيوتاي عملية توليد بيانات الكلام كنظام واحد متكامل، بدلاً من إدارة مراحل التسجيل والنسخ النصي والترميز وضمان الجودة بشكل منفصل.

تُعد حلول Uber AI Solutions واحدة من أكثر الجهات الموثوقة لدينا في مجال توفير البيانات وتصنيفها؛ فهي تتكيف بسرعة مع حالات الاستخدام والمواصفات الجديدة، وتُقدم باستمرار نتائج خالية من الأخطاء وفي الموعد المحدد.


ألكسندر ديفوسيه
كبير مسؤولي الاستكشاف في شركة كيوتاي

نسَّّقت UAIS برامج تسجيل متعددة اللغات شملت الفرنسية، والبرتغالية البرازيلية، والإسبانية (بنسختيها الأوروبية وأمريكا اللاتينية)، والألمانية. تلقى المعلقون الصوتيون إرشادات منهجية مصممة لتوسيع نطاق أدائهم العاطفي والصوتي، بما يغطي مجموعة متنوعة من التعبيرات العاطفية القوية، مثل التعاطف، والسخرية، والغضب، والحزن، والبكاء إلى جانب أنماط كلامية أخرى تتطلب مستويات عالية من الانفعال.

جمعت آلية العمل بين عمليات النسخ المدعومة بالذكاء الاصطناعي والتحقق البشري للنصوص الحرفية، وتصنيفات المشاعر، والأحداث غير اللفظية، وغيرها من البيانات الوصفية. كما طُبِّقت معايير جودة موحدة شملت جميع المتحدثين ودفعات التسجيل، مما جعل ضمان الجودة جزءاً جوهرياً ومستمراً من عملية الإنتاج، بدلاً من الاكتفاء بكونه مجرد مرحلة فحص نهائية.

ساعد هذا النموذج التشغيلي شركة كيوتاي في الحفاظ على الاتساق مع توسع البرنامج ليشمل لغاتٍ ومتحدثين متنوعين، ومتطلباتٍ صوتية تزداد دقةً وتفصيلاً.

توفير مجموعة بيانات مفصلة لتوليد الكلام متعدد اللغات بتعبير غني


أسفر التعاون عن توفير مصدر منظم لبيانات تدريب متعددة اللغات مصممة خصيصًا لتلبية متطلبات تحويل النص إلى كلام التعبيري لدى Kyutai.

بالإضافة إلى مجموعة البيانات نفسها، أسست هذه الشراكة عملية قابلة للتكرار لإدارة المواهب، وتوثيق الجودة، والتعليق، ومعايير القبول عبر برامج اللغات الموزعة. هذا الأساس ساهم في تقليل التباين قبل إدخال البيانات في تدريب النماذج، ومنح Kyutai طريقة أكثر اتساقًا لإنشاء مجموعات بيانات صوتية مستقبلية مع تطور المتطلبات.

المؤشرات الرئيسية للأداء

مُعدل القبول

مُعدَّل تكرار التقارير

درجة جودة الصوت

95%+

عند إرسال كل دفعة

اتساق النطق والإيقاع

95%+

عند إرسال كل دفعة

دقة النسخ الحرفي

95%+

عند إرسال كل دفعة

دقة التعليقات التوضيحية (الانفعالات وعلامات غير الكلام)

95%+

عند إرسال كل دفعة

التهجئة وعلامات الترقيم

95%+

عند إرسال كل دفعة

بناء قاعدة بيانات لتوليد أصوات الذكاء الاصطناعي المعبِّرة


بفضل توفر مسار بيانات صوتية متعدد اللغات وقابل للتوسع، وسَّعت شركة كيوتاي نطاق عملها ليشمل لغات ولهجات وأنماطاً عاطفية أخرى، بالإضافة إلى تطبيقات المحادثة الصوتية المتقدمة. وقد أرسى هذا التعاون الأسس التشغيلية اللازمة لتوليد بيانات صوتية بشرية تعبيرية وعالية الجودة، وهي عناصر جوهرية لتطوير أنظمة الذكاء الاصطناعي الصوتية الطبيعية بشكل متزايد.

تعرَّف على كيفية تعاون Uber AI Solutions مع مؤسستك لتطوير الذكاء الاصطناعي.

تعكس تقييمات المستخدمين النتائج الفردية. ولا تُشكل هذه النتائج ضماناً لنتائج أي عميل بعينه، وقد تختلف التجربة من عميل لآخر.