مرکزی مواد پر جائیں

Kyutai کا جذباتی اظہار کرنے والی کثیر لسانی ٹیکسٹ ٹو اسپیچ (TTS) کو وسعت دینے کا راستہ

جانیے کہ Kyutai نے اظہار خیال کے قابل TTS کے لیے پروڈکشن کے لیے تیار کثیر لسانی وائس ڈیٹا کیسے تیار کیا

September 1, 2026 | ریاست ہائے متحدہ امریکہ

سفید پس منظر پر سیاہ متن 'kyutai' اور سبز فارورڈ سلیش۔

ایگزیکٹو خلاصہ

جب اوپن-سائنس AI لیب Kyutai نے کثیر لسانی ٹیکسٹ ٹو اسپیچ ماڈلز کو ترقی دی، تو اسے ایسی تربیتی ڈیٹا کی ضرورت تھی جو صرف قابلِ فہم تقریر سے زیادہ کو ظاہر کرے۔ ان ماڈلز کے لیے اسٹوڈیو معیار کی ریکارڈنگز درکار تھیں جن میں مختلف زبانوں میں تلفظ، آہنگ، جذبات اور تشریحات میں یکسانیت ہو۔

Uber AI Solutions (UAIS) کے ساتھ شراکت داری کے ذریعے، Kyutai نے ایک مکمل اسٹیک اسپیچ ڈیٹا پروگرام قائم کیا جو وائس ٹیلنٹ، ریکارڈنگ، ٹرانسکرپشن، تشریح، میٹا ڈیٹا اور کوالٹی ایشورنس پر محیط ہے۔ اس تعاون نے ایک قابلِ تکرار کثیر لسانی پائپ لائن تیار کی جو جدید وائس AI سسٹمز کے لیے اعلیٰ معیار اور جذباتی اظہار سے بھرپور تربیتی ڈیٹا تیار کرنے کی صلاحیت رکھتی ہے۔

کلیدی نتائج

500 گھنٹے

پانچ زبانوں میں تیار کردہ اسٹوڈیو معیار کی تقریری ڈیٹا

95%+

اہم معیارِ یقین دہانی کے مختلف پہلوؤں میں معیار کی حدیں حاصل کی گئیں

25%

پیچیدہ معاملات میں TTS کی ناکامی کی شرح میں کمی

Production-grade voice AI requires more than speech collection


Kyutai was pushing the boundaries of open voice and multimodal AI, including real-time conversational models and advanced speech generation.As the lab moved toward emotionally expressive text-to-speech, available datasets presented a limitation. Basic speech databases could support intelligibility, but they often lacked the emotional nuance, conversational variation, and multilingual consistency needed to produce natural-sounding voices.

Building the datasets introduced significant operational complexity. Speakers needed to maintain consistent identities and recording quality across sessions while delivering varied emotions and speaking styles. Transcripts, emotion labels, non-speech events, pronunciation, and metadata also had to remain accurate across languages and recording batches. To scale, Kyutai needed a governed production process capable of creating expressive multilingual data consistently.

کثیر لسانی صوتی ڈیٹا کے لیے ایک متحدہ پروڈکشن پائپ لائن تیار کرنا


Kyutai نے Uber AI Solutions کے ساتھ شراکت داری کی تاکہ وائس ڈیٹا کی تخلیق کو ایک مربوط نظام کے طور پر عملی شکل دی جا سکے، بجائے اس کے کہ ریکارڈنگ، ٹرانسکرپشن، تشریح اور QA کو الگ الگ طور پر سنبھالا جائے۔

Uber AI Solutions ہمارے سب سے قابل اعتماد ڈیٹا فراہم کنندگان اور تشریحات کرنے والوں میں سے ایک ہے۔ یہ نئی ضروریات اور وضاحتوں کے مطابق تیزی سے خود کو ڈھالتے ہیں، وقت پر ڈیلیور کرتے ہیں اور بہترین معیار کے ساتھ کام مکمل کرتے ہیں۔


Alexandre Défossez
چیف ایکسپلوریشن آفیسر، کیوتائی

UAIS نے فرانسیسی، برازیلی پرتگالی، یورپی اور لاطینی امریکی ہسپانوی، اور جرمن زبانوں میں کثیر لسانی ریکارڈنگ پروگرامز کو مربوط کیا۔ وائس ٹیلنٹ کو منظم رہنمائی فراہم کی گئی جس کا مقصد جذباتی اور آہنگی کی وسعت کو بڑھانا تھا، جس میں ہمدردانہ، طنزیہ، غصے، اداسی، رونے اور دیگر شدت والے بولنے کے انداز شامل تھے۔

ورک فلو میں AI کی مدد سے ٹرانسکرپشن کو انسانی تصدیق کے ساتھ ملایا گیا تاکہ لفظ بہ لفظ ٹرانسکرپٹس، جذبات کے لیبلز، غیر گفتاری واقعات اور دیگر میٹا ڈیٹا تیار کیا جا سکے۔ معیاری معیارِ معیار کو تمام مقررین اور ریکارڈنگ بیچز پر لاگو کیا گیا، جس سے QA پیداوار کا مسلسل حصہ بن گیا بجائے اس کے کہ یہ صرف آخری مرحلہ ہو۔

اس آپریٹنگ ماڈل نے کیوٹائی کو یہ پروگرام مختلف زبانوں، مقررین اور مزید پیچیدہ آواز کی ضروریات میں پھیلنے کے دوران مستقل مزاجی برقرار رکھنے میں مدد دی۔

ایکسپریسیو کثیر لسانی TTS کے لیے ایک تفصیلی ڈیٹاسیٹ فراہم کرنا


اس تعاون کے نتیجے میں Kyutai کی اظہار پسند TTS ضروریات کے مطابق ایک منظم، کثیر لسانی تربیتی ڈیٹا کا ماخذ تیار ہوا۔

ڈیٹا سیٹ کے علاوہ، اس تعاون نے ٹیلنٹ کے انتظام، معیار کی ریکارڈنگ، تشریح، اور تقسیم شدہ زبان پروگراموں میں قبولیت کے معیار کے لیے ایک قابلِ تکرار عمل قائم کیا۔ اس بنیاد نے ماڈل کی تربیت میں ڈیٹا شامل ہونے سے پہلے تغیر کو کم کیا اور کیوٹائی کو مستقبل میں تقریری ڈیٹا سیٹس تیار کرنے کا ایک زیادہ مستقل طریقہ فراہم کیا، جیسے جیسے تقاضے بدلتے گئے۔

کے پی آئیز

قبولیت کی شرح

رپورٹنگ کی فریکوئنسی

آڈیو معیار اسکور

95%+

ہر بیچ جمع کروانے کے ساتھ

ادائیگی اور لہجے میں ہم آہنگی

95%+

ہر بیچ جمع کروانے کے ساتھ

لفظ بہ لفظ نقل کی درستگی

95%+

ہر بیچ جمع کروانے کے ساتھ

تشریح کی درستگی (جذبہ اور غیر گفتاری ٹیگز)

95%+

ہر بیچ جمع کروانے کے ساتھ

املا اور رموزِ اوقاف

95%+

ہر بیچ جمع کروانے کے ساتھ

ایکسپریسیو اے آئی وائس جنریشن کے لیے ڈیٹا کی بنیاد قائم کرنا


ایک قابل توسیع کثیر لسانی اسپیچ ڈیٹا پائپ لائن کے قیام کے بعد، کیوتائی نے اپنے کام کو مزید زبانوں، بولیوں، جذباتی انداز اور جدید مکالماتی وائس ایپلیکیشنز تک وسعت دی۔ کیوتائی کے لیے، اس شراکت داری نے ایسے عملی بنیاد فراہم کی جس کے ذریعے وہ اظہار خیال سے بھرپور، اعلیٰ معیار کی انسانی اسپیچ ڈیٹا تیار کر سکے جو کہ مزید قدرتی وائس اے آئی سسٹمز کی ترقی کے لیے ضروری ہے۔

جانیں کہ Uber AI Solutions آپ کے ادارے کے ساتھ مل کر آپ کی AI کو آگے بڑھانے میں کس طرح شراکت دار بن سکتے ہیں۔

تعریفی بیانات انفرادی نتائج کی عکاسی کرتے ہیں۔ ہر فرد کے نتائج کسی بھی صارف کے لیے نتائج کی ضمانت نہیں ہیں، اور صارف کا تجربہ مختلف ہو سکتا ہے۔