বাদ দিয়ে প্রধান বিষয়সূচিতে যান

Kyutai-এর আবেগপ্রবণ বহুভাষিক টেক্সট-টু-স্পিচ (TTS) স্কেল করার পথ

জানুন কীভাবে Kyutai এক্সপ্রেসিভ TTS-এর জন্য প্রোডাকশন-রেডি বহু-ভাষার ভয়েস ডেটা তৈরি করেছে

September 1, 2026 | যুক্তরাষ্ট্র

সাদা পটভূমিতে কালো 'kyutai' লেখার সঙ্গে সবুজ ফরোয়ার্ড স্ল্যাশ।

কার্যনির্বাহী সারসংক্ষেপ

ওপেন-সায়েন্স এআই ল্যাব Kyutai যখন উন্নত বহু-ভাষিক টেক্সট-টু-স্পিচ মডেল তৈরি করছিল, তখন তাদের এমন প্রশিক্ষণ ডেটার প্রয়োজন ছিল যা শুধু বোধগম্য বক্তব্যই নয়, আরও অনেক কিছু ধারণ করে। এই মডেলগুলোর জন্য স্টুডিও-মানের রেকর্ডিং দরকার ছিল, যেখানে একাধিক ভাষায় উচ্চারণ, স্বরভঙ্গি, আবেগ এবং অ্যানোটেশন সবই ধারাবাহিকভাবে বজায় থাকে।

Uber AI Solutions (UAIS)-এর সঙ্গে অংশীদারিত্বের মাধ্যমে, Kyutai একটি সম্পূর্ণ-পর্যায়ের স্পিচ ডেটা প্রোগ্রাম প্রতিষ্ঠা করেছে, যার মধ্যে রয়েছে ভয়েস ট্যালেন্ট, রেকর্ডিং, ট্রান্সক্রিপশন, অ্যানোটেশন, মেটাডেটা এবং কোয়ালিটি অ্যাসিউরেন্স। এই সহযোগিতার ফলে একটি পুনরাবৃত্তিযোগ্য বহুভাষিক পাইপলাইন তৈরি হয়েছে, যা উন্নত ভয়েস AI সিস্টেমের জন্য উচ্চ-মানের, আবেগপ্রবণ প্রশিক্ষণ ডেটা উৎপাদনে সক্ষম।

মূল ফলাফলসমূহ

৫০০ ঘণ্টা

পাঁচটি ভাষায় তৈরি স্টুডিও-গ্রেডের কথোপকথনের ডেটা

95%+

মূল QA ক্ষেত্রগুলোর জুড়ে মানের নির্ধারিত স্তর অর্জিত হয়েছে

25%

জটিল ক্ষেত্রে TTS ব্যর্থতার হার হ্রাস

Production-grade voice AI requires more than speech collection


Kyutai was pushing the boundaries of open voice and multimodal AI, including real-time conversational models and advanced speech generation.As the lab moved toward emotionally expressive text-to-speech, available datasets presented a limitation. Basic speech databases could support intelligibility, but they often lacked the emotional nuance, conversational variation, and multilingual consistency needed to produce natural-sounding voices.

Building the datasets introduced significant operational complexity. Speakers needed to maintain consistent identities and recording quality across sessions while delivering varied emotions and speaking styles. Transcripts, emotion labels, non-speech events, pronunciation, and metadata also had to remain accurate across languages and recording batches. To scale, Kyutai needed a governed production process capable of creating expressive multilingual data consistently.

বহুভাষিক ভয়েস ডেটার জন্য একটি একীভূত প্রোডাকশন পাইপলাইন তৈরি করা


Kyutai Uber AI Solutions-এর সঙ্গে অংশীদারিত্ব করেছে, যাতে রেকর্ডিং, ট্রান্সক্রিপশন, অ্যানোটেশন এবং QA আলাদাভাবে পরিচালনা না করে, একটি সমন্বিত ব্যবস্থার মাধ্যমে ভয়েস ডেটা তৈরির কার্যক্রম চালানো যায়।

Uber AI Solutions আমাদের অন্যতম নির্ভরযোগ্য ডেটা প্রদানকারী এবং অ্যানোটেটর। তারা নতুন ব্যবহারিক ক্ষেত্র ও স্পেসিফিকেশনের সাথে দ্রুত মানিয়ে নেয়, সময়মতো ডেলিভারি দেয় এবং নিখুঁত মান বজায় রাখে।


Alexandre Défossez
চিফ এক্সপ্লোরেশন অফিসার, কিউতাই

UAIS ফরাসি, ব্রাজিলিয়ান পর্তুগিজ, ইউরোপীয় এবং লাতিন আমেরিকান স্প্যানিশ, এবং জার্মান ভাষায় বহু-ভাষিক রেকর্ডিং প্রোগ্রাম সমন্বয় করেছে। ভয়েস ট্যালেন্টরা গঠিত নির্দেশনা পেয়েছে, যা তাদের আবেগপ্রবণতা ও স্বরভঙ্গির পরিসর বাড়ানোর জন্য তৈরি করা হয়েছে—এর মধ্যে সহানুভূতিশীল, ব্যঙ্গাত্মক, রাগান্বিত, দুঃখিত, কান্নারত এবং অন্যান্য উচ্চ-তীব্রতার বক্তব্যের ধরন অন্তর্ভুক্ত।

এই কার্যপ্রবাহে AI-সহায়ক ট্রান্সক্রিপশন মানব যাচাইয়ের সাথে একত্রিত করা হয়েছিল, যাতে হুবহু ট্রান্সক্রিপ্ট, আবেগের লেবেল, অ-ভাষিক ঘটনা এবং অন্যান্য মেটাডেটা অন্তর্ভুক্ত থাকে। মানসম্মত গুণগত মানদণ্ড বক্তা ও রেকর্ডিং ব্যাচ জুড়ে প্রয়োগ করা হয়েছে, ফলে QA উৎপাদনের একটি ধারাবাহিক অংশ হয়ে উঠেছে, শুধুমাত্র চূড়ান্ত পর্যায়ের একটি চেকপয়েন্ট নয়।

এই পরিচালন মডেলটি কিউটাই-কে ধারাবাহিকতা বজায় রাখতে সহায়তা করেছে, কারণ প্রোগ্রামটি বিভিন্ন ভাষা, বক্তা এবং ক্রমবর্ধমান সূক্ষ্ম কণ্ঠস্বরের চাহিদার মধ্যে বিস্তৃত হয়েছে।

এক্সপ্রেসিভ বহু-ভাষিক TTS-এর জন্য একটি বিস্তারিত ডেটাসেট প্রদান করা হচ্ছে


এই উদ্যোগটি Kyutai-এর অভিব্যক্তিপূর্ণ TTS চাহিদার জন্য উপযোগী বহুভাষিক প্রশিক্ষণ ডেটার একটি সংগঠিত উৎস তৈরি করেছে।

ডেটাসেটটির বাইরেও, এই সহযোগিতার মাধ্যমে বিভিন্ন ভাষা প্রোগ্রামে মেধা ব্যবস্থাপনা, রেকর্ডিংয়ের মান, অ্যানোটেশন এবং গ্রহণযোগ্যতার মানদণ্ড নির্ধারণের জন্য একটি পুনরাবৃত্তিযোগ্য প্রক্রিয়া প্রতিষ্ঠিত হয়েছে। এই ভিত্তিটি মডেল প্রশিক্ষণে ডেটা প্রবেশের আগেই পরিবর্তনশীলতা হ্রাস করেছে এবং প্রয়োজন অনুযায়ী ভবিষ্যতের স্পিচ ডেটাসেট তৈরির জন্য কিউতাইকে আরও সামঞ্জস্যপূর্ণ একটি উপায় দিয়েছে।

কেপিআইসমূহ

গ্রহণের হার

রিপোর্টিং ফ্রিকোয়েন্সি

অডিও মানের স্কোর

95%+

প্রতি ব্যাচ জমা দেওয়ার সাথে সাথে

উচ্চারণ ও স্বরধ্বনি সামঞ্জস্য

95%+

প্রতি ব্যাচ জমা দেওয়ার সাথে সাথে

শব্দশব্দ অনুলিপির নির্ভুলতা

95%+

প্রতি ব্যাচ জমা দেওয়ার সাথে সাথে

অ্যানোটেশনের নির্ভুলতা (অনুভূতি ও অ-ভাষণ ট্যাগসমূহ)

95%+

প্রতি ব্যাচ জমা দেওয়ার সাথে সাথে

বানান ও যতিচিহ্ন

95%+

প্রতি ব্যাচ জমা দেওয়ার সাথে সাথে

এক্সপ্রেসিভ এআই ভয়েস জেনারেশনের জন্য ডেটার ভিত্তি তৈরি করা হচ্ছে


একটি স্কেলযোগ্য বহুভাষিক স্পিচ ডেটা পাইপলাইন স্থাপনের মাধ্যমে, Kyutai তার কাজকে আরও ভাষা, উপভাষা, আবেগপূর্ণ শৈলী এবং উন্নত কথোপকথনভিত্তিক ভয়েস অ্যাপ্লিকেশনে সম্প্রসারিত করেছে। Kyutai-এর জন্য, এই অংশীদারিত্বটি আরও স্বাভাবিক ভয়েস এআই সিস্টেমের উন্নয়নের জন্য প্রয়োজনীয়, প্রকাশভঙ্গিময় ও উচ্চ-মানের মানবিক স্পিচ ডেটা তৈরির জন্য কার্যকর ভিত্তি তৈরি করেছে।

জানুন কীভাবে Uber AI Solutions আপনার প্রতিষ্ঠানের সঙ্গে অংশীদার হতে পারে আপনার কৃত্রিম বুদ্ধিমত্তা উন্নত করতে।

প্রত্যয়নগুলো ব্যক্তিগত ফলাফল প্রতিফলিত করে। প্রতিটি গ্রাহকের ফলাফল এক নয় এবং কোনো নির্দিষ্ট গ্রাহকের জন্য ফলাফল নিশ্চিত নয়; গ্রাহকের অভিজ্ঞতা ভিন্ন হতে পারে।