Kyutai ಯ ಭಾವನಾತ್ಮಕ ಅಭಿವ್ಯಕ್ತಿಯುಳ್ಳ ಬಹುಭಾಷಾ ಪಠ್ಯದಿಂದ-ಮಾತಿಗೆ (TTS) ವಿಸ್ತರಣೆಯ ದಾರಿ
ಎಕ್ಸ್ಪ್ರೆಸಿವ್ TTSಗಾಗಿ ಉತ್ಪಾದನಾ ಮಟ್ಟದ ಬಹುಭಾಷಾ ಧ್ವನಿ ಡೇಟಾವನ್ನು Kyutai ಹೇಗೆ ನಿರ್ಮಿಸಿತು ಎಂಬುದನ್ನು ತಿಳಿಯಿರಿ
September 1, 2026 | ಯುನೈಟೆಡ್ ಸ್ಟೇಟ್ಸ್
ಕಾರ್ಯನಿರ್ವಾಹಕ ಸಾರಾಂಶ
ಕ್ಯುಟೈ ಎಂಬ ಮುಕ್ತ ವಿಜ್ಞಾನ AI ಪ್ರಯೋಗಾಲಯವು ಬಹುಭಾಷಾ ಪಠ್ಯದಿಂದ ಭಾಷಣ ಮಾದರಿಗಳನ್ನು ಅಭಿವೃದ್ಧಿಪಡಿಸುತ್ತಿದ್ದಂತೆ, ಅದಕ್ಕೆ ಅರ್ಥವಾಗುವ ಭಾಷಣಕ್ಕಿಂತ ಹೆಚ್ಚಿನದನ್ನು ಸೆರೆಹಿಡಿಯುವ ತರಬೇತಿ ದತ್ತಾಂಶದ ಅಗತ್ಯವಿತ್ತು. ಮಾದರಿಗಳಿಗೆ ಬಹು ಭಾಷೆಗಳಲ್ಲಿ ಸ್ಥಿರವಾದ ಉಚ್ಚಾರಣೆ, ಛಂದಸ್ಸು, ಭಾವನೆ ಮತ್ತು ಟಿಪ್ಪಣಿಗಳೊಂದಿಗೆ ಸ್ಟುಡಿಯೋ-ದರ್ಜೆಯ ರೆಕಾರ್ಡಿಂಗ್ಗಳು ಬೇಕಾಗಿದ್ದವು.
Uber AI Solutions (UAIS) ಜೊತೆಗೆ ಪಾಲುದಾರಿಕೆ ಮಾಡಿಕೊಂಡು, Kyutai ಒಂದು ಸಂಪೂರ್ಣ-ಸ್ಟ್ಯಾಕ್ ಸ್ಪೀಚ್ ಡೇಟಾ ಕಾರ್ಯಕ್ರಮವನ್ನು ಸ್ಥಾಪಿಸಿತು, ಇದರಲ್ಲಿ ವಾಯ್ಸ್ ಟ್ಯಾಲೆಂಟ್, ರೆಕಾರ್ಡಿಂಗ್, ಟ್ರಾನ್ಸ್ಕ್ರಿಪ್ಷನ್, ಅನೋಟೇಶನ್, ಮೆಟಾಡೇಟಾ ಮತ್ತು ಗುಣಮಟ್ಟ ಭರವಸೆ ಎಲ್ಲವೂ ಒಳಗೊಂಡಿವೆ. ಈ ಸಹಕಾರವು ಪುನರಾವರ್ತಿಸಬಹುದಾದ ಬಹುಭಾಷಾ ಪೈಪ್ಲೈನ್ ಅನ್ನು ನಿರ್ಮಿಸಿತು, ಇದು ಉನ್ನತ ಮಟ್ಟದ ವಾಯ್ಸ್ AI ವ್ಯವಸ್ಥೆಗಳಿಗೆ ಉನ್ನತ ಗುಣಮಟ್ಟದ, ಭಾವನಾತ್ಮಕವಾಗಿ ವ್ಯಕ್ತಪಡಿಸುವ ತರಬೇತಿ ಡೇಟಾವನ್ನು ಉತ್ಪಾದಿಸಲು ಸಾಮರ್ಥ್ಯ ಹೊಂದಿದೆ.
ಪ್ರಮುಖ ಫಲಿತಾಂಶಗಳು
500 ಗಂಟೆ
ಐದು ಭಾಷೆಗಳಲ್ಲಿಯೂ ಉತ್ಪಾದಿಸಲಾದ ಸ್ಟುಡಿಯೋ-ಮಟ್ಟದ ಮಾತಿನ ಡೇಟಾ
95%+
ಪ್ರಮುಖ ಗುಣಮಟ್ಟದ ಖಾತರಿ ಆಯಾಮಗಳಲ್ಲಿ ಗುಣಮಟ್ಟದ ಮಿತಿಗಳನ್ನು ಸಾಧಿಸಲಾಗಿದೆ
25%
ಸಂಕೀರ್ಣ ಪ್ರಕರಣಗಳಲ್ಲಿ TTS ವಿಫಲತಾ ಪ್ರಮಾಣದಲ್ಲಿ ಕಡಿತ
Production-grade voice AI requires more than speech collection
Kyutai was pushing the boundaries of open voice and multimodal AI, including real-time conversational models and advanced speech generation.As the lab moved toward emotionally expressive text-to-speech, available datasets presented a limitation. Basic speech databases could support intelligibility, but they often lacked the emotional nuance, conversational variation, and multilingual consistency needed to produce natural-sounding voices.
Building the datasets introduced significant operational complexity. Speakers needed to maintain consistent identities and recording quality across sessions while delivering varied emotions and speaking styles. Transcripts, emotion labels, non-speech events, pronunciation, and metadata also had to remain accurate across languages and recording batches. To scale, Kyutai needed a governed production process capable of creating expressive multilingual data consistently.
ಬಹುಭಾಷಾ ಧ್ವನಿ ಡೇಟಾದಿಗಾಗಿ ಏಕೀಕೃತ ಉತ್ಪಾದನಾ ಪೈಪ್ಲೈನ್ ರಚಿಸುವುದು
Kyutai Uber AI Solutions ಜೊತೆಗೆ ಕೈಜೋಡಿಸಿ ಧ್ವನಿ ಡೇಟಾ ಸೃಷ್ಟಿಯನ್ನು ಒಂದೇ ಸಂಯೋಜಿತ ವ್ಯವಸ್ಥೆಯಾಗಿ ಕಾರ್ಯಗತಗೊಳಿಸಿತು, ಬದಲು ಪ್ರತ್ಯೇಕವಾಗಿ ರೆಕಾರ್ಡಿಂಗ್, ಟ್ರಾನ್ಸ್ಕ್ರಿಪ್ಷನ್, ಅನೋಟೇಶನ್ ಮತ್ತು ಗುಣಮಟ್ಟ ಪರಿಶೀಲನೆಯನ್ನು ನಿರ್ವಹಿಸುವುದಕ್ಕೆ.
“
Uber AI Solutions ನಮ್ಮ ಅತ್ಯಂತ ನಂಬಿಗಸ್ಥ ಡೇಟಾ ಪೂರೈಕೆದಾರರು ಮತ್ತು ಅನೋಟೇಟರ್ಗಳಲ್ಲಿ ಒಬ್ಬರು. ಅವರು ಹೊಸ ಬಳಕೆ ಪ್ರಕರಣಗಳು ಮತ್ತು ವಿಶೇಷಣಗಳಿಗೆ ವೇಗವಾಗಿ ಹೊಂದಿಕೊಳ್ಳುತ್ತಾರೆ, ಸಮಯಕ್ಕೆ ಸರಿಯಾಗಿ ಮತ್ತು ದೋಷರಹಿತ ಗುಣಮಟ್ಟದೊಂದಿಗೆ ವಿತರಣೆಯನ್ನು ಮಾಡುತ್ತಾರೆ.
”
Alexandre Défossez
ಚೀಫ್ ಎಕ್ಸ್ಪ್ಲೋರೇಶನ್ ಆಫೀಸರ್, Kyutai
ಫ್ರೆಂಚ್, ಬ್ರೆಜಿಲಿಯನ್ ಪೋರ್ಚುಗೀಸ್, ಯುರೋಪಿಯನ್ ಮತ್ತು ಲ್ಯಾಟಿನ್ ಅಮೇರಿಕನ್ ಸ್ಪ್ಯಾನಿಷ್ ಮತ್ತು ಜರ್ಮನ್ ಭಾಷೆಗಳಲ್ಲಿ ಬಹುಭಾಷಾ ರೆಕಾರ್ಡಿಂಗ್ ಪ್ರೋಗ್ರಾಂಗಳನ್ನು UAIS ಸಂಯೋಜಿಸಿತು. ಧ್ವನಿ ಪ್ರತಿಭೆಯು ಭಾವನಾತ್ಮಕ ಮತ್ತು ಛಂದೋಬದ್ಧ ಶ್ರೇಣಿಯನ್ನು ವಿಸ್ತರಿಸಲು ವಿನ್ಯಾಸಗೊಳಿಸಲಾದ ರಚನಾತ್ಮಕ ಮಾರ್ಗದರ್ಶನವನ್ನು ಪಡೆಯಿತು, ಇದರಲ್ಲಿ ಸಹಾನುಭೂತಿ, ವ್ಯಂಗ್ಯ, ಕೋಪ, ದುಃಖ, ಅಳುವುದು ಮತ್ತು ಇತರ ಹೆಚ್ಚಿನ ತೀವ್ರತೆಯ ಭಾಷಣ ಶೈಲಿಗಳು ಸೇರಿವೆ.
ವರ್ಕ್ಫ್ಲೋ ಸಂಯೋಜಿತ AI- ನೆರವಿನ ಪ್ರತಿಲೇಖನವನ್ನು ಮೌಖಿಕ ಪ್ರತಿಲೇಖನಗಳು, ಭಾವನಾತ್ಮಕ ಲೇಬಲ್ಗಳು, ಭಾಷಣೇತರ ಘಟನೆಗಳು ಮತ್ತು ಇತರ ಮೆಟಾಡೇಟಾಕ್ಕಾಗಿ ಮಾನವ ಪರಿಶೀಲನೆಯೊಂದಿಗೆ ಸಂಯೋಜಿಸಿತು. ಸ್ಪೀಕರ್ಗಳು ಮತ್ತು ರೆಕಾರ್ಡಿಂಗ್ ಬ್ಯಾಚ್ಗಳಲ್ಲಿ ಪ್ರಮಾಣೀಕೃತ ಕ್ವಾಲಿಟಿ ಮಾನದಂಡಗಳನ್ನು ಅನ್ವಯಿಸಲಾಯಿತು, ಈ ಮೂಲಕ QA ಅನ್ನು ಅಂತಿಮ ಚೆಕ್ಪಾಯಿಂಟ್ಗಿಂತ ಹೆಚ್ಚಾಗಿ ಪ್ರೊಡಕ್ಷನ್ನ ನಿರಂತರ ಭಾಗವನ್ನಾಗಿ ಮಾಡಿತು.
ಈ ಕಾರ್ಯಾಚರಣಾ ಮಾದರಿಯು, ಭಾಷೆಗಳು, ಮಾತನಾಡುವವರು ಮತ್ತು ಹೆಚ್ಚು ಸೂಕ್ಷ್ಮವಾದ ಧ್ವನಿ ಅಗತ್ಯಗಳನ್ನು ಒಳಗೊಂಡಂತೆ ಪ್ರೋಗ್ರಾಂ ವಿಸ್ತರಿಸಿದಂತೆ, Kyutai ಗೆ ಸುದೀರ್ಘತೆ ಕಾಯ್ದುಕೊಳ್ಳಲು ಸಹಾಯ ಮಾಡಿತು.
ವ್ಯಕ್ತಿಪೂರ್ಣ ಬಹುಭಾಷಾ ಪಠ್ಯದಿಂದ ಮಾತಿಗೆ ಪರಿವರ್ತನೆಗೆ (TTS) ವಿವರವಾದ ಡೇಟಾಸೆಟ್ ಅನ್ನು ಒದಗಿಸಲಾಗುತ್ತಿದೆ
ಈ ಸಂವಹನವು Kyutai ನ ಅಭಿವ್ಯಕ್ತಿಪೂರ್ಣ TTS ಅಗತ್ಯಗಳಿಗೆ ಹೊಂದಿಕೊಂಡಿರುವ ಬಹುಭಾಷಾ ತರಬೇತಿ ಡೇಟಾದ ಸಂರಚಿತ ಮೂಲವನ್ನು ಸೃಷ್ಟಿಸಿತು.
ಡೇಟಾಸೆಟ್ನ ಆಚೆಗೆ, ಸಹಯೋಗವು ವಿತರಿಸಿದ ಭಾಷಾ ಪ್ರೋಗ್ರಾಂಗಳಾದ್ಯಂತ ಪ್ರತಿಭೆ, ರೆಕಾರ್ಡಿಂಗ್ ಕ್ವಾಲಿಟಿ, ಟಿಪ್ಪಣಿ ಮತ್ತು ಸ್ವೀಕಾರ ಮಾನದಂಡಗಳನ್ನು ನಿರ್ವಹಿಸುವ ಪುನರಾವರ್ತಿತ ಪ್ರಕ್ರಿಯೆಯನ್ನು ಸ್ಥಾಪಿಸಿತು. ಆ ಅಡಿಪಾಯವು ಡೇಟಾ ಮಾದರಿ ತರಬೇತಿಗೆ ಪ್ರವೇಶಿಸುವ ಮೊದಲು ವ್ಯತ್ಯಾಸವನ್ನು ಕಡಿಮೆ ಮಾಡಿತು ಮತ್ತು ಅವಶ್ಯಕತೆಗಳು ವಿಕಸನಗೊಂಡಂತೆ ಭವಿಷ್ಯದ ಭಾಷಣ ಡೇಟಾಸೆಟ್ಗಳನ್ನು ಉತ್ಪಾದಿಸಲು Kyutai ಗೆ ಹೆಚ್ಚು ಸ್ಥಿರವಾದ ಮಾರ್ಗವನ್ನು ನೀಡಿತು.
KPIಗಳು | ಸ್ವೀಕೃತಿ ದರ | ವರದಿ ಮಾಡುವ ಆವೃತ್ತಿ |
|---|---|---|
ಆಡಿಯೋ ಗುಣಮಟ್ಟದ ಅಂಕೆ | 95%+ | ಪ್ರತಿ ಬ್ಯಾಚ್ ಸಲ್ಲಿಕೆಗೊಂದಿಗೆ |
ಉಚ್ಚಾರಣೆ ಮತ್ತು ಪ್ರೊಸೋಡಿ ಸಮ್ಮತತೆ | 95%+ | ಪ್ರತಿ ಬ್ಯಾಚ್ ಸಲ್ಲಿಕೆಗೊಂದಿಗೆ |
ನಿಖರವಾದ ಪದಶಃ ಲಿಪ್ಯಂತರಣ | 95%+ | ಪ್ರತಿ ಬ್ಯಾಚ್ ಸಲ್ಲಿಕೆಗೊಂದಿಗೆ |
ವ್ಯಾಖ್ಯಾನ ಶುದ್ಧತೆ (ಭಾವನೆ ಮತ್ತು ಮಾತಿನಲ್ಲದ ಟ್ಯಾಗ್ಗಳು) | 95%+ | ಪ್ರತಿ ಬ್ಯಾಚ್ ಸಲ್ಲಿಕೆಗೊಂದಿಗೆ |
ಅಕ್ಷರಚ್ಯುತಿ ಮತ್ತು ವಿರಾಮಚಿಹ್ನೆಗಳು | 95%+ | ಪ್ರತಿ ಬ್ಯಾಚ್ ಸಲ್ಲಿಕೆಗೊಂದಿಗೆ |
ವ್ಯಕ್ತಿಪೂರ್ಣ AI ಧ್ವನಿ ರಚನೆಗಾಗಿ ಡೇಟಾ ಆಧಾರವನ್ನು ಸ್ಥಾಪಿಸಲಾಗುತ್ತಿದೆ
ಬಹುಭಾಷಾ ಭಾಷ ಣ ಡೇಟಾ ಪೈಪ್ಲೈನ್ನೊಂದಿಗೆ, Kyutai ತನ್ನ ಕೆಲಸವನ್ನು ಹೆಚ್ಚುವರಿ ಭಾಷೆಗಳು, ಉಪಭಾಷೆಗಳು, ಭಾವನಾತ್ಮಕ ಶೈಲಿಗಳು ಮತ್ತು ಮುಂದುವರಿದ ಸಂಭಾಷಣಾ ಧ್ವನಿ ಅನ್ವಯಿಕೆಗಳಿಗೆ ವಿಸ್ತರಿಸಿದೆ. Kyutai ಗಾಗಿ, ಪಾಲುದಾರಿಕೆಯು ಹೆಚ್ಚು ನೈಸರ್ಗಿಕ ಧ್ವನಿ AI ವ್ಯವಸ್ಥೆಗಳನ್ನು ಮುಂದುವರಿಸಲು ಅಗತ್ಯವಾದ ಅಭಿವ್ಯಕ್ತಿಶೀಲ, ಉತ್ತಮ-ಕ್ವಾಲಿಟಿ ಮಾನವ ಭಾಷಣ ಡೇಟಾವನ್ನು ಉತ್ಪಾದಿಸುವ ಕಾರ್ಯಾಚರಣೆಯ ಅಡಿಪಾಯವನ್ನು ಸೃಷ್ಟಿಸಿದೆ.
ನಿಮ್ಮ ಎಂಟರ್ಪ್ರೈಸ್ನೊಂದಿಗೆ ಸಹಕ ರಿಸಿ ನಿಮ್ಮ AI ಅನ್ನು ಮುಂದುವರಿಸಲು Uber AI Solutions ಹೇಗೆ ಸಹಾಯ ಮಾಡಬಹುದು ಎಂಬುದನ್ನು ತಿಳಿಯಿರಿ.
ಪ್ರಶಂಸಾಪತ್ರಗಳು ವೈಯಕ್ತಿಕ ಫಲಿತಾಂಶಗಳನ್ನು ಪ್ರತಿಬಿಂಬಿಸುತ್ತವೆ. ಪ್ರತಿಯೊಬ್ಬ ಗ್ರಾಹಕರಿಗೂ ಫಲಿತಾಂಶಗಳು ಭಿನ್ನವಾಗಬಹುದು ಮತ್ತು ಯಾವುದೇ ನಿರ್ದಿಷ್ಟ ಗ್ರಾಹಕರಿಗೆ ಫಲಿತಾಂಶದ ಭರವಸೆ ಇಲ್ಲ, ಗ್ರಾಹಕರ ಅನುಭವವು ವಿಭಿನ್ನವಾಗಿರುತ್ತದೆ.
ನಿಮ್ಮ ಆದ್ಯತೆಯ ಭಾಷೆಯನ್ನು ಆಯ್ಕೆಮಾಡಿ
ಪರಿಹಾರಗಳು
ಉ ದ್ಯಮಗಳು
ಸಂಪನ್ಮೂಲಗಳು
ಅನ್ವೇಷಿಸಿ