कॉन्टेंट पर जाएं

ऑडियो टैग्स क्या हैं? इमोशनल टेक्स्ट टू स्पीच की पूरी गाइड

लेखक
Jack Limebear
प्रकाशित
आखिरी बार अपडेट किया गया

सुनेंइस आर्टिकल को सुनें

ऑडियो टैग्स ब्रैकेट में लिखे गए नैचुरल-लैंग्वेज संकेत होते हैं, जैसे [laughs], [gasps], [excited], और [worried], जिन्हें Eleven v3 शब्दों की तरह बोलने के बजाय परफॉर्मेंस डायरेक्शन के रूप में पढ़ता है। जब आप टेक्स्ट टू स्पीच मॉडल के लिए स्क्रिप्ट लिखते हैं, तो इन ऑडियो टैग्स को जोड़ने से आप अपनी राइटिंग की इमोशनल डिलीवरी पर पूरा कंट्रोल पा सकते हैं।Eleven v3 के रिलीज़ होने पर, ऑडियो प्रॉम्प्टिंग अब एक ज़रूरी स्किल बन गई है। अब आपको AI वॉइस से जो भी कहना है, उसे टाइप या पेस्ट करने की बजाय, आप एक नई सुविधा — ऑडियो टैग्स — का इस्तेमाल कर सकते हैं, जिससे आप भावना से लेकर डिलीवरी तक सब कंट्रोल कर सकते हैं।

Eleven v3 एक अल्फा रिलीज़ है रिसर्च प्रीव्यू नए मॉडल का। इसमें पिछले मॉडल्स के मुकाबले ज़्यादा प्रॉम्प्ट इंजीनियरिंग की ज़रूरत है — लेकिन रिजल्ट्स शानदार हैं।

ElevenLabs ऑडियो टैग्स वे शब्द होते हैं जिन्हें स्क्वायर ब्रैकेट्स में लिखा जाता है और नया Eleven v3 मॉडल इन्हें समझकर ऑडियो में इस्तेमाल करता है। ये कुछ भी हो सकते हैं जैसे [excited], [whispers], [sighs], [gunshot], [clapping], या [explosion]।

ऑडियो टैग्स आपको यह तय करने देते हैं कि

इस गाइड में बताया गया है कि ऑडियो टैग्स क्या हैं, ये कैसे काम करते हैं, कौन-कौन से टैग्स उपलब्ध हैं, और ये SSML (Speech Synthesis Markup Language) से कैसे अलग हैं। हम आमतौर पर इस्तेमाल होने वाले यूज़ केस भी बताएंगे, जिनके लिए अलग-अलग गाइड्स भी हैं।

आप अपने स्क्रिप्ट में कहीं भी ऑडियो टैग्स डाल सकते हैं और रियल टाइम में डिलीवरी को ढाल सकते हैं। आप एक ही स्क्रिप्ट या वाक्य में कई टैग्स भी इस्तेमाल कर सकते हैं। टैग्स मुख्य रूप से इन कैटेगरी में आते हैं:

सारांश:

इन टैग्स से आप वॉइस का इमोशनल टोन सेट कर सकते हैं — चाहे वो गंभीर हो, तेज़ हो या खुशमिज़ाज। उदाहरण के लिए आप [sad], [angry], [happily] और [sorrowful] जैसे टैग्स का एक साथ या अलग-अलग इस्तेमाल कर सकते हैं।

Background
Background

ऑडियो टैग्स आपकी ट्रांसक्रिप्ट में इनलाइन रहते हैं और स्क्वायर ब्रैकेट्स में लिखे जाते हैं। जब भी आप डिलीवरी बदलना चाहें, जैसे नॉर्मल से [worried] पर जाना हो, तो बस एक ऑडियो टैग जोड़ दें।

ये टैग्स टोन और परफॉर्मेंस से जुड़े होते हैं। आप इनसे वॉल्यूम और एनर्जी को एडजस्ट कर सकते हैं, खासकर उन सीन के लिए जहां संयम या जोश चाहिए। उदाहरण: [whispers], [shouts] या [x accent]।

Background
Background

मानव प्रतिक्रियाएँ

Eleven v3 की आर्किटेक्चर मॉडल को पहले के मुकाबले ज़्यादा गहराई से कॉन्टेक्स्ट पढ़ने देती है, जिससे ये इमोशनल संकेत, टोन शिफ्ट, स्पीकर ट्रांज़िशन और कॉन्टेक्स्ट क्लूज़ को बिना किसी अलग सेटिंग के फॉलो कर सकती है। बस मॉडल को बताएं कि आपको किस तरह की डिलीवरी चाहिए, और ये लाइन को वैसे ही परफॉर्म करेगा।

Background
Background

Eleven v3 मल्टी-स्पीकर डायलॉग को भी नैचुरल तरीके से हैंडल करता है, जिसमें इंटरप्शन, मूड शिफ्ट और असली बातचीत जैसा नैचुरल बैक-एंड-फोर्थ शामिल है—सिर्फ टैग्स और स्क्रिप्ट स्ट्रक्चर से।

ऑडियो टैग्स बनाम SSML

अगर आपने दूसरे TTS सिस्टम्स के साथ काम किया है, तो आपने शायद Speech Synthesis Markup Language देखा होगा। Amazon Polly और Microsoft Azure Speech जैसे प्लेटफॉर्म SSML टैग्स जैसे <break> या <emphasis> का इस्तेमाल TTS स्क्रिप्ट में एक्स्ट्रा कॉन्टेक्स्ट देने के लिए करते हैं।मल्टी-स्पीकर डायलॉग्स भी बना सकते हैं जो स्पॉन्टेनियस लगते हैं — इंटरप्शन, मूड शिफ्ट और कन्वर्सेशनल नूअंस को बहुत कम प्रॉम्प्टिंग में संभाल सकते हैं।

अब उपलब्ध

Eleven v3 SSML ब्रेक टैग्स या बाकी SSML टैग्स को सपोर्ट नहीं करता। इसकी जगह ऑडियो टैग्स, पंक्चुएशन और टेक्स्ट की स्ट्रक्चर ही ये रोल निभाते हैं, और आपको डिलीवरी पर पूरा कंट्रोल देते हैं।

Eleven v3 अब ElevenLabs UI में उपलब्ध है, और हम जून के अंत तक 80% की छूट दे रहे हैं। Eleven v3 (अल्फा) के लिए पब्लिक API भी उपलब्ध है। चाहे आप एक्सपेरिमेंट कर रहे हों या बड़े पैमाने पर डिप्लॉय, अभी नए फीचर्स आज़माने का सही समय है।

आप नीचे दी गई टेबल का इस्तेमाल करके आम SSML टैग्स को Eleven v3 के बराबर टैग्स से मैच कर सकते हैं।

राइटर के नज़रिए से देखें तो लाइन में [whispers] जोड़ना, प्रोसोदी रेट सेट करने से कहीं आसान है।सिर्फ पढ़ती नहीं, बल्कि परफॉर्म भी करती है ऑडियो टैग्स को अच्छे से समझने पर निर्भर करता है। हमने सात छोटे, प्रैक्टिकल गाइड्स बनाए हैं जो दिखाते हैं कि कैसे [धीरे से फुसफुसाते हुए], [हल्के से हँसते हुए], या [फ्रेंच लहजा] जैसे टैग्स से आप एक ही मॉडल में कॉन्टेक्स्ट, भावना, गति और मल्टी-कैरेक्टर डायलॉग्स को ढाल सकते हैं।

v3 में ऑडियो टैग्स की कैटेगरी: ऑडियो टैग्स से परफॉर्मेंस डायरेक्ट करना

  • सिचुएशनल अवेयरनेस – जैसे टैग्स [धीरे से फुसफुसाते हुए], [चिल्लाते हुए], और [आह भरते हुए] Eleven v3 को मौके के हिसाब से रिएक्ट करने देते हैं—कहीं इंटेंसिटी बढ़ाना, कहीं चेतावनी को सॉफ्ट करना या सस्पेंस के लिए पॉज़ लेना।
  • कैरेक्टर परफॉर्मेंस[समुद्री डाकू की आवाज़] से लेकर [फ्रेंच लहजा] तक, टैग्स नैरेशन को रोल-प्ले में बदल देते हैं। एक ही लाइन में पर्सोना बदलें और बिना मॉडल बदले फुल कैरेक्टर परफॉर्मेंस डायरेक्ट करें।
  • इमोशनल कॉन्टेक्स्ट – जैसे संकेत [आह भरते हुए], [उत्साहित], या [थके हुए] हर पल की भावना को गाइड करते हैं, टेंशन, राहत या ह्यूमर जोड़ते हैं—फिर से रिकॉर्डिंग की ज़रूरत नहीं।
  • नैरेटिव इंटेलिजेंस – कहानी सुनाने में टाइमिंग ज़रूरी है। जैसे टैग्स [रुकावट], [आश्चर्य], या [नाटकीय अंदाज़] रिदम और ज़ोर को कंट्रोल करें ताकि
  • मल्टी-कैरेक्टर डायलॉग – ओवरलैपिंग लाइन्स और तेज़ बातचीत लिखें [बीच में टोकते हुए], [एक-दूसरे पर बोलते हुए], या टोन स्विच के साथ। एक ही मॉडल, कई आवाज़ें—एक ही टेक में नैचुरल कन्वर्सेशन।
  • डिलीवरी कंट्रोल – गति और इम्पहसिस को फाइन-ट्यून करें। जैसे टैग्स [रुकावट], [जल्दी-जल्दी], या [खींचकर बोले हुए] से आप टेम्पो पर सटीक कंट्रोल पाते हैं, जिससे सिंपल टेक्स्ट भी परफॉर्मेंस बन जाता है।
  • एक्सेंट एमुलेशन – तुरंत रीजन बदलें—[अमेरिकन लहजा], [ब्रिटिश लहजा], [साउदर्न US लहजा] और भी बहुत कुछ—कल्चरल टच के साथ स्पीच, बिना मॉडल बदले।

संबंधित लेख

उच्चतम गुणवत्ता वाले AI ऑडियो के साथ बनाएं