Vad är ljudtaggar? Komplett guide till emotionell TTS
- Skriven av
- Jack Limebear
- Publicerad
- Senast uppdaterad
Ljudtaggar är naturliga språkliga ledtrådar inom hakparenteser, som [skrattar], [flämtar], [exalterad] och [orolig], som Eleven v3 tolkar som instruktioner för hur något ska framföras istället för ord som ska läsas upp. När du skriver ett manus för en text to speech-modell ger dessa ljudtaggar dig detaljerad kontroll över hur känslorna förmedlas.Eleven v3 har audio prompting blivit en viktig färdighet. Istället för att bara skriva eller klistra in det du vill att AI-rösten ska säga, kan du nu använda en ny funktion – Ljudtaggar – för att styra allt från känsla till leverans.
Eleven v3 är en alpha-version forskningsförhandsvisning av den nya modellen. Den kräver mer prompt engineering än tidigare modeller – men resultaten är imponerande.
ElevenLabs Audio Tags är ord inom hakparenteser som den nya Eleven v3-modellen kan tolka och använda för att styra ljudet. Det kan vara allt från [excited], [whispers] och [sighs] till [gunshot], [clapping] och [explosion].
Med Audio Tags kan du styra hur
I den här guiden går vi igenom vad ljudtaggar är, hur de fungerar, vilka kategorier som finns och hur de skiljer sig från SSML (Speech Synthesis Markup Language). Vi visar också vanliga användningsområden, med länkar till egna guider för varje.
Du kan placera Audio Tags var som helst i ditt manus för att styra leveransen i realtid. Du kan också kombinera flera tags i ett manus eller till och med i en mening. Tags delas in i huvudkategorier:
Sammanfattning:
Dessa tags hjälper dig att sätta känsloläget på rösten – oavsett om det är sorgligt, intensivt eller glatt. Du kan till exempel använda en eller flera av [sad], [angry], [happily] och [sorrowful].
Ljudtaggar placeras direkt i manuset och skrivs inom hakparenteser. När du vill ändra leveransen, till exempel från neutral till [orolig], lägger du bara till en ljudtagg.
Dessa handlar mer om ton och uttryck. Använd dem för att justera volym och energi i scener som kräver återhållsamhet eller kraft. Exempel: [whispers], [shouts] och även [x accent].
Mänskliga reaktioner
Arkitekturen bakom Eleven v3 gör att modellen kan läsa av sammanhang på ett djupare plan än tidigare versioner. Den följer känslomässiga ledtrådar, tonväxlingar, talarbyten och kontext utan att du behöver ställa in extra parametrar. Säg bara vad du vill ha, så levererar modellen precis som du tänkt dig.
Eleven v3 hanterar också dialog mellan flera röster på ett naturligt sätt, med avbrott, stämningsskiften och det spontana samspelet som finns i verkliga samtal – allt styrt av taggar och manusets struktur.
Ljudtaggar vs. SSML
Om du har jobbat med andra TTS-system har du säkert stött på Speech Synthesis Markup Language. Plattformar som Amazon Polly och Microsoft Azure Speech använder SSML-taggar som <break> eller <emphasis> för att ge extra kontext till ett TTS-manus.dialoger med flera röster som känns spontana – med avbrott, skiftande stämningar och nyanserad konversation med minimalt promptande.
Tillgängligt nu
Eleven v3 stöder inte SSML-breaktaggar eller andra SSML-taggar. Istället tar ljudtaggar, skiljetecken och själva textens struktur över rollen – och ger dig dessutom mer exakt kontroll över leveransen.
Eleven v3 finns i ElevenLabs-gränssnittet, och vi erbjuder 80% rabatt till slutet av juni. Publikt API för Eleven v3 (alpha) är också tillgängligt. Oavsett om du experimenterar eller kör i stor skala är det nu du kan utforska möjligheterna.
I tabellen nedan kan du se hur vanliga SSML-taggar motsvaras av Eleven v3-taggar.

För dig som skriver är det mycket enklare att lägga till [viskar] i en replik än att ställa in prosody rate.presterar – inte bara läser – handlar om att bemästra Audio Tags. Vi har tagit fram sju korta, praktiska guider som visar hur tags som [VISKAR], [SKRATTAR TYST], eller [Fransk accent] låter dig styra sammanhang, känsla, tempo och till och med dialog mellan flera karaktärer med en enda modell.
Kategorier av ljudtaggar i v3: Så styr du leveransen med ljudtaggar
- Situationsanpassning – Tags som
[VISKAR],[ROPAR]och[SUCKAR]gör att Eleven v3 kan reagera på stunden – höja spänningen, mildra varningar eller pausa för effekt. - Karaktärsprestation – Från
[piratröst]till[Fransk accent]förvandlar tags berättande till rollspel. Byt personlighet mitt i en replik och styr hela karaktärsprestationer utan att byta modell. - Känslomässigt sammanhang – Signaler som
[suckar],[entusiastisk]eller[trött]styr känslan i stunden, lägger på spänning, lättnad eller humor – utan att spela in på nytt. - Berättarintelligens – Berättande handlar om timing. Tags som
[paus],[imponerad]eller[dramatisk ton]styr rytm och betoning så att - Dialog med flera röster – Skriv överlappande repliker och snabba replikskiften med
[avbryter],[överlappar]eller tonväxlingar. En modell, många röster – naturlig konversation i en tagning. - Leveranskontroll – Finjustera tempo och betoning. Tags som
[paus],[stressat]eller[utdraget]ger dig kontroll över tempot och gör texten till en prestation. - Accentimitation – Byt region direkt –
[Amerikansk accent],[Brittisk accent],[Sydstatsaccent (USA)]och fler – för kulturellt rikt tal utan att byta modell.









