Pular para o conteúdo

O que são tags de áudio? Guia completo para TTS emocional

Escrito por
Jack Limebear
Publicado
Última atualização

OuvirOuça este artigo

Tags de áudio são indicações entre colchetes, escritas em linguagem natural, como [risos], [suspiros], [animado] e [preocupado], que o Eleven v3 interpreta como instruções de interpretação, e não como palavras para serem faladas. Ao escrever um roteiro para um modelo de transformar texto em áudio, inserir essas tags de áudio permite que você controle de forma detalhada a entrega emocional do seu texto.Eleven v3, o uso de prompts de áudio se tornou uma habilidade essencial. Em vez de apenas digitar ou colar o texto que você quer que a voz IA fale, agora você pode usar um novo recurso — Tags de Áudio — para controlar desde a emoção até a entrega.

O Eleven v3 é um lançamento alpha prévia de pesquisa do novo modelo. Ele exige mais engenharia de prompt do que os modelos anteriores — mas os resultados são impressionantes.

As Audio Tags ElevenLabs são palavras entre colchetes que o novo modelo Eleven v3 entende e usa para direcionar a ação sonora. Elas podem ser desde [excited], [whispers] e [sighs] até [gunshot], [clapping] e [explosion].

As Tags de Áudio permitem que você defina como as

Este guia explica o que são tags de áudio, como funcionam, todas as categorias de tags disponíveis e como elas se comparam ao SSML (Speech Synthesis Markup Language). Também mostramos casos de uso comuns, cada um com seu próprio guia dedicado.

Você pode colocar Audio Tags em qualquer parte do seu roteiro para ajustar a entrega em tempo real. Também é possível combinar tags dentro de um mesmo texto ou até em uma frase. As tags se dividem em categorias principais:

Resumo:

Essas tags ajudam a definir o tom emocional da voz — seja mais sóbria, intensa ou animada. Por exemplo, você pode usar uma ou combinar [sad], [angry], [happily] e [sorrowful].

Background
Background

As tags de áudio ficam no meio do seu texto e são colocadas entre colchetes. Sempre que quiser mudar a entrega, por exemplo, de normal para [preocupado], basta adicionar uma tag de áudio.

Essas tags são voltadas para o tom e a performance. Você pode usá-las para ajustar o volume e a energia em cenas que pedem mais suavidade ou intensidade. Exemplos: [whispers], [shouts] e até [x accent].

Background
Background

Reações humanas

A arquitetura do Eleven v3 permite que o modelo entenda o contexto de forma mais profunda do que versões anteriores, seguindo indicações emocionais, mudanças de tom, transições de falante e pistas do contexto sem precisar de parâmetros ou configurações extras. Basta indicar ao modelo o que a cena pede, e ele vai interpretar exatamente como você planejou.

Background
Background

O Eleven v3 também lida com diálogos entre vários personagens de forma espontânea, incluindo interrupções, mudanças de humor e o vai e vem natural de uma conversa real, tudo só com tags e a estrutura do roteiro.

Tags de áudio vs. SSML

Se você já usou outros sistemas de TTS, provavelmente conhece o Speech Synthesis Markup Language. Plataformas como Amazon Polly e Microsoft Azure Speech usam tags SSML como <break> ou <emphasis> para dar mais contexto ao roteiro de TTS.diálogos com vários personagens que soam espontâneos — lidando com interrupções, mudanças de humor e nuances de conversa com pouco esforço.

Disponível agora

O Eleven v3 não suporta tags de pausa do SSML nem o restante do conjunto de tags SSML. Em vez disso, as tags de áudio, a pontuação e a própria estrutura do texto assumem esse papel, oferecendo controle detalhado sobre a entrega.

O Eleven v3 já está disponível na interface da ElevenLabs, e estamos oferecendo 80% de desconto até o final de junho. A API pública do Eleven v3 (alpha) também está disponível. Seja para experimentar ou usar em escala, agora é a hora de explorar o que é possível.

Você pode usar a tabela abaixo para comparar tags SSML comuns com o equivalente no Eleven v3.

Para quem escreve, adicionar [sussurra] em uma frase é muito mais simples do que configurar a taxa de prosódia.interpreta — e não apenas lê — depende do domínio das Audio Tags. Preparamos sete guias práticos e diretos que mostram como tags como [SUSSURRO], [RISADA SUAVE], ou [sotaque francês] permitem definir contexto, emoção, ritmo e até diálogos com vários personagens usando um único modelo.

Categorias de tags de áudio no v3: Direcionando a performance com tags de áudio

  • Consciência de situação – Tags como [SUSSURRO], [GRITANDO], e [SUSPIRO] fazem o Eleven v3 reagir ao momento — aumentando a tensão, suavizando alertas ou criando suspense com uma pausa.
  • Performance de personagem – De [voz de pirata] a [sotaque francês], as tags transformam a narração em interpretação. Mude de personagem no meio da fala e direcione performances completas sem trocar de modelo.
  • Contexto emocional – Sinais como [suspiro], [animado], ou [cansado] conduzem as emoções a cada momento, trazendo tensão, alívio ou humor — sem precisar regravar.
  • Inteligência narrativa – Contar histórias é questão de ritmo. Tags como [pausa], [surpreso], ou [tom dramático] controle o ritmo e a ênfase para que
  • Diálogo com vários personagens – Escreva falas sobrepostas e conversas rápidas com [interrompendo], [sobreposição], ou mudanças de tom. Um modelo, várias vozes — conversas naturais em uma só gravação.
  • Controle de entrega – Ajuste ritmo e ênfase. Tags como [pausa], [apressado], ou [prolongado] dão precisão ao tempo, transformando texto simples em interpretação.
  • Emulação de sotaque – Troque de região na hora — [sotaque americano], [sotaque britânico], [sotaque do sul dos EUA] e outros — para falas com riqueza cultural sem trocar de modelo.

Artigos relacionados

Crie com o áudio de IA da mais alta qualidade