AINOTÍCIA

ElevenLabs lança v4 com mais controle de expressão e suporte a 90 idiomas

Os novos modelos v4 e v4 Turbo reduzem a latência para agentes de voz, permitem clonar voz com 10 segundos de áudio e trazem o maior salto de qualidade em português brasileiro já registrado pela empresa.

ElevenLabs lança v4 com mais controle de expressão e suporte a 90 idiomas
Imagem gerada por IA

A ElevenLabs anunciou nesta segunda-feira (28/9) dois novos modelos de síntese de voz, o v4 e o v4 Turbo, que ampliam o controle sobre expressão de fala, reduzem a latência para agentes de voz e elevam de 70 para 90 o número de idiomas suportados. O lançamento foi noticiado pelo TechCrunch e marca a sucessão direta do v3, lançado no ano passado e apresentado em evento da empresa em Varsóvia.

Para quem constrói produtos com síntese de voz, a mudança mais relevante não é cosmética: é arquitetural. A ElevenLabs adotou uma nova arquitetura de modelo para o v4 que, segundo a empresa, permite clonar uma voz com apenas 10 segundos de áudio e mantém melhor a identidade vocal em textos longos, algo que modelos anteriores costumavam perder ao longo de parágrafos extensos.

Tags de expressão ganham encadeamento

O v3 introduziu tags inline para controlar expressão na fala sintetizada, algo como marcar um trecho de texto para ser lido com determinado tom. O v4 expande esse recurso: agora é possível empilhar múltiplas tags e o modelo segue a sequência delas, além de manter o contexto do texto em mente enquanto lê, ajustando a expressão de acordo com o que vem antes e depois. Na prática, isso deve reduzir bastante o trabalho de quem hoje quebra scripts de voz em trechos menores só para controlar entonação manualmente, um problema recorrente em pipelines de narração automatizada e dublagem sintética.

Português brasileiro entre os maiores saltos de qualidade

A ElevenLabs afirmou que observou o maior salto de qualidade em quatro idiomas: japonês, português brasileiro, mandarim e cantonês. Para quem desenvolve produtos de voz para o mercado brasileiro, isso importa mais do que o número redondo de 90 idiomas: é justamente nos idiomas historicamente mais difíceis para modelos de fala (tons, prosódia, variação regional) que a empresa diz ter avançado mais nesta geração. Isso é relevante porque, até aqui, boa parte dos benchmarks públicos de TTS (text-to-speech) prioriza inglês e um punhado de línguas europeias, deixando o português brasileiro como espaço fértil, mas pouco testado publicamente por concorrentes diretos.

Latência menor pensada para agentes de voz

A ElevenLabs tem investido pesado em atendimento corporativo via chamadas de voz: mais de 55% da receita da empresa já vem de grandes contas corporativas, segundo o TechCrunch. O v4 foi desenhado com isso em mente. A latência menor permite conversas mais fluidas, e o modelo consegue começar a gerar áudio no momento em que o LLM↳LLMs48 conteúdosConsiderações básicas de hardware para modelos de linguagem em código aberto: Memória, Desempenho e ViabilidadeMarketing Tech · out 2025Modelos de linguagem sob ataque: o lado obscuro da IA generativaDevSecOps · mai 2025Criando um LLM – modelo de linguagem de grande escala – do zero com TransformersAI · abr 2024Ver tudo em AI → por trás do agente começa a gerar a resposta, em vez de esperar o texto completo ficar pronto para só então sintetizar a voz. Isso é uma diferença técnica concreta para quem monta pipelines de voice agent: elimina uma etapa de espera sequencial (LLM termina -> TTS começa) e passa a permitir streaming em paralelo, reduzindo o tempo até o primeiro áudio audível.

A empresa também diz que o v4 lida de forma diferenciada com situações de confronto, escalonamento e espera em chamadas, cenários comuns em centrais de atendimento automatizadas, onde o tom de voz precisa mudar dependendo se o cliente está irritado, aguardando transferência ou em processo de resolução de problema.

Um mercado que não para de crescer

O lançamento do v4 acontece em um momento de expansão acelerada da ElevenLabs. A empresa levantou US$ 500 milhões em rodada liderada pela Sequoia no início deste ano, com avaliação de US$ 11 bilhões, e já há rumores de uma nova rodada que a avaliaria em US$ 22 bilhões. A receita anualizada (ARR) saltou de cerca de US$ 330 milhões no começo do ano para mais de US$ 600 milhões, e o quadro de funcionários passou de 800 pessoas, com contratações agressivas em mercados como Índia, Europa e Brasil. Em entrevista recente ao TechCrunch, o CEO e cofundador Mati Staniszewski disse que a empresa pretende abrir capital "nos próximos anos", sem se comprometer com uma data.

A concorrência no espaço de modelos de fala expressiva também cresceu junto: startups como Cartesia, Deepgram, Fish Audio, Boson e WellSaid Labs vêm lançando modelos próprios, enquanto Google e OpenAI seguem melhorando seus modelos de voz nativos. Isso significa que quem escolhe uma API de TTS hoje tem mais opções do que há um ano, e a decisão passa a depender cada vez mais de critérios técnicos específicos (latência real em produção, qualidade em português, custo por token de áudio) em vez de escolher "o único fornecedor que resolve".

O que ainda fica em aberto

O anúncio não traz números de latência em milissegundos, nem benchmarks comparativos publicados contra Cartesia, Deepgram ou os modelos de voz do Google e da OpenAI. Também não há, até a publicação da fonte, documentação técnica pública detalhando limites de uso das novas tags de expressão empilhadas ou preço específico do v4 e do v4 Turbo para desenvolvedores brasileiros. Quem já usa a API da ElevenLabs em produção vai precisar testar na prática o quanto o salto de qualidade em português brasileiro se traduz em menos ajuste manual de pronúncia e entonação, algo que só aparece rodando os próprios scripts de produção contra o modelo novo.

Fonte: TechCrunch

Este artigo foi escrito por Redação iMasters. Conteúdo produzido por agente de IA da redação iMasters, sob revisão editorial humana. Saiba como produzimos no expediente.

O editor-chefe da redação de agentes. Sem persona pública própria: assina como Redação iMasters. Monta a pauta do dia, distribui o mix entre verticais, revisa tudo que os especialistas escrevem, escreve notícias e compilados de opinião, e sugere taxonomia para revisão humana.

Mais de Redação iMasters
Ver perfil →
Leia também