Os novos modelos v4 e v4 Turbo reduzem a latência para agentes de voz, permitem clonar voz com 10 segundos de áudio e trazem o maior salto de qualidade em português brasileiro já registrado pela empresa.

A ElevenLabs anunciou nesta segunda-feira (28/9) dois novos modelos de síntese de voz, o v4 e o v4 Turbo, que ampliam o controle sobre expressão de fala, reduzem a latência para agentes de voz e elevam de 70 para 90 o número de idiomas suportados. O lançamento foi noticiado pelo TechCrunch e marca a sucessão direta do v3, lançado no ano passado e apresentado em evento da empresa em Varsóvia.
Para quem constrói produtos com síntese de voz, a mudança mais relevante não é cosmética: é arquitetural. A ElevenLabs adotou uma nova arquitetura de modelo para o v4 que, segundo a empresa, permite clonar uma voz com apenas 10 segundos de áudio e mantém melhor a identidade vocal em textos longos, algo que modelos anteriores costumavam perder ao longo de parágrafos extensos.
Tags de expressão ganham encadeamento
O v3 introduziu tags inline para controlar expressão na fala sintetizada, algo como marcar um trecho de texto para ser lido com determinado tom. O v4 expande esse recurso: agora é possível empilhar múltiplas tags e o modelo segue a sequência delas, além de manter o contexto do texto em mente enquanto lê, ajustando a expressão de acordo com o que vem antes e depois. Na prática, isso deve reduzir bastante o trabalho de quem hoje quebra scripts de voz em trechos menores só para controlar entonação manualmente, um problema recorrente em pipelines de narração automatizada e dublagem sintética.
Português brasileiro entre os maiores saltos de qualidade
A ElevenLabs afirmou que observou o maior salto de qualidade em quatro idiomas: japonês, português brasileiro, mandarim e cantonês. Para quem desenvolve produtos de voz para o mercado brasileiro, isso importa mais do que o número redondo de 90 idiomas: é justamente nos idiomas historicamente mais difíceis para modelos de fala (tons, prosódia, variação regional) que a empresa diz ter avançado mais nesta geração. Isso é relevante porque, até aqui, boa parte dos benchmarks públicos de TTS (text-to-speech) prioriza inglês e um punhado de línguas europeias, deixando o português brasileiro como espaço fértil, mas pouco testado publicamente por concorrentes diretos.
Latência menor pensada para agentes de voz
A ElevenLabs tem investido pesado em atendimento corporativo via chamadas de voz: mais de 55% da receita da empresa já vem de grandes contas corporativas, segundo o TechCrunch. O v4 foi desenhado com isso em mente. A latência menor permite conversas mais fluidas, e o modelo consegue começar a gerar áudio no momento em que o LLM↳LLMs48 conteúdosConsiderações básicas de hardware para modelos de linguagem em código aberto: Memória, Desempenho e ViabilidadeMarketing Tech · out 2025Modelos de linguagem sob ataque: o lado obscuro da IA generativaDevSecOps · mai 2025Criando um LLM – modelo de linguagem de grande escala – do zero com TransformersAI · abr 2024Ver tudo em AI → por trás do agente começa a gerar a resposta, em vez de esperar o texto completo ficar pronto para só então sintetizar a voz. Isso é uma diferença técnica concreta para quem monta pipelines de voice agent: elimina uma etapa de espera sequencial (LLM termina -> TTS começa) e passa a permitir streaming em paralelo, reduzindo o tempo até o primeiro áudio audível.
A empresa também diz que o v4 lida de forma diferenciada com situações de confronto, escalonamento e espera em chamadas, cenários comuns em centrais de atendimento automatizadas, onde o tom de voz precisa mudar dependendo se o cliente está irritado, aguardando transferência ou em processo de resolução de problema.
Um mercado que não para de crescer
O lançamento do v4 acontece em um momento de expansão acelerada da ElevenLabs. A empresa levantou US$ 500 milhões em rodada liderada pela Sequoia no início deste ano, com avaliação de US$ 11 bilhões, e já há rumores de uma nova rodada que a avaliaria em US$ 22 bilhões. A receita anualizada (ARR) saltou de cerca de US$ 330 milhões no começo do ano para mais de US$ 600 milhões, e o quadro de funcionários passou de 800 pessoas, com contratações agressivas em mercados como Índia, Europa e Brasil. Em entrevista recente ao TechCrunch, o CEO e cofundador Mati Staniszewski disse que a empresa pretende abrir capital "nos próximos anos", sem se comprometer com uma data.
A concorrência no espaço de modelos de fala expressiva também cresceu junto: startups como Cartesia, Deepgram, Fish Audio, Boson e WellSaid Labs vêm lançando modelos próprios, enquanto Google e OpenAI seguem melhorando seus modelos de voz nativos. Isso significa que quem escolhe uma API de TTS hoje tem mais opções do que há um ano, e a decisão passa a depender cada vez mais de critérios técnicos específicos (latência real em produção, qualidade em português, custo por token de áudio) em vez de escolher "o único fornecedor que resolve".
O que ainda fica em aberto
O anúncio não traz números de latência em milissegundos, nem benchmarks comparativos publicados contra Cartesia, Deepgram ou os modelos de voz do Google e da OpenAI. Também não há, até a publicação da fonte, documentação técnica pública detalhando limites de uso das novas tags de expressão empilhadas ou preço específico do v4 e do v4 Turbo para desenvolvedores brasileiros. Quem já usa a API da ElevenLabs em produção vai precisar testar na prática o quanto o salto de qualidade em português brasileiro se traduz em menos ajuste manual de pronúncia e entonação, algo que só aparece rodando os próprios scripts de produção contra o modelo novo.
Fonte: TechCrunch
Este artigo foi escrito por Redação iMasters. Conteúdo produzido por agente de IA da redação iMasters, sob revisão editorial humana. Saiba como produzimos no expediente.
Aurora DSQL ganha chaves estrangeiras depois de quase dois anos sem suporte
A AWS adicionou constraints de foreign key ao Aurora DSQL, resolvendo o principal bloqueio apontado por quem tentava migrar bancos Postgres tradicionais para o serviço serverless distribuído.













