Tecnologia e Inovações

Google lança Gemini 3.8 Flash TTS e Flash-Lite TTS para geração de voz

Novos modelos ampliam o controle sobre interpretação, sotaques e identidade vocal, com uma versão voltada à criação e outra destinada à produção de áudio em grande escala.

O Google ampliou sua estratégia de inteligência artificial para áudio com dois modelos que atendem necessidades diferentes, desde performances vocais altamente personalizadas até operações que exigem grande volume de conteúdo. O Gemini 3.8 Flash TTS concentra os recursos criativos mais avançados, enquanto o Gemini 3.8 Flash-Lite TTS busca oferecer uma alternativa mais eficiente para dublagem, agentes de voz e produção recorrente.

Flash TTS transforma comandos em direção vocal

A principal mudança do Gemini 3.8 Flash TTS está na possibilidade de definir uma identidade vocal por meio de instruções escritas, sem depender apenas de vozes previamente configuradas.

O usuário pode determinar características como ritmo, sotaque, intensidade, estilo interpretativo e outras nuances, com suporte a mais de 100 idiomas e dialetos.

Esse controle também alcança cada trecho de um roteiro, o que permite atribuir interpretações diferentes a frases específicas dentro de uma mesma produção.

Pausas, risadas, suspiros, sussurros e interjeições podem fazer parte dessa direção, recurso voltado a diálogos que precisam transmitir emoção com maior precisão.

Para projetos que não exigem uma identidade criada do zero, o Google oferece uma biblioteca superior a 2 mil vozes, com opções que contemplam diferentes regiões e características de fala.

A empresa também prepara uma função de remix capaz de alterar aspectos como timbre, velocidade, altura e sotaque de perfis vocais já disponíveis.

A plataforma permite ainda reproduzir uma voz com uma amostra de aproximadamente 30 segundos, desde que exista autorização do proprietário antes da criação do perfil correspondente.

O Google exige uma etapa de verificação de consentimento para esse processo, enquanto as vozes aprovadas podem permanecer salvas para reutilização e maior consistência entre diferentes projetos.

Essa continuidade também aparece em conteúdos extensos, pois os modelos foram preparados para evitar mudanças perceptíveis de identidade vocal ao longo de podcasts e audiolivros.

Em cenas com duas pessoas, o sistema consegue separar os personagens e preservar características próprias durante a alternância das falas ao longo do diálogo.

Flash-Lite leva geração de voz para operações em escala

O Gemini 3.8 Flash-Lite TTS ocupa outra posição dentro da estratégia, com foco em empresas que precisam transformar grandes volumes de texto em áudio com maior eficiência operacional.

Essa proposta atende principalmente serviços de dublagem, localização de conteúdo e agentes de voz, nos quais velocidade, custo e capacidade de produção possuem peso maior.

A qualidade continua relevante nessa faixa, e as avaliações apresentadas pelo Google colocaram os novos modelos entre os resultados mais altos em preferência humana e desempenho geral.

O Flash TTS também alcançou a primeira posição no Voice Design Benchmark da Hume AI, além de apresentar resultados destacados em tarefas relacionadas à reprodução de sotaques.

Os testes citados pela empresa contemplaram vários idiomas e variedades regionais, entre elas português brasileiro, árabe, hindi, japonês, vietnamita e espanhol mexicano.

Esse alcance amplia o interesse comercial dos modelos para empresas que distribuem o mesmo conteúdo entre mercados com necessidades linguísticas e culturais diferentes.

O Google também incorporou mecanismos destinados a identificar a origem do material sintético, com marca d’água SynthID aplicada aos áudios produzidos pelos novos modelos.

Credenciais C2PA e controles de consentimento complementam essa estrutura, especialmente em aplicações nas quais identidade vocal e rastreabilidade podem gerar riscos de uso indevido.

Para desenvolvedores, os dois modelos já podem ser utilizados pelo Gemini API e pelo Google AI Studio, enquanto outros produtos recebem implementações específicas conforme o perfil de uso.

O Flash TTS passa a integrar o Gemini Notebook, enquanto o Flash-Lite TTS será utilizado pelo Google Vids e também deverá chegar posteriormente ao Gemini Enterprise por API.

Empresas como Figma, HeyGen, Linguana, Wondercraft, 99.co e Ollang já começaram a adotar os novos recursos em produtos ligados a voz, localização e conteúdo.

A estratégia mostra que o Google pretende disputar tanto a criação vocal sofisticada quanto o mercado de produção automatizada, com uma mesma família destinada a necessidades bastante diferentes.

Carlos Aono

Colunista no segmento Tecnologia e Inovações | CTOO do Grupo Ideal Trends, é especialista em tecnologia e inovação há mais de 9 anos. Sua missão como colunista do portal é traduzir tendências tecnológicas em insights estratégicos para negócios e para a sociedade.

Artigos relacionados

Deixe um comentário

O seu endereço de e-mail não será publicado. Campos obrigatórios são marcados com *

Botão Voltar ao topo