O Google DeepMind anunciou em 24 de setembro de 2026 o Gemini 3.8 Live with Live Avatar, recurso que adiciona presença visual em tempo quase real aos modelos de diálogo ao vivo da companhia. A novidade chega uma semana depois do lançamento do Gemini 3.8 Live e já está disponível para uso corporativo no Gemini Enterprise, segundo a publicação oficial assinada por um engenheiro de software em nome do Gemini Audio Team. Na prática, o sistema deixa de ser apenas uma voz que responde e passa a se apresentar como uma persona animada, capaz de ouvir, ver e falar dentro da mesma conversa.
Presença visual em tempo quase real
A base técnica descrita pela equipe é o acoplamento nativo entre as capacidades de diálogo ao vivo e a transmissão de vídeo de baixa latência. Com isso, o avatar gerado acompanha a fala com sincronia labial precisa, expressões naturais e troca de turnos fluida.
Segundo o texto, esses elementos aproximam a interação do ritmo de uma conversa humana.
O modelo processa entradas visuais e de áudio ao mesmo tempo e devolve resposta em áudio e vídeo. O diálogo reage tanto ao que a câmera captura quanto ao que o usuário diz.
A proposta, de acordo com a Google, é tornar os agentes empresariais mais próximos de uma troca multimodal completa. Não uma sequência de perguntas e respostas escritas.
Ferramentas em segundo plano e 97 idiomas
Um detalhe menos visível sustenta a continuidade dessa presença: a execução assíncrona de ferramentas. O Live Avatar dispara chamadas de ferramenta e busca dados em segundo plano enquanto mantém o diálogo ativo.
Isso evita pausas incômodas quando a tarefa exige consultar sistemas externos.
O exemplo citado pela própria Google é o check-in em um hotel. O avatar acessa o sistema hoteleiro e conduz a conversa ao mesmo tempo, sem interromper o fluxo.
A escala linguística é outro ponto destacado no anúncio. O recurso traz sincronização nativa de fala para fala em vários idiomas e alterna entre 97 línguas no meio da conversa.
A sincronia labial e as expressões se adaptam dinamicamente, sem degradar a fidelidade do vídeo nem introduzir desvios visuais perceptíveis.
Avatares sob medida e regras de acesso
Para atender a diferentes necessidades de marca, a Google oferece uma biblioteca com avatares predefinidos e diversos. Também abre espaço para personalização.
A partir de uma imagem de referência de alta qualidade, desenvolvedores podem gerar um avatar totalmente animado e responsivo. O recurso preserva traços da pessoa retratada, elementos de identidade visual ou o estilo de um personagem.
Esse caminho tem porteira. A criação de avatares personalizados está disponível apenas por meio de allowlist para empresas.
O controle sinaliza quem pode replicar aparências e identidades visuais.
Transparência, marca d'água e implicações
A publicação dedica espaço explícito a salvaguardas. Todo conteúdo gerado pelos produtos de IA da empresa recebe marca d'água SynthID, inserida de forma imperceptível no áudio e no vídeo.
O objetivo é manter material sintético detectável e reduzir riscos de desinformação e de atribuição equivocada.
A Google também remete ao model card do modelo de áudio Gemini 3.8 para quem quiser conhecer a abordagem completa de segurança e implantação responsável.
Para o mercado corporativo, o anúncio reposiciona os agentes conversacionais como interface de atendimento e de demonstração de produtos. A companhia cita serviços ao cliente mais envolventes e walkthroughs interativos entre os usos previstos.
Nesses cenários, ver um rosto falar pode tornar a experiência mais acessível do que uma janela de chat.
Quem quiser testar pode acessar o recurso no Gemini Enterprise e consultar a documentação da API para integração. O material não detalha preços, limites de uso nem cronograma para além do allowlist de avatares personalizados.
Esses pontos costumam definir a velocidade de adoção em larga escala.
Fontes e links
- Google DeepMind
- Introducing Gemini 3.8 Live e 3.8 Live Extended Thinking
- Model card do Gemini 3.8 Audio
- SynthID







