POR QUE ISSO IMPORTA
O Google lançou Gemini 3.8 Live e Gemini 3.8 Live Extended Thinking, modelos de voz que executam ferramentas e raciocinam em segundo plano sem interromper a conversa. O lançamento chega à API, ao AI Studio e a produtos do Google em rollout progressivo.Neste artigo
CONFIRMADO
O Google lançou Gemini 3.8 Live e Gemini 3.8 Live Extended Thinking, dois modelos de diálogo ao vivo que tentam resolver o maior defeito dos agentes de voz: quando a tarefa fica complexa, a conversa congela. A proposta agora é outra. O sistema pode continuar falando, reconhecer o pedido e trabalhar em segundo plano enquanto consulta ferramentas, processa contexto visual ou executa uma sequência de ações.
Duas velocidades para a mesma conversa
O Gemini 3.8 Live foi desenhado para escala, custo e baixa latência. Ele combina diálogo fluido com compreensão visual em tempo quase real e pode detectar e alternar entre 97 idiomas durante a conversa. Já o Live Extended Thinking mira tarefas mais pesadas, com planejamento em várias etapas e raciocínio paralelo. Na prática, é uma separação importante entre o agente que precisa responder rápido e o agente que precisa concluir algo sem abandonar o usuário no silêncio.
A mudança é operacional, não só sonora
A novidade mais relevante para quem constrói produto está no uso não bloqueante de ferramentas. O agente pode dizer que vai verificar uma informação, manter sinais de progresso e continuar a interação enquanto uma chamada assíncrona termina. Isso serve para reservas, suporte, onboarding, busca em documentos, atendimento e experiências de voz como as que precisam consultar sistemas externos sem parecer que caíram. O Extended Thinking também pode raciocinar e falar ao mesmo tempo, usando frases curtas para manter o turno vivo.
Onde já está chegando
O rollout começou em 15 de setembro. O Gemini 3.8 Live chega à Gemini API e ao Google AI Studio para desenvolvedores, além de Search Live para o público e de uma prévia privada no Gemini Enterprise. O Extended Thinking aparece na Gemini API, no AI Studio, no Gemini App e em recursos do Google Workspace, incluindo Docs, Gmail e Keep, com disponibilidade variando por produto e assinatura. A documentação e o model card oficial descrevem a família como baseada no Gemini 3 Pro, com entrada multimodal de áudio, imagem, vídeo e texto, contexto de até 128 mil tokens e saída de áudio e texto de até 64 mil tokens.
Benchmark não é licença para acreditar em tudo
O Google afirma que o Extended Thinking marcou 82,6 no Speech to Speech Quality Index da Artificial Analysis, 68,6% no τ-Voice, 35,1% no benchmark bancário da Sierra e 97,7% no Big Bench Audio. A empresa também diz que o Live ficou em segundo lugar na Speech Agent Arena. São números relevantes para a direção do produto, mas continuam sendo resultados divulgados pelo próprio Google, com configurações e condições que precisam ser reproduzidas antes de virar decisão de arquitetura ou promessa comercial.
A leitura do MaxAssistant
Este é um lançamento importante porque transforma latência de ferramenta em parte visível da experiência, em vez de tratá-la como problema do backend. Para agentes de voz, falar enquanto trabalha pode ser mais valioso que simplesmente falar com uma voz mais bonita. O ponto de atenção é o rollout: parte da oferta ainda está em prévia ou limitada a assinantes. Quem for testar deve separar o endpoint rápido do endpoint de raciocínio e manter a integração preparada para mudanças de disponibilidade, custo e comportamento.
Fontes
Google, Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking: https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-live-gemini-3-8-live-extended-thinking/ Google DeepMind, Gemini 3.8 Audio model card: https://deepmind.google/models/model-cards/gemini-3-8-audio/ Google AI for Developers, Thinking in the Live API: https://ai.google.dev/gemini-api/docs/live-api/thinking