POR QUÉ IMPORTA
Google lanzó Gemini 3.8 Live y Gemini 3.8 Live Extended Thinking, modelos de voz que ejecutan herramientas y razonan en segundo plano sin interrumpir la conversación. El lanzamiento llega de forma gradual a la API, AI Studio y productos de Google.En este artículo
CONFIRMADO
Google lanzó Gemini 3.8 Live y Gemini 3.8 Live Extended Thinking, dos modelos de diálogo en vivo que buscan resolver la mayor debilidad de los agentes de voz: la conversación se detiene cuando la tarea se vuelve compleja. El nuevo enfoque permite que el sistema siga hablando, reconozca la solicitud y trabaje en segundo plano mientras usa herramientas, procesa contexto visual o ejecuta una secuencia de acciones.
Dos velocidades para una misma conversación
Gemini 3.8 Live está diseñado para escala, eficiencia de costos y baja latencia. Combina diálogo fluido con comprensión visual casi en tiempo real y puede detectar y cambiar entre 97 idiomas durante una conversación. Live Extended Thinking apunta a tareas más exigentes, con planificación en varias etapas y razonamiento paralelo. La diferencia importa para quienes construyen productos: un agente necesita responder de inmediato, mientras otro debe completar una tarea compleja sin dejar al usuario en silencio.
El cambio es operativo, no solo de voz
La función más importante para los equipos de producto es el uso de herramientas sin bloqueo. El agente puede reconocer que está verificando algo, mostrar señales de progreso y mantener activa la interacción mientras termina una llamada asíncrona. Esto encaja en reservas, soporte, onboarding, búsqueda documental, atención al cliente y cualquier experiencia de voz que deba consultar sistemas externos sin parecer detenida. Extended Thinking también puede razonar y hablar al mismo tiempo, usando señales verbales breves para mantener activo el turno.
Dónde está llegando
El despliegue comenzó el 15 de septiembre. Gemini 3.8 Live llega a Gemini API y Google AI Studio para desarrolladores, a Search Live para el público y a una vista previa privada en Gemini Enterprise. Extended Thinking se está desplegando en Gemini API, AI Studio, la aplicación Gemini y funciones de Google Workspace como Docs, Gmail y Keep, con disponibilidad que varía según el producto y la suscripción. La documentación y la tarjeta de modelo de Google describen la familia como basada en Gemini 3 Pro, con entrada multimodal de audio, imagen, video y texto, contexto de hasta 128K tokens y salida de audio y texto de hasta 64K tokens.
Los benchmarks no son un cheque en blanco
Google afirma que Extended Thinking obtuvo 82,6 en el Speech to Speech Quality Index de Artificial Analysis, 68,6% en τ-Voice, 35,1% en el benchmark bancario de Sierra y 97,7% en Big Bench Audio. La empresa también dice que el modelo Live estándar quedó segundo en Speech Agent Arena. Son señales relevantes sobre la dirección del producto, pero siguen siendo resultados comunicados por Google, con configuraciones y condiciones que deben reproducirse antes de orientar una arquitectura o una promesa comercial.
La lectura de MaxAssistant
Este lanzamiento importa porque convierte la latencia de las herramientas en parte visible de la experiencia, en vez de dejarla como un problema del backend. Para los agentes de voz, hablar mientras trabajan puede ser más valioso que simplemente tener una voz más bonita. La cautela está en el despliegue: una parte de la oferta sigue en vista previa o limitada a suscriptores. Al probarla, conviene separar el endpoint rápido del endpoint de razonamiento y mantener la integración preparada para cambios de disponibilidad, costo y comportamiento.
Fuentes
Google, Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking: https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-live-gemini-3-8-live-extended-thinking/ Google DeepMind, Gemini 3.8 Audio model card: https://deepmind.google/models/model-cards/gemini-3-8-audio/ Google AI for Developers, Thinking in the Live API: https://ai.google.dev/gemini-api/docs/live-api/thinking