Gemini 3.8 Live: la IA que piensa mientras habla

Google presentó Gemini 3.8 Live y Gemini 3.8 Live Extended Thinking, dos nuevos modelos diseñados para conversaciones de voz en tiempo real. Pueden interpretar imágenes y video, ejecutar herramientas mientras continúa el diálogo y, en su versión más avanzada, razonar sobre tareas complejas sin interrumpir la conversación.
Google presenta Gemini 3.8 Live, una IA capaz de conversar en tiempo real, interpretar imágenes y ejecutar tareas mientras mantiene el diálogo.
Google presenta Gemini 3.8 Live, una IA capaz de conversar en tiempo real, interpretar imágenes y ejecutar tareas mientras mantiene el diálogo.
Compartir nota:

Google quiere que hablar con una inteligencia artificial se parezca cada vez menos a enviar una consulta y esperar una respuesta. Con ese objetivo, la compañía presentó Gemini 3.8 Live y Gemini 3.8 Live Extended Thinking, dos nuevos modelos centrados en interacciones de voz en tiempo real, capaces de comprender contexto visual, utilizar herramientas y ejecutar tareas mientras mantienen activa la conversación.

Los modelos fueron anunciados oficialmente el 15 de septiembre de 2026 y, según Google, representan sus sistemas de diálogo en vivo más avanzados hasta el momento. La compañía apunta especialmente a asistentes de voz y agentes de inteligencia artificial capaces de acompañar al usuario durante procesos que requieren varios pasos.

La diferencia principal entre ambos está en el nivel de razonamiento. Gemini 3.8 Live prioriza respuestas rápidas y conversaciones fluidas, mientras que Gemini 3.8 Live Extended Thinking puede dedicar más procesamiento a resolver problemas complejos sin dejar al usuario esperando en silencio.

Google presentó Gemini 3.8 Live y Gemini 3.8 Live Extended Thinking, dos modelos diseñados para mantener conversaciones de voz en tiempo real y ejecutar tareas mientras interactúan con el usuario.
Google presentó Gemini 3.8 Live y Gemini 3.8 Live Extended Thinking, dos modelos diseñados para mantener conversaciones de voz en tiempo real y ejecutar tareas mientras interactúan con el usuario.

Qué es Gemini 3.8 Live

Gemini 3.8 Live es un modelo de audio a audio desarrollado para mantener conversaciones de voz con baja latencia. Es decir, puede recibir directamente la voz del usuario y generar una respuesta hablada sin depender exclusivamente de una cadena tradicional de conversión de voz a texto y nuevamente de texto a voz.

Según la documentación de Google, esta versión fue diseñada como la opción predeterminada para la mayoría de las experiencias con agentes de voz que necesitan respuestas rápidas y diálogos en tiempo real.

Pero su funcionamiento no se limita al audio. El modelo admite como entrada texto, imágenes, audio y video, por lo que puede combinar lo que escucha con información visual para comprender mejor una situación.

Esto permite, por ejemplo, apuntar una cámara hacia un objeto o una pantalla y realizar preguntas mientras Gemini interpreta lo que está viendo.

Google mostró esta capacidad con demostraciones en las que Gemini acompaña procesos de incorporación de empleados utilizando contexto visual o analiza una partida de ajedrez mientras conversa con el usuario en tiempo casi real.

Puede entender imágenes y cambiar de idioma durante una conversación

Una de las mejoras destacadas es el denominado visual grounding, es decir, la capacidad de relacionar una conversación con elementos que aparecen en imágenes o video.

Gemini 3.8 Live procesa estas entradas visuales prácticamente en tiempo real y las utiliza como contexto para generar respuestas.

También puede detectar automáticamente y alternar entre 97 idiomas durante una misma conversación, según Google. Esto significa que una persona puede cambiar de idioma al hablar sin tener que configurar manualmente una nueva sesión.

El objetivo es que la interacción sea menos rígida y pueda adaptarse mejor a una conversación natural, en la que existen interrupciones, cambios de contexto o nuevas instrucciones.

Gemini 3.8 Live busca reducir la latencia de las conversaciones con IA y responder de forma más natural durante un diálogo hablado.
Gemini 3.8 Live busca reducir la latencia de las conversaciones con IA y responder de forma más natural durante un diálogo hablado.

Qué cambia con Gemini 3.8 Live Extended Thinking

Para las consultas que necesitan mayor análisis, Google desarrolló Gemini 3.8 Live Extended Thinking.

La principal diferencia es que este modelo incorpora razonamiento en segundo plano durante una conversación de voz.

Hasta ahora, uno de los problemas de los asistentes que utilizan herramientas externas era el silencio que se producía mientras el sistema esperaba información o procesaba una tarea. Extended Thinking intenta resolver esa situación manteniendo activo el diálogo.

Por ejemplo, puede recibir una solicitud compleja, comenzar a trabajar sobre ella y responder con frases breves para indicar que está procesando determinada información mientras continúa utilizando herramientas en segundo plano.

Google explica que el modelo puede razonar y hablar simultáneamente, además de narrar avances mientras ejecuta procesos que requieren varios pasos.

Una IA que puede seguir hablando mientras realiza otras tareas

Esta arquitectura resulta especialmente relevante para los agentes de IA.

Supongamos que un usuario pide organizar un viaje. El sistema podría necesitar buscar vuelos, consultar hoteles, comparar precios y combinar los resultados antes de ofrecer una respuesta definitiva.

Con Extended Thinking, esas operaciones pueden ejecutarse mediante llamadas asíncronas a herramientas, mientras Gemini mantiene la interacción con el usuario.

La documentación oficial menciona precisamente escenarios como reservas de viajes, asistencia técnica con múltiples verificaciones, resolución de problemas de programación o análisis de fórmulas y tareas STEM.

Google también mostró una demostración en la que el modelo transforma bocetos y comentarios realizados por voz en componentes funcionales de React, modificándolos mientras recibe nuevas instrucciones.

El objetivo es que la voz deje de utilizarse solamente para hacer preguntas rápidas y pueda convertirse en una interfaz para controlar flujos de trabajo más amplios.

Los nuevos modelos combinan conversación, contexto multimodal y uso de herramientas para acercar Gemini al funcionamiento de un agente capaz de coordinar distintas tareas.
Los nuevos modelos combinan conversación, contexto multimodal y uso de herramientas para acercar Gemini al funcionamiento de un agente capaz de coordinar distintas tareas.

Gemini 3.8 Live y Extended Thinking: cuáles son las diferencias

Aunque ambos pertenecen a la misma generación, están pensados para situaciones distintas.

Gemini 3.8 Live está orientado a conversaciones rápidas y tareas directas. Puede razonar durante la interacción, utilizar funciones y ejecutar herramientas, pero mantiene un perfil de latencia diseñado para responder con rapidez.

Gemini 3.8 Live Extended Thinking, en cambio, está pensado para procesos que necesitan planificación, análisis de varios pasos o herramientas que pueden tardar más tiempo en devolver resultados. Su nivel de razonamiento puede configurarse en bajo, medio o alto mediante la API.

Ambos modelos tienen un límite de entrada de 131.072 tokens y uno de salida de 65.536 tokens, según la documentación para desarrolladores de Google.

Gemini se acerca al concepto de agente de IA

La evolución resulta importante porque muestra hacia dónde está llevando Google a Gemini.

En lugar de limitarse a responder preguntas, los nuevos modelos están preparados para utilizar APIs y herramientas externas, mantener contexto multimodal y ejecutar acciones mientras continúa una conversación.

Esto acerca el asistente al concepto de agente de IA: un sistema al que una persona puede asignarle un objetivo y que posteriormente coordina distintos pasos para intentar completarlo.

Google posiciona a Gemini 3.8 Live especialmente para interacciones rápidas, como asistentes de atención al cliente, búsquedas por voz o aplicaciones interactivas. Extended Thinking amplía ese escenario hacia procesos que necesitan coordinar varias fuentes de información o herramientas antes de completar una tarea.

Google mostró cómo Gemini puede transformar instrucciones y bocetos realizados por voz en componentes funcionales de React y modificarlos a partir de nuevas indicaciones.
Google mostró cómo Gemini puede transformar instrucciones y bocetos realizados por voz en componentes funcionales de React y modificarlos a partir de nuevas indicaciones.

Dónde está disponible Gemini 3.8 Live

Google comenzó el despliegue de ambos modelos el 15 de septiembre de 2026.

Para desarrolladores, Gemini 3.8 Live y Gemini 3.8 Live Extended Thinking están disponibles mediante Gemini API y Google AI Studio. Google también confirmó su incorporación progresiva a productos destinados a usuarios y empresas.

Gemini 3.8 Live comenzó a llegar a Search Live, mientras que Extended Thinking se está incorporando a Gemini Live.

En Google Workspace, Extended Thinking está disponible para suscriptores de Google AI Pro y Ultra en Docs, mientras que Google indicó que los suscriptores de Google AI pueden acceder a estas capacidades en Gmail y Keep, sujeto al despliegue correspondiente. Para clientes empresariales, los modelos también están llegando mediante Gemini Enterprise y otros productos de la compañía.

Google incorpora SynthID al audio generado

El crecimiento de las conversaciones generadas por IA también plantea interrogantes alrededor de la identificación del contenido sintético.

Google informó que todo el audio producido por sus productos de inteligencia artificial incorpora SynthID, su tecnología de marca de agua digital.

La identificación es imperceptible durante la reproducción normal, pero queda integrada en el contenido para facilitar la detección de audio generado mediante inteligencia artificial.

Con Gemini 3.8 Live y Extended Thinking, Google da así otro paso hacia asistentes capaces de mantener una conversación mientras interpretan lo que ocurre alrededor, utilizan servicios externos y trabajan sobre tareas más largas. La apuesta ya no pasa únicamente por conseguir que la IA responda mejor, sino por lograr que pueda razonar y actuar sin romper el flujo natural del diálogo.

Preguntas frecuentes

  1. ¿Qué es Gemini 3.8 Live? Gemini 3.8 Live es un modelo de Google diseñado para conversaciones de voz en tiempo real. Puede recibir texto, imágenes, audio y video, interpretar contexto visual, utilizar herramientas y generar respuestas habladas con baja latencia.
  2. ¿Qué diferencia hay entre Gemini 3.8 Live y Live Extended Thinking? Gemini 3.8 Live prioriza conversaciones rápidas y tareas directas. Live Extended Thinking incorpora razonamiento más profundo en segundo plano y está diseñado para resolver problemas complejos que requieren planificación, múltiples pasos o el uso de varias herramientas.
  3. ¿Dónde se puede usar Gemini 3.8 Live Extended Thinking? Google comenzó a desplegarlo en Gemini Live, Gemini API y Google AI Studio. También está llegando a productos de Workspace como Docs, Gmail y Keep para determinados planes, además de soluciones empresariales de Gemini.
Compartir nota:

Publicaciones Relacionadas

Scroll to Top