Ir al contenido
Español
Contenido de FikirPilot

Presentados Gemini 3.8 Live y 3.8 Live Extended Thinking

Actualizado: 15/09/2026 · 3 min de lectura · 542 palabras

Publicado: · Noticia recibida: · Tiempo de procesamiento: 2 h 47 min

Presentados Gemini 3.8 Live y 3.8 Live Extended Thinking
Teléfono con pantalla digital sobre una mesa

Google presentó los modelos Gemini 3.8 Live y Gemini 3.8 Live Extended Thinking, que buscan hacer que las interacciones por voz sean más naturales, fluidas e inteligentes. Los modelos ofrecen razonamiento complejo, contexto visual en tiempo real y la capacidad de ejecutar tareas en segundo plano sin interrumpir la conversación. Desde hoy, los usuarios pueden acceder a los modelos mediante Gemini API, Google Workspace y la aplicación Gemini.

Gemini 3.8 Live Extended Thinking ocupó el primer puesto de la clasificación general del Speech to Speech Quality Index de Artificial Analysis, con 82,6 puntos. En el ámbito de la finalización de tareas, el modelo obtuvo un 68,6 % en τ-Voice, un 35,1 % en la prueba τ-Voice-banking de Sierra y un 97,7 % en Big Bench Audio. Gemini 3.8 Live se situó en segundo lugar en Speech Agent Arena. En la evaluación EVA-Bench de ServiceNow, los modelos mejoraron la frontera de Pareto en flujos de trabajo complejos al equilibrar la precisión y la calidad de la conversación.

Gemini 3.8 Live procesa las entradas visuales casi en tiempo real para añadir contexto a las conversaciones y puede cambiar automáticamente entre los 97 idiomas compatibles durante una conversación. Puede mantener el diálogo mientras ejecuta herramientas y llamadas API en segundo plano. Mediante el contexto visual, puede orientar a los empleados durante los procesos de incorporación y jugar al ajedrez.

Por su parte, Gemini 3.8 Live Extended Thinking piensa y habla al mismo tiempo, comunicando verbalmente su progreso en tareas de varias etapas. Puede convertir bocetos sin procesar y comentarios de voz en componentes funcionales de React, así como preparar mediante la conversación reservas, llamadas asíncronas a funciones, planes de negocio y herramientas de marketing.

El modelo está disponible en Docs Live, Gmail Live y Keep Live. Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel y Vision Agents permiten desarrollar interfaces de voz con Gemini Live API. Google también trabaja con Salesforce, Genspark y Lumeris. Todas las voces generadas se marcan con SynthID para que puedan detectarse frente a la desinformación.

Por qué es importante

Este anuncio lleva el uso de la inteligencia artificial por voz más allá del mero formato de preguntas y respuestas, y ofrece un marco que combina el contexto visual, el uso de herramientas y los flujos de trabajo de varias etapas en una misma interacción. Por ello, crea nuevas posibilidades de aplicación, especialmente para quienes utilizan Google Workspace, los desarrolladores y las empresas que crean interfaces conversacionales. Los resultados de los modelos en distintas pruebas muestran que Google evalúa conjuntamente el equilibrio entre la calidad de la voz y la ejecución de tareas; sin embargo, sigue sin estar claro hasta qué punto estas comparaciones se reflejarán en el uso cotidiano en tareas como realizar reservas, preparar planes de negocio u ofrecer orientación sobre el cumplimiento normativo. Si bien el marcado de las voces con SynthID busca ayudar a distinguir el contenido generado, la forma en que esto influirá en las decisiones de confianza de los usuarios también sigue siendo una cuestión que habrá que observar.

Antecedentes

Gemini no es un nombre nuevo en el archivo de FikirPilot: en los últimos 90 días publicamos 10 noticias en las que se mencionó este nombre; la más reciente está fechada el 8 de septiembre de 2026.

Fuente: Google DeepMind