Google lanza Gemini 3.8 Live: los nuevos modelos de voz que lideran el ranking de speech-to-speech

Google lanza Gemini 3.8 Live: los nuevos modelos de voz que lideran el ranking de speech-to-speech

Gadgets — Google ha lanzado Gemini 3.8 Live y Gemini 3.8 Live Extended Thinking, dos modelos de voz en tiempo real diseñados para agentes de IA conversacionales. Ambos modelos llegan a un rendimiento de frontera a un costo aproximado de $0,84 por hora, con un puntaje compuesto superior a GPT-Realtime-2 High a un costo aproximadamente 80% menor.

Gemini 3.8 Live

Este modelo está diseñado para conversaciones fluidas y en tiempo real. Es multimodal: la voz es la interfaz principal, pero también puede procesar información visual durante una conversación y cambiar automáticamente entre los 97 idiomas soportados. El modelo está orientado a agentes de voz en producción, no a interacciones tradicionales basadas en texto.

Extended Thinking: el avance clave

La variante Extended Thinking es donde reside el mayor salto de capacidad. Esta versión no solo procesa la voz, sino que puede razonar y hablar simultáneamente, permitiendo a los usuarios escuchar el progreso mientras se completan tareas complejas. El modelo gestiona herramientas en segundo plano mientras mantiene la conversación fluida.

Benchmark τ-Voice

En el benchmark τ-Voice, que no solo mide si una IA suena natural sino si puede completar tareas complejas de servicio al cliente de múltiples pasos mientras sigue políticas, utiliza correctamente las herramientas y llega al resultado correcto, Gemini 3.8 Live Extended Thinking obtiene un 68,6%, superando por poco a GPT-Live-1 Astra Medium (67,9%).

Costos revolucionarios

El precio de $0,84 por hora de operación hace que estos modelos sean significativamente más accesibles que las alternativas de la competencia, abriendo la puerta a agentes de voz de producción a una escala sin precedentes.

Fuentes y créditos:

Ver publicación