CLOSED
S&PNASDAQDOWR2KVIXAAPLMSFTNVDAGOOGLMETAAMZNTSLAAVGOGOLDWTIUSDPEN
Yahoo · 60s · delay ~15min
LIVE
BTCETHSOLXRPADABNBDOGE
CoinGecko · 30s
Google Lanza Nuevos Modelos de Voz para Agentes Inteligentes
Papers

Google Lanza Nuevos Modelos de Voz para Agentes Inteligentes

MarkTechPost (AI/ML News)16 de setiembre de 2026Cortesia de MarkTechPost (AI/ML News)

Segun MarkTechPost (AI/ML News), Google ha presentado dos nuevos modelos de inteligencia artificial especializados en interacciones por voz: Gemini 3.8 Live y Gemini 3.8 Live Extended Thinking. Estos sistemas, desarrollados como soluciones nativas de conversación en voz, están diseñados para integrarse directamente en agentes de voz en producción. Forman parte de la línea Gemini Audio, ampliada recientemente con Gemini 3.5 Transcribe. Su objetivo principal es cerrar una brecha clave: permitir que los agentes de voz realicen razonamientos y ejecuten tareas sin interrumpir el flujo natural de la conversación. Ambos modelos están disponibles hoy en la API Gemini Live y en Google AI Studio, aunque no ofrecen versiones descentralizadas, ya que son modelos alojados y no abiertos al público.

El modelo Gemini 3.8 Live se enfoca en eficiencia operativa y escalabilidad, combinando inteligencia conversacional con una comprensión visual y fluidez en el diálogo. Por su parte, Gemini 3.8 Live Extended Thinking está pensado para tareas complejas, incorporando una capacidad de razonamiento multidimensional que se activa durante la generación de respuesta. En evaluaciones técnicas, este modelo logra una puntuación de 82.6 en el Índice de Calidad de Conversación por Voz de Artificial Analysis, posicionándose como el más avanzado en este criterio. Además, obtiene un 68.6% de éxito en la prueba τ-Voice y un 35.1% en el benchmark τ-Voice-banking de Sierra, destacando su capacidad para aplicaciones financieras. Su desempeño en Big Bench Audio, un test de razonamiento para modelos de audio, alcanza el 97.7%. En comparación, Gemini 3.8 Live ocupa el segundo lugar en el "Speech Agent Arena", un estudio basado en preferencias humanas. En pruebas de fluidez en procesos complejos, los modelos superan el límite de rendimiento establecido por ServiceNow en su EVA-Bench, equilibrando precisión y calidad del diálogo.

Para desarrolladores, la API de Gemini Live ofrece cinco funcionalidades clave, incluyendo llamadas asíncronas a funciones externas. Esto permite a los sistemas ejecutar tareas específicas, como consultas a bases de datos o transacciones, sin romper la narrativa de la interacción. Aunque la tecnología no está disponible para uso local, su integración en plataformas empresariales como la plataforma Enterprise Agent de Google ofrece una puerta de entrada para aplicaciones en sectores como servicios al cliente, atención telefónica y asistentes digitales.

Para los inversores y profesionales del sector peruano, esta evolución en inteligencia vocal representa una oportunidad para modernizar servicios digitales. Muchas empresas locales aún dependen de procesos manuales o de flujos de voz fragmentados. Con estos nuevos modelos, es posible construir agentes que comprendan mejor al usuario, ejecuten tareas de forma autónoma y mantengan una comunicación fluida. Aunque el costo de implementación inicial puede ser alto, el retorno a largo plazo en eficiencia operativa y experiencia del cliente puede justificar la inversión. El sector de servicios en Perú, especialmente en comercio y atención al cliente, podría beneficiarse directamente de esta tecnología, permitiendo automatizar interacciones críticas sin sacrificar la calidad humana.

Google Lanza Nuevos Modelos de Voz para Agentes Inteligentes | Reditua