CLOSED
S&PNASDAQDOWR2KVIXAAPLMSFTNVDAGOOGLMETAAMZNTSLAAVGOGOLDWTIUSDPEN
Yahoo · 60s · delay ~15min
LIVE
BTCETHSOLXRPADABNBDOGE
CoinGecko · 30s
Google Lanza Gemini 3.5 Transcribe para transcripción en tiempo real
Papers

Google Lanza Gemini 3.5 Transcribe para transcripción en tiempo real

MarkTechPost (AI/ML News)28 de agosto de 2026Cortesia de MarkTechPost (AI/ML News)

Segun MarkTechPost (AI/ML News), Google ha lanzado Gemini 3.5 Transcribe, una herramienta de conversión de voz a texto diseñada para interfaces de voz en tiempo real y archivos grabados. La solución se entrega como dos servicios independientes: uno para archivos pregrabados y otro para transcripción en vivo mediante flujo bidireccional. El modelo gemini-3.5-transcribe se integra a través de la API de Interacciones, mientras que el servicio en vivo, gemini-3.5-transcribe-live, opera mediante la API de Live, permitiendo una transcripción continua con latencia reducida. Los resultados de precisión muestran un error promedio del 4,0% en transcripciones en vivo y del 2,6% en archivos ya grabados, según análisis realizados por Artificial Analysis. Este avance representa una mejora del 70% en el tiempo total de generación de transcripciones en comparación con el modelo anterior, Chirp 3. La tecnología soporta más de 85 idiomas, incluyendo escenarios de cambio lingüístico durante la comunicación, como el uso de mezclas de idiomas en medio de frases.

La división funcional entre ambos servicios es clave para el diseño de estrategias de implementación. Cada uno presenta distintas capacidades, límites técnicos y costos. No existen versiones abiertas ni opciones para ejecución local, lo que posiciona la solución como un servicio gestionado. La disponibilidad se extiende a cualquier tipo de empresa, aunque el acceso inicial está disponible para desarrolladores individuales y startups mediante la versión gratuita de Google AI Studio. Equipos de mediana escala deben optar por la versión paga para alcanzar tasas de uso superiores. En este caso, el acuerdo incluye una garantía de que los datos no serán utilizados para entrenar productos internos de Google. Las organizaciones sujetas a regulaciones pueden acceder al entorno empresarial de Gemini, que incluye controles de cumplimiento, capacidad de escalabilidad y descuentos por volumen. Ambos planes, para desarrolladores y empresas, se encuentran en fase de presentación pública, lo que exige una evaluación cuidadosa antes de cualquier compromiso operativo.

Para el mercado peruano, este avance en inteligencia artificial tiene un impacto directo en sectores clave como atención al cliente, documentación clínica, servicios de localización, y gestión de llamadas. En entornos donde el acceso a servicios multilingües es crítico, como las empresas de servicios públicos o las clínicas de atención médica, la capacidad de procesar voces en más de 85 idiomas —incluyendo mezclas— permite una mejora significativa en la experiencia del usuario. Además, la reducción del tiempo de transcripción y el bajo error de reconocimiento permiten automatizar procesos que antes requerían intervención humana, optimizando costos y aumentando la eficiencia. Aunque el modelo no es abierto ni autónomo, su integración en plataformas existentes como sistemas de llamadas o herramientas de gestión de reuniones puede ser una inversión estratégica para empresas que buscan modernizar sus operaciones sin sacrificar calidad o cumplimiento normativo.

Google Lanza Gemini 3.5 Transcribe para transcripción en tiempo real | Reditua