Segun MarkTechPost (AI/ML News), el equipo de Alibaba ha lanzado Qwen3.8-LiveTranslate, un modelo de interpretación simultánea que reduce la latencia promedio a 2,3 segundos en 60 idiomas. Esta innovación permite que el sistema procese y traduzca en tiempo real, mientras el hablante sigue hablando, integrando tanto audio como imágenes en escenas multilenguaje. La mejora se logra mediante una arquitectura denominada Interleave, que optimiza el equilibrio entre tiempo de respuesta y precisión del contenido. La métrica clave utilizada es el LAAL —Length-Adaptive Average Lagging—, que mide cuánto tiempo en promedio la traducción se retrasa respecto al hablante original. Su reducción de 2,8 a 2,3 segundos representa una disminución del 18% en el retardo promedio.
Este modelo está disponible como servicio en línea a través de Alibaba Cloud Model Studio y QwenCloud, bajo la denominación qwen3.8-livetranslate-flash-realtime, mediante conexión por WebSocket. Su diseño se basa en la pila Qwen-Omni, que combina grandes volúmenes de datos multimodales, alineación entre idiomas y modos, y mejoras visuales. A diferencia de versiones anteriores, esta versión permite el procesamiento de audio y video en entornos of-line, ampliando su aplicabilidad en entornos no conectados.
Entre sus funcionalidades destacadas se encuentra la identificación en tiempo real de los hablantes en conversaciones multilaterales, lo que permite distinguir voces individuales y mantener la consistencia de cada voz mediante técnicas de clonación. Esta característica se expone como modo "always", que re-clona la voz de cada participante antes de cada respuesta, especialmente útil en reuniones o llamadas grupales. Además, el sistema muestra simultáneamente el texto original y su traducción, en pantalla, lo que facilita la comprensión en tiempo real.
Para los peruanos, esta evolución en inteligencia artificial tiene implicaciones directas en el acceso a información multilingüe. En contextos como la diplomacia, el comercio internacional o las comunicaciones empresariales, la capacidad de traducir en tiempo real puede reducir barreras de comunicación. Aunque actualmente el modelo opera principalmente en plataformas tecnológicas, su potencial se extiende a escenarios locales donde se requiere fluidez en idiomas como el quechua, el inglés o el español, especialmente en eventos que involucran participantes de diferentes regiones. La tecnología, aunque aún en fase de desarrollo, señala una tendencia hacia soluciones más accesibles y rápidas en entornos de trabajo y educación.
La reducción de la latencia, junto con la capacidad de reconocer múltiples voces, representa un avance significativo en la usabilidad de los modelos de lenguaje. Aunque no está disponible para uso general en dispositivos móviles o aplicaciones nacionales, su evolución podría inspirar futuras soluciones adaptadas al entorno peruano, donde la diversidad lingüística es clave para el desarrollo sostenible de las comunidades.
