Segun MarkTechPost (AI/ML News), el laboratorio Tongyi de Alibaba ha presentado Qwen-Audio-3.0-TTS, un sistema de conversión de texto a voz diseñado para entornos de producción. Este modelo se ofrece en dos versiones, Flash y Plus, derivadas de la misma línea tecnológica, y está disponible como servicio en la plataforma Alibaba Cloud Model Studio, sin que los usuarios puedan descargar directamente los pesos del modelo. La oferta se enfoca en cuatro aspectos clave que impactan el rendimiento en entornos reales: ampliación del idioma, control de estilo natural, gestión de etiquetas finas y estabilidad frente a audios de referencia de baja calidad. La versión Plus se posiciona como líder en una prueba independiente de calidad en conversión de texto a voz.
La versión Flash está optimizada para interacciones en tiempo real, alcanzando una latencia inicial de 300 milisegundos, ideal para aplicaciones donde la respuesta debe ser inmediata. En contraste, la versión Plus prioriza la calidad natural del habla y la fidelidad de tono, siendo más adecuada para usos como narraciones, servicios de atención al cliente o contenido audiovisual. Ambas variantes operan mediante un protocolo de streaming bidireccional por WebSocket, permitiendo la transmisión continua de entrada y salida. El formato de salida admite PCM, WAV, MP3 y Opus, con una tasa de muestreo máxima de 48 kHz. El modelo incluye funcionalidades como clonación de voz, diseño personalizado de voces y control mediante instrucciones, facilitando su integración en aplicaciones específicas. Alibaba ha desarrollado un SDK denominado DashScope, acompañado de ejemplos de código en Python, Java, Go, C#, PHP y Node.js, accesibles desde centros de datos en Singapur y Beijing.
La arquitectura del sistema se basa en dos decisiones clave. Primero, el uso de un tokenizador de voz a 12,5 Hz reduce significativamente el costo computacional del proceso de decodificación autoregresiva, preservando al mismo tiempo la información del contenido y del hablante. Segundo, se aplica un paradigma de entrenamiento en cinco fases que coordina el modelo de lenguaje y el proceso de coincidencia de flujo. Estas fases incluyen entrenamiento inicial separado, entrenamiento conjunto con anelamiento de datos de alta calidad, aprendizaje reforzado del modelo de lenguaje, entrenamiento de robustez del componente de flujo y una reentrenamiento final del flujo. Este enfoque permite una síntesis más natural y consistente, incluso ante condiciones de entrada variables.
Para el lector peruano, esta evolución tecnológica puede ser clave en sectores como el turismo, educación o servicios financieros digitales. Las plataformas que integran voz en sus interfaces —como asistentes virtuales o aplicaciones de educación— podrían beneficiarse de la calidad y versatilidad del modelo. Aunque aún no está disponible en mercados latinoamericanos, su creciente adopción global sugiere que en los próximos años, soluciones como esta podrían integrarse en herramientas que mejoran la accesibilidad y experiencia del usuario en servicios digitales.
