Segun MarkTechPost (AI/ML News), NVIDIA ha presentado NemotronLabs VoiceChat 11B, un modelo abierto de procesamiento de voz que permite conversaciones en tiempo real y bidireccional. Este sistema elimina la necesidad de conectar múltiples tecnologías —como reconocimiento de voz, lenguaje natural y síntesis de voz— mediante una arquitectura unificada. En su lugar, el modelo comprende y genera habla en una sola red, reduciendo así el retraso total en la interacción. La latencia media de cambio de turno, evaluada en el benchmark Full-Duplex-Bench 1.0, alcanza los 448 milisegundos. Al mismo tiempo, permite que un usuario interrumpa una frase en curso, con una tasa de transición de 1.00 detectada en 480 milisegundos. Este comportamiento es clave para entornos donde la fluidez humana es esencial.
Además, es el primer modelo de este tipo que permite la ejecución de herramientas durante una conversación, sin que el flujo se interrumpa. Para ello, emplea una canal separado para enviar instrucciones de tipo <TOOLCALL>, junto con líneas definidas por el operador que mantienen la interacción mientras se procesan solicitudes externas. Aunque el modelo está disponible en formato abierto —con pesos y contenedor públicos y licencia permissiva—, el equipo de NVIDIA lo califica como “únicamente adecuado para investigaciones científicas”. Esto implica que no está diseñado para uso en producción masiva. El sistema presenta limitaciones reales: el contexto de audio se mantiene en un límite de dos minutos, luego de ese tiempo se produce un deterioro en la salida, pasando a textos incoherentes. Además, pueden surgir bucles de autoconversación que no se detienen y errores en la transcripción de palabras del usuario.
El acceso al modelo requiere un GPU con al menos 80 GB de memoria, como el A100, H100, RTX 6000 Pro o B200 en entornos Linux x86_64. Esto limita su uso a equipos especializados: startups enfocadas en inteligencia artificial, empresas de innovación tecnológica, laboratorios de investigación empresarial y proveedores de nube de GPU. Actualmente, no existe una versión en API pública ni servicios de inferencia que ofrezcan este modelo, lo que dificulta su evaluación para equipos sin infraestructura propia.
Para el lector peruano, este avance tiene implicaciones directas en sectores clave del mercado local. En servicios de atención al cliente, por ejemplo, podría mejorar la eficiencia de las interacciones en centros de llamadas, reduciendo el tiempo de respuesta y mejorando la experiencia del usuario. En el sector automotriz, donde se implementan asistentes vocales en vehículos, el modelo podría optimizar las interacciones en entornos dinámicos. Asimismo, en comercios que operan en puntos de servicio como cajas de entrega o ventanas de atención, podría facilitar órdenes más rápidas y fluidas. Aunque aún no está listo para uso generalizado, su desarrollo señala un camino hacia tecnologías más naturales y reales en la interacción humana con máquinas.
