CLOSED
S&PNASDAQDOWR2KVIXAAPLMSFTNVDAGOOGLMETAAMZNTSLAAVGOGOLDWTIUSDPEN
Yahoo · 60s · delay ~15min
LIVE
BTCETHSOLXRPADABNBDOGE
CoinGecko · 30s
Meta Lanza Modelo de Voz en Tiempo Real para Transcripción
Papers

Meta Lanza Modelo de Voz en Tiempo Real para Transcripción

MarkTechPost (AI/ML News)2 de setiembre de 2026Cortesia de MarkTechPost (AI/ML News)

Segun MarkTechPost (AI/ML News), Meta Superintelligence Labs ha presentado Muse Voice Transcribe, un avance en inteligencia artificial que integra tres funciones clave en un solo modelo. Este sistema, diseñado para procesar audio en tiempo real, ejecuta transcripción de voz, separación de hablantes y detección de fin de frase, todo en una sola pasada sin necesidad de procesos posteriores. La tecnología se posiciona como la primera instancia de un modelo autoregresivo de percepción audiovisual en tiempo real desarrollado por la empresa.

El modelo recibe fragmentos de audio cada 80 milisegundos a una frecuencia de 12,5 Hz. Cada bloque se convierte en un token suave, y el sistema decide en cada paso si emite texto o continúa escuchando. Si elige continuar, el siguiente fragmento de audio se inserta en lugar del token especial <|next_audio|>. Al final de la secuencia, se añade un token <|empty_audio|> y se generan todos los textos almacenados sin pedir más datos. Este enfoque elimina fases intermedias que antes generaban retrasos y errores. La duración del "retraso" —la cantidad de audio que se mantiene antes de que se genere un texto— se ajusta dinámicamente mediante aprendizaje por recompensa. Meta ha entrenado este parámetro para optimizar el equilibrio entre precisión y latencia, sin recurrir a soluciones fijas.

El servicio está disponible como API en la plataforma Meta Model API, bajo la ruta muse-voice-transcribe-1.0, con un costo de $3.00 por 1.000 minutos de audio (equivalente a $0.18 por hora). Actualmente alimenta funciones de dictado en Meta AI para Mac y en el entorno Muse Code. No se han liberado los pesos del modelo, por lo que no es posible ejecutarlo localmente.

Para el lector peruano, esta innovación representa un salto significativo en la eficiencia de las herramientas de asistente de voz. En entornos como educación, atención al cliente o gestión de tareas diarias, el hecho de que un solo modelo resuelva transcripción, identificación de hablantes y detección de finalización en tiempo real puede reducir costos operativos y mejorar la experiencia del usuario. Aunque el modelo no está disponible para uso local, su integración en aplicaciones como el dictado en dispositivos puede acelerar la adopción de tecnologías inteligentes en entornos de trabajo y hogar. En un país donde el acceso a herramientas digitales es creciente, este avance podría facilitar el uso de tecnologías de IA en contextos más amplios, desde la educación hasta la atención médica.

Meta Lanza Modelo de Voz en Tiempo Real para Transcripción | Reditua