Según MarkTechPost (AI/ML News), el panorama de reconocimiento de voz abierto ha evolucionado significativamente en los últimos doce meses, dejando atrás la dominancia de Whisper. A finales de 2025, Cohere lanzó Transcribe, un modelo de 2 billones de parámetros bajo licencia Apache 2.0, que alcanzó un error promedio de 5.42% en la lista de líderes de Hugging Face. Cinco semanas después, IBM presentó Granite Speech 4.1 (2B) con un rendimiento de 5.33%. Posteriormente, modelos como ARK-ASR-3B y MOSS-Transcribe-preview-2B superaron estos índices, reduciendo aún más la brecha en términos de precisión. Hoy, el liderato se mantiene en un margen de menos de un punto en el error de palabra, lo que indica que métricas como el error promedio ya no son suficientes para evaluar modelos.
La comparación entre modelos debe extenderse más allá del error promedio. Cada modelo ha sido evaluado con diferentes conjuntos de datos, lo que afecta directamente la validez de las cifras. Por ejemplo, el rendimiento de Cohere (5.42%) se calculó sobre ocho conjuntos de pruebas en inglés, incluyendo TED-LIUM. Los datos específicos muestran que la media de los conjuntos AMI (8.13%), Earnings-22 (10.86%), GigaSpeech (9.34%), LibriSpeech clean (1.25%), LibriSpeech other (2.37%), SPGISpeech (3.08) y TED-LIUM (2.49), junto con VoxPopuli (5.87), suma exactamente 5.42%. En contraste, ARK-ASR-3B obtuvo un promedio de 5.04% basado en siete conjuntos, sin incluir TED-LIUM. Dado que este conjunto es relativamente sencillo, su exclusión eleva el promedio. Al reevaluar Cohere sobre los mismos siete conjuntos, su error aumenta hasta 5.84%, mientras que Granite Speech 4.1 sube a 5.65%. Esto demuestra que las diferencias reales entre modelos son mayores de lo que sugieren los valores públicos, y que comparar cifras directas sin contexto de evaluación es arriesgado.
Además, no todos los modelos comparten los mismos criterios de prueba. Algunas métricas están expuestas públicamente, mientras que otras no. Esto plantea un desafío para quienes deciden implementar soluciones en entornos reales, como servicios de atención al cliente o transcripciones en tiempo real. Factores como la cobertura lingüística, el soporte para streaming, el costo por hora de audio y la disponibilidad de licencias se han vuelto esenciales. Un modelo que funcione bien en inglés podría fracasar en un entorno bilingüe o con dialectos no estándar.
Para los usuarios peruanos, esta evolución implica que la selección de un modelo de reconocimiento de voz debe ir más allá de la precisión técnica. En un contexto donde el español tiene variantes regionales, y donde el acceso a infraestructura de voz es limitado, es crucial elegir tecnologías que ofrezcan soporte para dialectos locales, sean escalables y tengan licencias fáciles de gestionar. Los datos no solo deben ser precisos, sino también aplicables al día a día de los usuarios reales. En el caso peruano, donde el uso de voz en servicios digitales crece, la elección de un modelo adecuado puede marcar la diferencia entre una experiencia fluida y una interrupción frecuente.
