Segun MarkTechPost (AI/ML News), un análisis detallado de siete proveedores de clonación de voz revela diferencias significativas en la calidad, eficiencia y cumplimiento de normas entre sus ofertas. El estudio se basa en una prueba estándar de 10 segundos, donde se graba un audio de un hablante en entorno silencioso y se utiliza para generar una copia de voz en cada plataforma. Los resultados se presentan sin etiquetas, permitiendo una evaluación directa por parte del usuario. Los criterios analizados incluyen la duración del audio de referencia requerida, la verificación de consentimiento, la disponibilidad de licencias comerciales y el soporte de idiomas.
El comportamiento de los proveedores varía notablemente en estas dimensiones. Por ejemplo, Hume establece como mínimo un periodo de 15 segundos para la creación de una voz, lo que implica que su modelo extiende el audio original para cumplir con ese límite. En contrapartida, ElevenLabs sugiere un tiempo de referencia entre 1 y 2 minutos, y su versión de clonación rápida se ejecuta con solo 10 segundos, desafiando así su propia guía técnica. En cuanto a la calidad percibida, Fish Audio s2-pro obtiene una puntuación de 4.03 en la escala de semejanza, superando a otros sistemas como Cartesia sonic-3.5 (3.70) y ElevenLabs Multilingual v2 (3.68). La versión beta de Cartesia sonic-3.6-beta registra 3.63, mientras que Inworld TTS-2 alcanza 3.62. Sin embargo, ElevenLabs Eleven v3 queda en último lugar con solo 2.91, indicando una menor naturalidad en la reproducción. Este dato evidencia que no todas las soluciones ofrecen una representación fiel del hablante original.
La comparación de precios también revela una diversidad notable. Las tarifas se calculan dividiendo el costo total de la plan por el número de caracteres incluidos. En el caso de Resemble AI, no se proporciona una tasa de síntesis de voz, aunque fuentes independientes indican una tarifa de $0.0005 por segundo en el segundo semestre de 2026. Esta cifra, equivalente a unos 1,000 caracteres por minuto, se mantiene como referencia. Los datos fueron verificados el 20 de septiembre de 2026. La discrepancia entre la percepción de naturalidad y el rendimiento en identidad es crítica: Cartesia sonic-3.6-beta obtiene una puntuación alta en naturalidad (4.36), pero solo ocupa el octavo lugar en representación de identidad, lo que sugiere que el sonido puede ser atractivo pero poco fiel al individuo original.
Para los usuarios peruanos, esta información es clave en contextos como la creación de contenidos digitales, educación o servicios de atención al cliente. Muchos sectores locales, como el comercio o la comunicación, están integrando tecnologías de voz para mejorar accesibilidad y personalización. Sin embargo, el riesgo de infracción ética y legal —especialmente en temas de consentimiento y uso comercial— requiere una evaluación cuidadosa. Es fundamental que los emprendedores y profesionales comprendan no solo la calidad técnica, sino también las implicaciones legales al usar voces clonadas, especialmente cuando se involucran datos personales o identidades reales.
