Segun MarkTechPost (AI/ML News), Gradium, empresa francesa especializada en inteligencia artificial de voz derivada del laboratorio Kyutai, ha presentado una innovación que redefine cómo se generan voces sintéticas. En lugar de recurrir a catalogos preexistentes que limitan la creatividad, el sistema Voice Design procesa una descripción textual para producir, en cuestión de segundos, una voz completamente nueva. Este avance permite diseñar personalidades vocales sin necesidad de audio de referencia, sin requerir consentimiento ni licencias, rompiendo así barreras éticas y técnicas que hasta ahora obstaculizaban el desarrollo de voces personalizadas.
El proceso se basa en una solicitud escrita, donde el usuario define atributos clave como género, rango de edad, acento o procedencia, tono, ritmo, energía, textura y calidad de voz, así como el tipo de uso previsto. Cada descripción debe tener entre 1 y 500 caracteres, y puede estar en inglés, francés, español, portugués o alemán. La herramienta no depende de ejemplos de habla previos, lo que elimina el riesgo de copiar o replicar voces reales. En respuesta, el sistema entrega entre una y cinco opciones, que suelen estar listas en 3 a 5 segundos. Cada propuesta representa una variante de un solo personaje, por lo que un cambio en la descripción implica una nueva personalidad, no una ampliación de muestras.
Para transformar una opción seleccionada en una voz funcional, se requieren cuatro llamadas a una API. La primera, mediante POST /voice-generator/generate, asigna un ID provisional a un candidato, marcado como "listo para uso" en falso. Luego, mediante GET /voice-generator/embeddings, el sistema verifica el estado hasta que se actualice. Una vez listo, el candidato se prueba a través del endpoint estándar de síntesis de voz, utilizando el ID como identificador. Finalmente, mediante POST /voices/from-embedding, se promueve la voz elegida para su uso activo. Las voces generadas cumplen con las mismas condiciones de latencia y formato que las voces existentes en los catálogos oficiales, garantizando compatibilidad en cualquier entorno de aplicación.
Para el lector peruano, esta tecnología ofrece una solución práctica frente a la escasez de voces localizadas en plataformas de voz. Muchos servicios de atención al cliente o contenidos educativos requieren un tono específico que refleje identidad regional o cultural. Gradium permite crear voces que imitan un tono de recepcionista montrealés o un narrador de edad avanzada, sin necesidad de contratar hablantes reales. Esto es especialmente relevante para pymes y emprendedores que buscan personalizar sus mensajes sin incurrir en costos elevados o riesgos legales. Además, al no depender de datos de personas reales, se reduce el impacto ético en la privacidad y el uso de voces que podrían ser vulnerables. En un mercado donde la personalización está en auge, esta herramienta podría convertirse en una pieza clave para innovar en servicios digitales locales.
