Según MarkTechPost (AI/ML News), un nuevo tokenizador de inteligencia artificial llamado Gigatoken ha demostrado una eficiencia sin precedentes en el procesamiento de texto, alcanzando velocidades de hasta 24.53 gigabytes por segundo en una configuración de hardware con doble socket AMD EPYC 9565 y 144 núcleos. Este avance fue presentado por Marcel Rød, estudiante de posgrado en Stanford, quien desarrolló el software bajo licencia MIT. La herramienta, escrita en Rust con interfaces en Python, se encuentra disponible en PyPI como "gigatoken" (versión 0.9.0, lanzada el 21 de julio de 2026), y se instala mediante el comando pip install gigatoken. La estructura del código es casi equilibrada: el 66,2% está en Rust y el 33,3% en Python, lo que permite un rendimiento óptimo en entornos de alto desempeño.
En pruebas comparativas, Gigatoken supera ampliamente a otros sistemas líderes en el campo. Mientras que el tokenizador de OpenAI (tiktoken) logra solo 36,0 megabytes por segundo en el mismo entorno, Gigatoken registra un salto de 681 veces en velocidad. En comparación, los tokenizadores de HuggingFace alcanzan 24,8 MB/s, con un incremento de hasta 989 veces frente al nuevo sistema. En dispositivos más accesibles, como la placa Apple M4 Max con 16 núcleos, el rendimiento se mantiene en 8,79 GB/s, lo que equivale a un 1.268% más rápido que HuggingFace y un 140% más que tiktoken. En una configuración típica de consumo, como el procesador AMD Ryzen 7 9800X3D, el sistema alcanza 6,27 GB/s, un 106% más rápido que los tokenizadores de HuggingFace y 68 veces más rápido que tiktoken. Estos datos indican que el desempeño no depende únicamente de un núcleo específico o de un vocabulario limitado, sino que representa una mejora sistémica en la arquitectura de software.
Este avance en la eficiencia del tokenizado, un paso clave en el desarrollo de modelos de lenguaje, tiene implicaciones directas para el entorno peruano. En el contexto de empresas que operan en entornos con recursos limitados —como start-ups, consultorías o centros de educación—, el uso de herramientas como Gigatoken permite procesar grandes volúmenes de datos sin necesidad de infraestructura costosa. Esto puede acelerar el desarrollo de soluciones digitales en sectores como finanzas, comercio electrónico o servicios públicos. Además, al estar basado en Rust, un lenguaje conocido por su estabilidad y rendimiento, el tokenizador ofrece una base sólida para futuras integraciones en plataformas de IA que buscan escalabilidad y eficiencia.
El sistema cuenta con compatibilidad con múltiples familias de modelos, incluyendo GPT-2, Llama 3 a 4, Qwen 2 a 3.6, DeepSeek, GLM, Kimi, Phi-4 y otros. Sin embargo, al activar el modo de compatibilidad, el rendimiento se ve afectado por una sobrecarga de Python, que reduce la velocidad en hasta 200 a 300 veces. Esto sugiere que, para obtener el máximo beneficio, los usuarios deben evaluar el equilibrio entre interoperabilidad y desempeño en sus aplicaciones específicas.
