Segun MarkTechPost (AI/ML News), Liquid AI ha presentado LFM2.5-VL-3B-DSpark, un modelo experimental de decodificación especulativa diseñado para acelerar el procesamiento en modelos de lenguaje y visión. Este avance permite una mejora significativa en la velocidad de ejecución, alcanzando hasta 3.13 veces más rápido en procesadores de Apple Silicon y 2.66 veces en GPUs NVIDIA H100, sin alterar la calidad de salida del modelo principal. El sistema se basa en un "drafter" que propone secuencias de tokens adelantados, que luego son validados en un solo paso por el modelo principal, reduciendo así el tiempo de ejecución sin comprometer la precisión.
La arquitectura del drafter se construye sobre un modelo simplificado que emplea solo atención, seleccionando cuatro capas y un tamaño de bloque de 9. Este diseño permite que el sistema funcione de forma eficiente en distintos entornos, con recomendaciones específicas según el hardware: se sugiere un bloque de tamaño 8 o 9, dependiendo del equipo, mientras que los procesadores de Apple Silicon operan con un bloque de 8. Importante, el drafter no incluye capas de embeddings ni cabeza de lenguaje, vinculadas directamente al modelo principal, lo que incrementa el conteo total de parámetros en un 8.9%. Este enfoque permite reutilizar el mismo algoritmo de inferencia tanto en modelos de texto como en aquellos que integran imágenes, ya que al llegar a las capas ocultas, tanto el texto como los parches visuales se convierten en tensores indistinguibles.
Los pesos del modelo ya están disponibles en Hugging Face, en formatos Safetensors y GGUF, con soporte inmediato para plataformas como SGLang, MLX-VLM y llama.cpp. A pesar de su potencial, el lanzamiento se clasifica como experimental, y el uso comercial está restringido al límite de 10 millones de dólares anuales bajo la licencia LFM Open License v1.0. Esta limitación afecta su accesibilidad para empresas de tamaño ampliado, aunque abre puertas para startups y entidades de menor escala que buscan innovar con tecnologías de inteligencia artificial sin costo elevado.
Para los inversionistas y profesionales peruanos, este avance representa una mejora clave en la eficiencia de los sistemas de IA, especialmente en entornos donde el tiempo de respuesta influye en la toma de decisiones. En el contexto local, donde las empresas de servicios, comercio y finanzas operan con límites de recursos tecnológicos, la capacidad de ejecutar modelos más rápidos sin aumentar costos de infraestructura podría transformar el rendimiento de aplicaciones como asistentes de cálculo, análisis de documentos o procesamiento de imágenes. Aunque el modelo aún está en etapa experimental, su disponibilidad abierta y su diseño modular lo posicionan como una herramienta potencialmente escalable para soluciones adaptadas al mercado peruano.
