CLOSED
S&PNASDAQDOWR2KVIXAAPLMSFTNVDAGOOGLMETAAMZNTSLAAVGOGOLDWTIUSDPEN
Yahoo · 60s · delay ~15min
LIVE
BTCETHSOLXRPADABNBDOGE
CoinGecko · 30s
Jina AI Lanza jina-ocr-v1 para lectura de documentos con GPU económica
Papers

Jina AI Lanza jina-ocr-v1 para lectura de documentos con GPU económica

MarkTechPost (AI/ML News)19 de setiembre de 2026Cortesia de MarkTechPost (AI/ML News)

Según MarkTechPost (AI/ML News), Jina AI, parte de la empresa Elastic, ha presentado jina-ocr-v1, una herramienta de análisis visual de documentos que transforma archivos como PDFs, escáneres, tablas o facturas en formato limpio de Markdown en una sola ejecución. Este modelo, con 3.4 billones de parámetros totales y unos 570 millones activos por token en su cabeza decodificadora, está diseñado para funcionar en hardware de bajo costo, como la NVIDIA L4. La tecnología incorpora un módulo de decodificación especulativa, conocido como FastMTP, que mejora la velocidad sin sacrificar precisión. Los resultados en pruebas técnicas alcanzan el 91,14 por ciento en OmniDocBench v1.6 y el 83,4 por ciento en olmOCR-Bench, demostrando su eficiencia en tareas de reconocimiento óptico de caracteres.

La arquitectura del modelo se basa en la post-entrenamiento del modelo DeepSeek-OCR, conservando dos componentes clave de eficiencia. El DeepEncoder, con alrededor de 380 millones de parámetros, procesa una página de 1024×1024 dividida en 4.096 parches, reduciéndola a 256 tokens visuales. Un modo de resolución dinámica permite agregar hasta nueve bloques locales, cada uno con hasta 100 tokens, lo que eleva el límite de tokens por página a 1.156. La capa decodificadora utiliza DeepSeek-3B-MoE, compuesta por 12 capas, 64 expertos rutas y 2 expertos compartidos. La selección top-6 activa aproximadamente 570 millones de parámetros por token, mientras que el límite de posición se establece en 32.768 tokens. El formato de salida incluye Markdown, tablas en HTML y fórmulas en LaTeX, facilitando su integración en entornos técnicos.

El sistema de decodificación especulativa FastMTP aplica tres pasos de un bloque denso recursivo, manteniendo constantes los parámetros del draft a medida que aumenta la profundidad. Posteriormente, el decodificador valida los borradores de forma greedy, aceptando la secuencia más larga que coincida con sus decisiones y agregando un token adicional. Si los tres intentos coinciden, este token se convierte en un beneficio real. La clave aquí es que el texto final siempre coincide con la decodificación tradicional, lo que garantiza que el aumento de velocidad sea absoluto. En el escenario de K=3, el modelo logra una aceleración de hasta 2,7 veces en el tiempo de procesamiento.

Para el lector peruano, este avance en inteligencia artificial representa una oportunidad clave para pequeñas y medianas empresas que operan en entornos con recursos tecnológicos limitados. Muchas organizaciones del sector público o privado, especialmente en áreas como contabilidad, servicios públicos o gestión documental, podrían beneficiarse de herramientas que interpreten facturas, contratos o informes sin necesidad de infraestructura de alto costo. Aunque el modelo está disponible bajo licencia CC BY-NC 4.0, su uso comercial requiere contacto directo con Jina AI. Esto subraya la importancia de evaluar cuidadosamente el uso de tecnologías emergentes, especialmente en contextos donde el acceso a herramientas de IA puede influir directamente en la eficiencia operativa.

Jina AI Lanza jina-ocr-v1 para lectura de documentos con GPU económica | Reditua