Segun MarkTechPost (AI/ML News), una nueva funcionalidad en Hermes Desktop, desarrollada por Nous Research, simplifica drásticamente la instalación de modelos de inteligencia artificial en entornos locales. Hasta ahora, el proceso de ejecutar un modelo abierto en una computadora requería múltiples pasos: evaluar la capacidad de memoria VRAM, estimar el tipo de cuantización adecuado, definir el tamaño de contexto y el número de capas de GPU, y luego enfrentar errores al intentar cargar un archivo que supera los tres gigabytes de tamaño. Esta complejidad ha sido eliminada con una nueva secuencia que se activa en un solo clic.
La herramienta, disponible desde la primera ejecución del software, detecta automáticamente la configuración del equipo —como memoria RAM y tipo de GPU— y selecciona un modelo compatible. Posteriormente, descarga los pesos del modelo y configura el entorno de inferencia sin intervención humana. Este flujo se encuentra en la interfaz bajo la ruta "Configuración → Proveedores → Modelos Locales". El sistema opera bajo licencia MIT, es gratuito y es compatible con macOS 12 o posteriores, Windows 10 y 11, así como cualquier distribución de Linux. No requiere conexión a una cuenta para funcionar.
Dentro de su operación, Hermes integra un motor de inferencia oficial de llama.cpp, que se adapta a la arquitectura del equipo. Este componente, de unos pocos cientos de megabytes, se verifica y actualiza automáticamente. Los backends disponibles incluyen CUDA, Metal, Vulkan, HIP y ejecución en CPU. El parámetro de configuración relevante, ubicado en el bloque "local_runtime" del archivo config.yaml, es generado automáticamente por la interfaz gráfica, permitiendo también su edición manual para usuarios en entornos sin pantalla.
Cada modelo disponible se evalúa específicamente contra las especificaciones del equipo antes de que se inicie la descarga. Las filas de la lista muestran un veredicto de compatibilidad: verde indica que el modelo se ejecuta completamente en la memoria de la GPU, amarillo implica que parte del modelo se carga en la RAM del sistema y opera con menor velocidad, y rojo señala que el modelo supera las capacidades del equipo. Además, cada fila detalla el tamaño inicial y máximo del contexto, así como el tamaño del archivo descargado para el hardware seleccionado. La selección de cuantización se basa en una regla clara: Hermes elige el modelo de mayor calidad que se ejecute completamente en la GPU, y los equipos con menos memoria reciben una recomendación más conservadora.
Para los usuarios peruanos, esta evolución es especialmente significativa. Muchos dispositivos en el mercado nacional, especialmente en entornos domésticos o educativos, cuentan con hardware limitado. Esto hace que la capacidad de ejecutar modelos de IA localmente, sin dependencia de internet o servicios en la nube, sea una herramienta clave para el aprendizaje, la innovación y la autonomía tecnológica. Con Hermes Desktop, incluso usuarios sin experiencia técnica pueden acceder a inteligencias artificiales de alto rendimiento, sin necesidad de invertir en servidores o plataformas externas.
