Según MarkTechPost (AI/ML News), el equipo de ingeniería de Perplexity ha desarrollado un sistema de embeddings eficiente que aprovecha el rendimiento de hardware de última generación, especialmente en GPUs con arquitecturas como Hopper y Blackwell. Este avance no se centra en crear un motor de embeddings independiente, sino en optimizar el uso existente de componentes de su infraestructura de inteligencia artificial. La eficiencia del sistema depende de dos factores clave: la calidad del modelo de embeddings y el costo de ejecutarlo en una base de datos vectorial. Perplexity ha resuelto ambos desafíos mediante una arquitectura que reutiliza kernels previamente desarrollados para modelos de lenguaje grandes (LLMs), adaptándolos a tareas de embeddings.
La implementación se divide en dos flujos principales: el batch embedding y el online embedding. En el primer caso, durante el proceso de construcción o actualización de la base de datos vectorial, se realizan embeddings en lotes para maximizar el rendimiento y reducir costos operativos. Este proceso se alinea con el patrón de cálculo intensivo conocido como prefill, típico en los modelos de lenguaje. Por otro lado, el online embedding ocurre en tiempo real, al recibir una consulta breve, y debe ejecutarse con rapidez. Este escenario se asemeja a una decodificación de memoria, donde el tiempo de respuesta es crítico. En lugar de construir un sistema dedicado, Perplexity ha integrado estos flujos dentro de su infraestructura existente, utilizando el mismo marco de cálculo que emplean sus modelos de lenguaje.
El sistema opera mediante tres componentes clave. Ivy actúa como puerta de enlace HTTP en lenguaje Rust, encargándose de tareas como el análisis de JSON, la tokenización de entradas y la división de peticiones grandes. Además, redistribuye las solicitudes en fragmentos para evitar sobrecargas en servidores individuales. Tulip, por su parte, es un servidor de inferencia basado en Rust, tokio y tonic, que organiza las peticiones, aplica agrupaciones y las envía al motor de ejecución. ROSE, que se encarga de la ejecución final, gestiona la respuesta y la entrega de resultados en tiempo real. Innovaciones como el manejo de CUDA graphs, abstracciones asíncronas para el seguimiento de resultados y una ruta de solicitud en Rust permiten una ejecución más fluida y escalable.
Para los inversores y profesionales del sector peruano, este caso demuestra cómo una estrategia de diseño arquitectónico inteligente puede transformar costos operativos sin sacrificar calidad. En un contexto donde los costos de computación son un factor clave en el crecimiento de startups y empresas tecnológicas, este enfoque permite ofrecer servicios de búsqueda y análisis de datos a precios más accesibles. Si bien Perplexity opera en un entorno global, sus principios pueden adaptarse a soluciones locales que requieren procesamiento rápido y eficiente de información, como plataformas de asesoría financiera o sistemas de diagnóstico en salud. El ahorro en operaciones no solo mejora la rentabilidad, sino que también abre espacio para innovar en servicios más personalizados y rápidos.
