Segun arXiv q-fin, un nuevo sistema para identificar estrategias de inversión ha sido propuesto que corrige dos fallos comunes en el diseño de modelos de trading automatizados. Mientras que los modelos de lenguaje grande (LLMs) han sido ampliamente utilizados para generar estrategias de inversión, muchas investigaciones no abordan adecuadamente el sesgo de revisión hacia adelante ni la intensidad de la búsqueda que conlleva la selección de un resultado. Este enfoque innovador no solo evita esos problemas, sino que los integra desde el diseño estructural del sistema.
El mecanismo principal se basa en el uso de herramientas validadas por registros, cuyo espacio de características está diseñado para excluir cualquier tipo de sesgo de anticipación. Este control no es una simple corrección estadística, sino un pilar estructural: se demuestra que incluso un "oráculo" deliberadamente defectuoso, que reporta una relación de Sharpe de 35, sobrevive a pruebas rigurosas de desinflación de Sharpe y de probabilidad de sobreajuste en backtests. Además, el sistema registra cada evaluación de estrategia que realiza durante la búsqueda y ajusta el rendimiento final por el número total de pruebas. Así, se observa cómo la mejor relación de Sharpe en el conjunto de entrenamiento mejora gradualmente con cada intento, mientras que el umbral de desinflación, impulsado por la búsqueda misma, aumenta más rápido.
Este marco se aplicó a un universo de 453 acciones de Estados Unidos y a un conjunto de 39 fondos de inversión multietapa, incorporando costos reales de transacciones, impacto y préstamo. Los resultados muestran que las evaluaciones honestas validan automáticamente benchmarks pasivos, cuyos intervalos de confianza al exterior no incluyen el cero. Por el contrario, todas las estrategias descubiertas por LLMs —incluso en dos modelos de frontera, con presupuestos de búsqueda hasta cien candidatos y cinco ejecuciones repetidas— son rechazadas. Este hallazgo captura efectos como la suerte de selección, el deterioro previsto en el ranking y el colapso en el entorno de prueba. Además, el sistema evalúa un conjunto de reglas de un trader humano bajo condiciones idénticas, ofreciendo un punto de comparación directo.
Para el lector peruano, este análisis es especialmente relevante en un contexto de alta volatilidad y escasez de instrumentos de inversión estructurados. Muchas plataformas digitales promueven estrategias de trading automatizadas basadas en LLMs, sin validaciones rigurosas. Este estudio demuestra que la mayoría de estas propuestas no son sostenibles en condiciones reales, ya que carecen de una evaluación honesta y sistemática. En el mercado peruano, donde los inversores frecuentemente dependen de indicadores digitales y de modelos de inteligencia artificial, es crucial entender que el rendimiento prometido no debe ser tomado como garantía. La certificación de un margen de rentabilidad real requiere muestras amplias y evaluaciones que excluyan sesgos, algo que muchos fondos o plataformas aún no cumplen. Así, los inversores deben priorizar estrategias validadas por procesos de búsqueda estructurados, no solo por su apariencia tecnológica.