Segun arXiv q-fin, un nuevo enfoque en el diseño de estrategias de mercado aprovecha el aprendizaje profundo para superar limitaciones de modelos tradicionales. Estos modelos clásicos, como el de Avellaneda-Stoikov o su extensión GLFT, ofrecen fórmulas cerradas para fijar precios, pero dependen de supuestos que pierden validez en escalas de tiempo reales. Uno de esos supuestos es que el flujo de órdenes es estacionario, es decir, que no cambia con el tiempo. Sin embargo, los datos empíricos indican que el mercado presenta regímenes dinámicos, posiblemente influenciados por ejecuciones algorítmicas de órdenes metas. En tales condiciones, los métodos convencionales generan pérdidas netas.
El estudio presenta una nueva estrategia de mercado basada en aprendizaje profundo (RLMM), que utiliza un algoritmo de red neuronal distribucional (C51), similar en estructura a los modelos Rainbow. Este sistema se calibra y prueba en un libro de órdenes de baja inteligencia, donde se observa que domina a GLFT en toda la frontera de riesgo-retorno. La RLMM demuestra mayor estabilidad frente a desequilibrios en el flujo de órdenes, pero también enfrenta caídas pronunciadas cuando se acumulan órdenes en un solo sentido, un fenómeno conocido como saturación de inventario. Para mitigar este problema, se incorporan dos señales auxiliares: una filtración bayesiana para detectar cambios en el sesgo del flujo direccional y otra que mide el desequilibrio entre exposición de precios y longitud de cola de órdenes. Esta modificación restaura la rentabilidad. Finalmente, una etapa adicional basada en simulación de escenarios ajusta los resultados de regímenes de baja ganancia, mejorando el rendimiento bajo condiciones de estrés como persistencia aleatoria o correlación de direcciones.
Para los inversionistas peruanos, este hallazgo implica que las estrategias tradicionales de mercado pueden dejar de ser efectivas en mercados con dinámicas cambiantes, como los que enfrenta el mercado de valores peruano. Las operaciones algorítmicas, cada vez más comunes en plataformas de trading, pueden generar ciclos de flujo que desafíen modelos que asumen estabilidad. Aunque los algoritmos de aprendizaje profundo prometen mayor adaptabilidad, su rendimiento depende de cómo se integran señales de cambio en el comportamiento del mercado. En el contexto peruano, donde la volatilidad de los valores es alta y las condiciones macroeconómicas cambian frecuentemente, una estrategia flexible y que detecte transiciones de régimen podría ser clave. Es importante destacar que estos modelos no eliminan el riesgo, sino que lo gestionan mejor bajo condiciones reales. Por ello, los inversores deben evaluar no solo el rendimiento esperado, sino también la capacidad de adaptación de cualquier estrategia al entorno dinámico del mercado local.