Por qué tu backtest miente

Analizamos 17 robots que brillaban en el papel. Ninguno con edge real sobrevivió a los ticks del mercado. Con datos, no opiniones.

La trampa que arruina cuentas

Casi todos los robots (EAs) que se compran y venden llegan con un backtest espectacular: factor de beneficio alto, curva de equity impecable. El truco es que ese backtest usa un modelo de ticks sintético —precios generados por el simulador— y no la realidad del mercado: spreads reales, slippage y la microestructura de cada tick.

La consecuencia: un robot puede lucir un Profit Factor de 1,68 en el simulador y perder dinero con ejecución real. No es teoría. Lo hemos medido, robot a robot, con ticks reales del bróker.

La prueba: simulador contra ticks reales

Sometimos a un doble juez —supervivencia en ticks reales frente al backtest sintético— a una familia de 17 robots (variantes de la misma idea sobre oro: entrada por order-block más filtro de tendencia). En el simulador varios parecían oro puro. En ticks reales, la verdad (muestra representativa):

RobotPF simuladorPF realNeto real (1.000 $)
PHALANX1,680,74−878 $
TITAN1,460,84−571 $
IRON DOME1,400,89−395 $
ADAPTIVE1,330,78−820 $
VANGUARD1,250,74−196 $
GHOST PROTOCOL 21,010,68−775 $
V3.1 «Golden Phalanx»1,010,38−959 $
V3 «Oracle of Delphi»0,950,50−857 $

El patrón es uniforme y demoledor: el espejismo sintético se desploma contra los fills reales. Y ojo: los dos «favoritos» con filtro horario Kill Zone (Golden Phalanx y Oracle of Delphi) fueron de los peores en real —PF 0,38 y 0,50, probabilidad de ruina cercana al 100%—. Un filtro bonito no salva una lógica sin edge.

El caso sutil: sobrevivir a los ticks no basta

Un robot sí sobrevivió a los ticks reales (supervivencia 103%). Parecía el bueno. Pero un Monte Carlo de la cola —el peor escenario derivado de su propia lógica, no la media— reveló una probabilidad de ruina del 41%. Es un «vendedor de seguros»: cobra primas pequeñas durante meses hasta que un gap con el grid cargado se lleva la cuenta. El backtest de 3 semanas jamás ve ese día.

Cómo se valida de verdad (los cuatro filtros que casi nadie aplica)

  1. Supervivencia en ticks reales: el mismo robot en ticks reales frente a sintéticos. Si el resultado cambia, era un espejismo.
  2. Monte Carlo de cola: probabilidad de ruina con la cola exacta derivada de la lógica del robot, no una media optimista.
  3. Walk-forward: ¿el edge aguanta en ventanas de tiempo que el robot no vio al ajustarse?
  4. Meseta (sensibilidad): se perturban los parámetros ±15%. Si un solo ajuste lo rompe, era sobreajuste disfrazado.
Cómo se ve uno que SÍ pasa

Para contraste, un robot criado y filtrado con este proceso: PF fuera de muestra 1,31 · supervivencia en ticks reales 99,8% · probabilidad de ruina 0% · meseta 6/6 variantes sanas. La diferencia con la tabla de arriba no es suerte: es el método.

Conclusión

No te fíes de un backtest bonito. Antes de poner un euro real en un robot —tuyo o comprado—, la pregunta correcta es: ¿sobrevive a ticks reales, a su cola de riesgo y a perturbar sus parámetros? Si no lo has medido, no lo sabes.