Discusión sobre el artículo "Superando las limitaciones del aprendizaje automático (Parte 2): Falta de reproducibilidad"
Devastating.
Thank you so much for the article.
Me pareció muy interesante la tesis principal del artículo, sobre todo la idea de que un modelo de aprendizaje automático puede comportarse de forma bastante diferente en función de los datos que proporcione cada bróker.
Sin embargo, al leer el análisis, me he dado cuenta de un importante problema metodológico que podría tener un impacto significativo en las conclusiones.
Los dos conjuntos de datos históricos comienzan en fechas diferentes, pero posteriormente se combinan utilizando:
pd.concat([A, B], axis=1) Dado que ambos DataFrames tienen índices enteros consecutivos, Pandas los alinea por índice en lugar de por marca de tiempo. Esto significa que muchas filas de A y B pueden corresponder, en realidad, a días de negociación distintos.
Por ejemplo, si A comienza en 2019 y B en 2020, la fila 0 de ambos conjuntos de datos no representa el mismo momento en el tiempo. Esto podría afectar directamente a la correlación obtenida, a las diferencias en las medias y varianzas, y a varias de las comparaciones posteriores entre los dos corredores.
Creo que, antes de extraer conclusiones de estas comparaciones, habría que sincronizar primero los dos conjuntos de datos por «tiempo», utilizando únicamente marcas de tiempo comunes, por ejemplo, mediante una «fusión» o «unión» en la columna de fecha y hora.
La idea principal del artículo parece válida y muy relevante, pero tal y como está diseñado actualmente el experimento, no estoy seguro de que los resultados presentados lo demuestren de forma concluyente.
Sería muy interesante ver cómo cambian los resultados tras repetir el análisis con ambos conjuntos de datos correctamente alineados en el tiempo. 😉
Está perdiendo oportunidades comerciales:
- Aplicaciones de trading gratuitas
- 8 000+ señales para copiar
- Noticias económicas para analizar los mercados financieros
Registro
Entrada
Usted acepta la política del sitio web y las condiciones de uso
Si no tiene cuenta de usuario, regístrese
Artículo publicado Superando las limitaciones del aprendizaje automático (Parte 2): Falta de reproducibilidad:
Para este análisis, seleccioné al azar dos brókers que yo, personalmente, utilizo para operar de forma independiente. De acuerdo con nuestras normas de la comunidad, que prohíben la promoción de brókeres, sus nombres han sido omitidos y sustituidos por «Bróker A» y «Bróker B».
Utilizando la biblioteca MetaTrader 5 de Python, solicité cuatro años de datos históricos diarios del par EURUSD a ambos brókeres. Tras revisar los datos, observé que las marcas de tiempo no coincidían: los datos de un bróker se remontaban a septiembre de 2019, mientras que los del otro solo llegaban hasta agosto de 2020. Sin embargo, ambos devolvieron exactamente 1.460 filas de datos diarios, cumpliendo correctamente con nuestra solicitud.
Dada la naturaleza descentralizada de los brókers, es de esperar que sus zonas horarias de funcionamiento difieran. Sin embargo, resultan menos evidentes los efectos del horario de verano, los días festivos oficiales y otras discrepancias sutiles, que pueden distorsionar aún más la sincronización de las marcas de tiempo.
A continuación, calculamos la rentabilidad del EURUSD a 10 días en ambos brókers y observamos que las propiedades numéricas del símbolo EURUSD no coincidían entre sí. La rentabilidad media del EURUSD a 10 días con el bróker A fue de 0,000267, mientras que con el bróker B la rentabilidad media a 10 días fue de -0,000352. Esto representa una diferencia de aproximadamente el 232% en la rentabilidad esperada del mismo activo subyacente.
Para empeorar las cosas, parece que la rentabilidad esperada del bróker A conlleva un 21 % más de riesgo que la rentabilidad esperada del bróker B. Así lo sugiere el hecho de que la varianza en la rentabilidad entre ambos brókeres aumentó en la misma proporción, un 21 %.
Autor: Gamuchirai Zororo Ndawana