인샘플 결과는 증거가 아니다 — 우리 손으로 자사 AI 모델을 폐기하며 배운 것

9 9월 2026, 06:00
Kenichiro Sakamoto
0
3
채점 대상 데이터를 이미 본 모델은 훌륭해 보입니다. 그것은 시장에 대한 발견이 아니라 기억에 대한 서술입니다. 가치 있는 수치는, 적합 과정에서 모델이 한 번도 보지 못한 데이터에서만 나옵니다.

인샘플이란 실제로 무엇인가
전략의 파라미터나 머신러닝 모델의 가중치가 특정 기간을 사용해 선택되었다면, 같은 기간에서 측정한 성과는 구조적으로 오염되어 있습니다. 그 적합은 바로 거기서 점수가 좋았기 때문에 선택된 것입니다. 그것을 성능이라 보고하는 것은 차트를 입힌 순환논법입니다.

최적화도 학습의 일종이다
이는 AI만의 문제가 아닙니다. 전략 테스터의 최적화를 어떤 기간에 돌려 최고 결과를 공개하는 것도, 어휘만 작을 뿐 똑같은 잘못입니다. 파라미터가 많고 시도한 조합이 많을수록, 승자가 잡음에 맞춰졌을 확률은 커집니다.

구매자가 물어야 할 것
파라미터는 어느 기간에서 선택되었고, 공개된 수치는 어느 기간의 것인가. 둘이 같다면 그 숫자는 미래에 대해 아무것도 말하지 않습니다. 판매자가 답하지 못한다면, 답은 '같다'라고 보십시오.

우리 모델에 일어난 일
GOLD NEURON 버전 2.x에 탑재한 ONNX 모델은 2020년 1월부터 2026년 7월까지의 데이터로 학습했습니다. 그 구간 안의 백테스트는 인샘플 적합이며 실거래로 얻은 것이 아닙니다. 2016~2019년 아웃오브샘플 구간에서 이 모델은 우리 테스트에서 손실을 냈고, 포워드 계좌도 기대값이 음수였습니다. 그래서 버전 3.10에서 엔진을 교체했습니다. 이전 백테스트는 조용히 지우지 않고 '인샘플'로 표기한 채 남겨 두었습니다.

남은 교훈
인상적인 인샘플 곡선은 약한 증거가 아니라, 증거가 아닙니다. 정직한 선택은 모델을 옹호하는 것이 아니라 폐기하고, 어느 기간이 그것을 학습시켰는지 제품 설명에 적는 것이었습니다.


수치가 학습 기간 내부에서 나온 것이라면, 우리는 제품 설명 자체에 인샘플이라고 표기합니다. 전체 목록: fxea365.com/ea/ranking