样本内结果不是证据:我们亲手停用自家 AI 模型学到的东西

9 九月 2026, 02:01
Kenichiro Sakamoto
0
5
一个已经看过评分数据的模型,看起来一定很出色。那不是关于市场的发现,那是对记忆的描述。唯一有价值的数字,只能来自模型在拟合时从未见过的数据。

样本内到底是什么意思
如果一套策略的参数、或一个机器学习模型的权重,是用某段时期挑出来的,那么在同一段时期上测得的结果在构造上就已被污染。这组拟合之所以被选中,恰恰因为它在那里表现好。把这个分数当成绩效来报告,是披着图表外衣的循环论证。

优化本身就是一种训练
这不只是 AI 的问题。把策略测试器的优化器跑在某段时期上、再公布最好的结果,是同一个错误,只是词汇小一些。参数越多、试过的组合越多,胜出者被拟合到噪声上的概率就越高。

买家应该问什么
参数是在哪段时期挑选的?公布的数字又来自哪段时期?如果两者相同,这个数字对未来毫无说明力。如果卖家答不上来,就当作两者相同。

我们自家的模型后来怎样了
GOLD NEURON 2.x 版所搭载的 ONNX 模型,使用 2020 年 1 月至 2026 年 7 月的数据训练。它在该窗口内的回测属于样本内拟合,从未来自实盘。在 2016 至 2019 年的样本外年份,该模型在我们的测试中亏损,前瞻账户的期望值为负。因此我们在 3.10 版更换了引擎。旧回测我们没有悄悄删除,而是标注为样本内后继续保留公开。

留下的教训
一条漂亮的样本内曲线不是弱证据,而是根本不是证据。诚实的做法不是为模型辩护,而是让它退役,并在产品说明中写明是哪段窗口训练了它。


如果某个数字来自训练窗口内部,我们会在产品说明中直接标注为样本内(in-sample)。完整列表:fxea365.com/ea/ranking