Обсуждение статьи "Возможности Мастера MQL5, которые вам нужно знать (Часть 82): Использование паттернов TRIX и WPR в обучении с подкреплением DQN"

 

Опубликована статья Возможности Мастера MQL5, которые вам нужно знать (Часть 82): Использование паттернов TRIX и WPR в обучении с подкреплением DQN:

В предыдущей статье мы рассмотрели сочетание Ишимоку и ADX в рамках обучения на основе инференса. В этой статье мы вновь обращаемся к обучению с подкреплением применительно к паре индикаторов, которую уже рассматривали в части 68: TRIX и Williams Percent Range. В этой статье используем алгоритм алгоритм DQN с квантильной регрессией. Как обычно, представляем его в виде пользовательского класса сигнала, предназначенного для использования с Мастером MQL5.

Стратегии на основе этих индикаторов обычно опираются на фиксированные правила. Например: "покупать, когда TRIX пересекает нулевой уровень снизу вверх, а WPR ниже -80" или "продавать, когда TRIX достигает пика, а WPR выше -20". Эти правила детерминированы и легко проверяются на исторических данных, но имеют общий недостаток: предполагают неизменность взаимосвязей на высокодинамичном рынке. Поэтому при изменении рыночных условий точность таких правил может снижаться, а "абсолютные пороги" требуют корректировки. 

Эта проблема подводит нас к обучению с подкреплением (RL). Обучение с подкреплением – один из методов машинного обучения, в котором агент на основе опыта взаимодействия со средой обучается выбирать подходящие действия. Вместо того чтобы полагаться только на заданные пороги индикаторов, агент RL исследует разные уровни порогов и корректирует торговые решения, стремясь максимизировать долгосрочное вознаграждение. Для большинства трейдеров это означало бы систему, которая не просто следует правилам, а адаптируется – по крайней мере, в теории.

Один из многообещающих для торговли методов RL – Deep Q Network (DQN). В отличие от моделей обучения с учителем, которые напрямую сопоставляют входные и выходные данные, DQN оценивают ценность определенных действий в заданных состояниях. В торговом контексте состояниями могут служить признаки, полученные из индикаторов и представленные в преобразованном виде, в виде двоичных значений или даже исходных сырых данных. В этой статье используются индикаторы TRIX и WPR. Действия могут соответствовать покупке, продаже или сохранению нейтральной позиции. RL-алгоритм DQN позволяет оценивать и уточнять эти действия на основе опыта, а не фиксированных произвольных правил.


Автор: Stephen Njuki