Обсуждение статьи "Нейросети в трейдинге: Управление риском через распределение результатов (AC-SRM)"

 

Опубликована статья Нейросети в трейдинге: Управление риском через распределение результатов (AC-SRM):

Средняя доходность не показывает, как распределены возможные прибыли и убытки, а значит, скрывает часть риска торговой стратегии. AC-SRM переносит этот риск в сам процесс обучения: политика оценивается по распределению результатов через спектральную меру риска, а не только по среднему значению. Практическую реализацию начинаем с OpenCL-кернела FQF_DistributionTargetGradient, который выбирает ближайшего к цели представителя распределения и формирует градиенты его значения и вероятности, подготавливая распределительный Критик для дальнейшей риск-ориентированной оптимизации.

На финансовом рынке одной высокой средней доходности недостаточно. Важно понимать, какой ценой она получена. Две стратегии могут показывать одинаковый средний результат. Первая дает умеренную прибыль при небольшом разбросе исходов. Вторая чередует крупные выигрыши с глубокими просадками. Для практической торговли это уже две разные стратегии.

Та же проблема возникает в обучении с подкреплением. В классическом Actor–Critic решение обычно строится вокруг ожидаемого вознаграждения. Критик оценивает последствия действия. Актер меняет политику так, чтобы увеличить эту оценку. Математическое ожидание удобно для оптимизации, но оно сворачивает распределение возможных результатов в одно число. Неблагоприятный хвост перестает быть виден как отдельная часть распределения.

Для трейдера это существенная потеря информации. Средняя прибыль важна, но сама по себе она мало говорит о характере риска. Нас интересуют вероятность крупных потерь, их глубина и концентрация результатов в неблагоприятной области распределения. Логичнее учитывать это отношение к риску уже во время обучения политики.

Эту задачу рассматривают Mehrdad Moghimi и Hyejin Ku в работе "Risk-sensitive actor-critic with static spectral risk measures for online and offline reinforcement learning". Они предлагают фреймворк AC-SRM для прямой оптимизации статической спектральной меры риска. Спектральная мера работает с квантилями распределения возврата. Разные части распределения получают разный вес. Так политика учитывает не только среднее значение, но и структуру возможных исходов.

AC-SRM строится как двухуровневая оптимизация. Во внешнем контуре функция риска согласуется с распределением возврата текущей политики. Во внутреннем контуре политика обучается при уже зафиксированной функции риска. Для оценки распределения нужен распределительный Критик. Такая схема сохраняет статическую постановку риска и не превращает ее в цепочку локальных штрафов на каждом шаге.


Автор: Dmitriy Gizlyk