Машинное обучение в трейдинге: теория, модели, практика и алготорговля - страница 3531

 
Maxim Dmitrievsky #:
на рисунке вероятность выбора устойчивого квантового отрезка на каждой итерации
на рисунке вероятность выбора устойчивого квантового отрезка на каждой итерации
 
Aleksey Vyazmikin #:
на рисунке вероятность выбора устойчивого квантового отрезка на каждой итерации

А что за итерации? Вряд ли обучение дополнительных деревьев. Какой то ваш собственный цикл. Что он делает?

[Удален]  
Aleksey Vyazmikin #:
на рисунке вероятность выбора устойчивого квантового отрезка на каждой итерации
Да. На каждой итерации чего?
 
Maxim Dmitrievsky #:
Да. На каждой итерации чего?
Forester #:

А что за итерации? Вряд ли обучение дополнительных деревьев. Какой то ваш собственный цикл. Что он делает?

Вот описывал этот метод - ниже вставка - итерации по нему там показаны.

Форум по трейдингу, автоматическим торговым системам и тестированию торговых стратегий

Машинное обучение в трейдинге: теория, модели, практика и алготорговля

Aleksey Vyazmikin, 2024.05.05 08:24

Ну, розные подходы, в моём методе происходит дистилляция данных, особенно актуально при сильном дисбалансе классов. Вместе с процессом отсева происходит исследование данных на каждой итерации. Изначально - это метод разведывательный для отбора предикторов и квантовых таблиц. Дополнительная задача - облегчить обучения другим классификаторам за счет удаления примеров в выборке по сложно выявляемым диапазонам предикторов.

Процесс можно представить в виде такого вот дерева


На дереве прошло 2 итерации и пришли к третей. В овале данные, которые больше не исследуем далее при построении текущей модели - класс "0".

И вот так я делал 100 итераций и смотрел, какая вероятность сделать сплит, который будет так же эффективно отсеивать нули от единиц на новых данных.


 
Maxim Kuznetsov #:

мелкая, гадкая, доставучая ошибка для расписаний, сессий и всего что про реальное время: реальное кол-во минутных баров в день != 1440 (точнее не всегда равно)..так-же для 5-ти минуток и даже для 15

надо или пропущенные бары дописывать до 1440 или добавлять в данные и рассчёты поле "время"

Вполне знаком с этой (и кучей прочих) особенностей котировок. В данном коде пропуски учтены посредством того, что (а) приращения считаются по опен/клоуз одного бара, а не по соседним барам; (б) номер бара в сутках определён только его временем в сутках и не зависит от числа пропущенных в сутках баров до него; (в) корреляция считается со следующим наличествующим баром, который не всегда оказывается баром со следующим  суточным номером.

Такой подход заметно всё упрощает и оставляет точность достаточной. Если бы "расписание разворотов" существовало, то оно наверняка проявило бы себя при подобном анализе, который бы имело смысл уточнять далее. Пока же очевидно что "расписание" если и существует, то совсем не как фиксированное время суток для разворота.

 
Aleksey Vyazmikin #:

Вот описывал этот метод - ниже вставка - итерации по нему там показаны.

На рисунке получены листья на глубине дерева = 2. Вы делали глубину всех веток до 100. Или число листьев доводили до 100.
Это самописное дерево или Катбуст?
 
Aleksey Vyazmikin #:

Вот пример первых экспериментов, на рисунке вероятность выбора устойчивого квантового отрезка на каждой итерации - отдельно для каждого класса (думаю, по названию кривой понятно), где в названии кривой буква D - там использовался описанный метод - красная кривая.

В целом можно говорить о положительном эффекте. Да, пока он не значителен, но есть разные вариации по реализации процесса. Я доволен, предварительным положительным результатом.

Очень странно, что на первой итерации/глубине/листе у вас вероятность устойчивого кванта 80%, (я так понимаю это хорошо). И потом из за каких-то манипуляций она падает до 30%. Непонятно, в чем положительный эффект вы увидели, это же ухудшение.

 
Forester #:
На рисунке получены листья на глубине дерева = 2. Вы делали глубину всех веток до 100. Или число листьев доводили до 100.

Пока максимальное число итераций - 300. Я хотел бы пояснить, что на рисунке показаны только выбранные алгоритмом сплиты, там нет кандидатов, а оценка на графике происходит и по выбранным и по кандидатам. Ну и отмечу, что алгоритм в виде дерева представлен для наглядного понимания процесса, на самом деле дерево, как таковое, не строится - графы\ветки не просчитываются, каждая итерация почти как запуск алгоритма с начала, но без учёта выбывших строк в выборке на прошлых итерациях.

Forester #:
Это самописное дерево или Катбуст?

Самописный алгоритм.

Forester #:

Очень странно, что на первой итерации/глубине/листе у вас вероятность устойчивого кванта 80%, (я так понимаю это хорошо). И потом из за каких-то манипуляций она падает до 30%. Непонятно, в чем положительный эффект вы увидели, это же ухудшение.

Положительный эффект я измерял через средний показатель на каждой итерации, возможно нужно доработать это измерение, но пока не придумал, как бы это сделать лучше. Вот как выглядит разница между двумя графиками.

На каждой итерации происходит добавление и выбытие отобранных квантовых отрезков.

На графиках ниже можно видеть для конкретного предиктора на каждой итерации процент квантовых отрезков из числа прошедших отбор, которые сохраняют смещение вероятности на отложенных выборках. При этом -100 - ни один из квантовых отрезков не оказался эффективным на новых данных.


[Удален]  
Aleksey Vyazmikin #:

Вот описывал этот метод - ниже вставка - итерации по нему там показаны.


Правила вытаскиваете, получается. Но в виде признаков и меток. Чем сложнее правило, тем в нем больше шума, вероятность отнесения к конкретному классу уменьшается.
 
Maxim Dmitrievsky #:
Правила вытаскиваете, получается. Но в виде признаков и меток. Чем сложнее правило, тем в нем больше шума, вероятность отнесения к конкретному классу уменьшается.

В целом - да - одна из задач. Вот и ищу методы поддержания вероятности на должном уровне.