Машинное обучение в трейдинге: теория, модели, практика и алготорговля - страница 3608

[Удален]  
СанСаныч Фоменко #:

Вполне согласен, чт что по имеющемуся кластеру ВСЕГДА можно указать соответствующую метку.

Все это прекрасно на этапе обучения, когда формируем и в конечном итоге имеем кластеры и присваиваем им метки.

Но это  обучение!

Но реальность совершенно другая: по имеющемуся/имеющимся кластеру/кластерам сказать какая метка будет в будущем! и когда под эту будущую метку сформируется кластер и для сформированного кластера мы одно значно назначим метку, то совпадет предсказанная метка с фактической?

Т.е. будущая метка определяется вероятностью.

Здесь уже включается тервер, верно, наверное лучше объяснять с его помощью. Но у меня пока нет до конца сформулированной теории. Поэтому предложение к мозговитым спецам помочь ее сформулировать :) 

Я сформулировал для себя через теорию обучения. Уменьшая переобучение на шум, улучшается результат на новых данных. То есть не утверждается, что создаётся Грааль. Утверждается, что снижается переобученность, как следствие - лучше на новых данных. А этого уже достаточно для большинства трейдунов. 

Достаточно простые предпосылки и оригинальная реализация. 
 
Maxim Dmitrievsky #:
Вообще не хотелось бы продолжать эту тему, потому что кто-то не понимает чем обучение отличается от оптимизации.

Я не понимаю. Не продолжаем.

[Удален]  
fxsaber #:

Я не понимаю. Не продолжаем.

Собственно, снова вырвана часть моего ответа, а смысловая часть пропущена. Так действуют только оптимизаторшики.

В итоге перевираются все сообщения.
 

Maxim Dmitrievsky #:

Уменьшая переобучение на шум, улучшается результат на новых данных. 

Вашим методом упрощается обучение модели. Для нее как бы шума меньше и она легче обучится. Тому же дереву будет проще выделить в данных кластер в котором все 100% примеров =1, а не 60% примеров.
Но помечая 40% примеров другим классом, вы добавляете шум в торговлю, вместо 0 ставите 1.

Но графики у вас достаточно стабильно и перспективно выглядят и на ООС.
Не планируете сигнал сделать? Даже без подписки, просто чтобы посмотреть, что в реале на ООС будет.

[Удален]  
Forester #:

Вашим методом упрощается обучение модели. Для нее как бы шума меньше и она легче обучится. Тому же дереву будет проще выделить в данных кластер в котором все 100% примеров =1, а не 60% примеров.
Но помечая 40% примеров другим классом, вы добавляете шум в торговлю, вместо 0 ставите 1.

Но графики у вас достаточно стабильно и перспективно выглядят и на ООС.
Не планируете сигнал сделать? Даже без подписки, просто чтобы посмотреть, что в реале на ООС будет.

Сигналы не хочу, хочу хедж фонд. Или просто очень много денег на карте. Не играю в сигналы.

Да, вы верно интерпретируете весь процесс.
 
Maxim Dmitrievsky #:
Сигналы не хочу, хочу хедж фонд. Или просто очень много денег на карте.

)))))))))

зрело

[Удален]  
Сравнительно недавно натолкнулся на весьма толковый ресурс по ML.
Open Source Research for Business
  • 2021.03.30
  • www.firmai.org
Home page for FirmAI Open Science
[Удален]  

Чтобы увидеть весь ужас, который творится в разметке, распечатал количество элементов в каждом кластере и отклонение среднего меток от 0.5, по убыванию:

Cluster 83: Count = 18, Mean = 0.33
Cluster 70: Count = 187, Mean = 0.22
Cluster 82: Count = 436, Mean = 0.10
Cluster 73: Count = 457, Mean = 0.09
Cluster 89: Count = 961, Mean = 0.09
Cluster 7: Count = 380, Mean = 0.09
Cluster 94: Count = 670, Mean = 0.09
Cluster 79: Count = 681, Mean = 0.08
Cluster 38: Count = 250, Mean = 0.08
Cluster 62: Count = 24, Mean = 0.08
Cluster 14: Count = 483, Mean = 0.08
Cluster 23: Count = 516, Mean = 0.08
Cluster 41: Count = 1181, Mean = 0.08
Cluster 60: Count = 412, Mean = 0.08
Cluster 2: Count = 667, Mean = 0.08
Cluster 12: Count = 651, Mean = 0.07
Cluster 0: Count = 646, Mean = 0.07
Cluster 39: Count = 1077, Mean = 0.07
Cluster 43: Count = 455, Mean = 0.06
Cluster 4: Count = 581, Mean = 0.06
Cluster 99: Count = 713, Mean = 0.06
Cluster 71: Count = 1368, Mean = 0.06
Cluster 72: Count = 1487, Mean = 0.06
Cluster 31: Count = 1340, Mean = 0.06
Cluster 51: Count = 1340, Mean = 0.06
Cluster 1: Count = 756, Mean = 0.06
Cluster 69: Count = 936, Mean = 0.05
Cluster 93: Count = 590, Mean = 0.05
Cluster 90: Count = 852, Mean = 0.05
Cluster 77: Count = 936, Mean = 0.05
Cluster 8: Count = 274, Mean = 0.05
Cluster 34: Count = 1050, Mean = 0.05
Cluster 86: Count = 979, Mean = 0.05
Cluster 58: Count = 508, Mean = 0.05
Cluster 66: Count = 632, Mean = 0.04
Cluster 55: Count = 556, Mean = 0.04
Cluster 75: Count = 1118, Mean = 0.04
Cluster 80: Count = 2365, Mean = 0.04
Cluster 65: Count = 334, Mean = 0.03
Cluster 53: Count = 1592, Mean = 0.03
Cluster 63: Count = 237, Mean = 0.03
Cluster 22: Count = 1155, Mean = 0.03
Cluster 27: Count = 1454, Mean = 0.03
Cluster 98: Count = 1062, Mean = 0.03
Cluster 88: Count = 17, Mean = 0.03
Cluster 5: Count = 767, Mean = 0.03
Cluster 67: Count = 1543, Mean = 0.03
Cluster 46: Count = 645, Mean = 0.03
Cluster 24: Count = 1028, Mean = 0.03
Cluster 85: Count = 498, Mean = 0.03
Cluster 37: Count = 1992, Mean = 0.03
Cluster 57: Count = 1523, Mean = 0.02
Cluster 26: Count = 476, Mean = 0.02
Cluster 28: Count = 695, Mean = 0.02
Cluster 10: Count = 1630, Mean = 0.02
Cluster 32: Count = 1522, Mean = 0.02
Cluster 50: Count = 651, Mean = 0.02

Приведен не полный список. Кластеров с отклонением >= 0.1 всего 3. То есть количество меток на бай и селл отличается на 10%.

В остальных кластерах противоположные метки выпали с вероятностью почти что 50%.

Для обучения модели это сущий ад, потому что она не уверена ни в чем.

Посмотрим что там будет за торговля если выбрать, исправить и торговать всего 3 этих кластера:

Ну такое себе, сидеть и выбирать эти кусочки, хоть они и плюсуют на ООС.

А если взять целый пакет кластеров выше некоторого порога вероятности и исправить их:

уже лучше, при пороге 0.03. Немножко подготовил код для основной цели - для расчета правильных комбинаций кластеров.

 
Maxim Dmitrievsky #:

Чтобы увидеть весь ужас, который творится в разметке

А есть полный код, начиная с загрузки данных и заканчивая тестом модели
[Удален]  
mytarmailS #:
А есть полный код, начиная с загрузки данных и заканчивая тестом модели

Потом скину, когда доделаю вероятности

статью может