Машинное обучение в трейдинге: теория, модели, практика и алготорговля - страница 3667

[Удален]  
А как без разведочного анализа понять, какие листья делать и что из этого получится?)
 
Forester #:
Да, как раз и думаю, что надо стараться листья делать близкими по размеру. Но листья в которых рандом собирается все равно будут большого размера, ведь они как раз содержат примеры с малым движением цены, а таких - большинство. А мельчить рандом - тоже получишь рандом - особого смысла нет.

Думаю, что если размер листьев отличается не более 2-3 раз, то взвешивание скорее полезно (теоретически). Но нет гарантий, что не получится огромных листьев с мусором.

Бессмысленно рассматривать построение модели без рассмотрения препроцессинга и способа деления на кассы.

1. Препроцессинг. Откуда такое количество рандома? Надо работать с отбором предикторов. Источником ошибки классификации является не способ построения дерева, а то, что одно и то значение предиктора в одних случаях дает один класс, а в других случаях дает другой класс. Бессмысленно классифицировать шум.

2. На каком основании рассматривается значение 0.5. У Вас вероятность класса распределена нормально с совпадающей средней и медианой?  Как делим на классы? Существует большое количество способов деления на классы, самый примитивный и сомнительный пополам. 

 
СанСаныч Фоменко #:
классы

Насколько понимаю, у Forester речь про регрессию, а не классификацию.

 
Aleksey Nikolayev #:

Насколько понимаю, у Forester речь про регрессию, а не классификацию.

В конечном итоге, всегда классы: "покупать-продавать" или более разнообразные, но классы. И при предсказании значения стоит тот же вопрос: при какой вероятности прогноза значения принимать решение, например, покупать.

Но при прогнозе значения, ситуация имеет другую сложность: вероятность должна сопровождаться доверительным интервалом, чего я не увидел в посте, и решил, что классы.

 
СанСаныч Фоменко #:

Бессмысленно рассматривать построение модели без рассмотрения препроцессинга и способа деления на кассы.

1. Препроцессинг. Откуда такое количество рандома? Надо работать с отбором предикторов. Источником ошибки классификации является не способ построения дерева, а то, что одно и то значение предиктора в одних случаях дает один класс, а в других случаях дает другой класс. Бессмысленно классифицировать шум.

2. На каком основании рассматривается значение 0.5. У Вас вероятность класса распределена нормально с совпадающей средней и медианой?  Как делим на классы? Существует большое количество способов деления на классы, самый примитивный и сомнительный пополам. 

0,5 я упоминал в качестве примера шумного листа, в котором нет прибыли.
Вероятность (значение лиcта) в классификации 0,5 эквивалентна равенству доходов и расходов в регрессии, т.е. среднее значение листа будет = 0. Т.е. говоря про 0,5 в классификации это я делаю перевод с 0 в регрессии.

А 0,5 классификации или 0 регрессии происходит из Распределения приращений на реальном рынке


Большиство движений мелкие и слабопрогнозируемые. Поэтому они в любом случае набьются в несколько листов. И будет большим успехом, если не во все, тогда модель вообще ничего не сможет предсказать. Из них еще надо вычесть маркап, что только ухудшит ситуацию.

Но все же бывают успешные листья с уменьшенным количеством шума, и задача - не заглушить их усреднением с шумовыми листами из других деревьев при усреднении.
В общем решение к этому уже есть - стремиться делать листья более близкими по размеру, если применяется взвешивание по числу примеров.

Ну а то, каким выбирать порог для действия (buy|sell) - другой вопрос. И заслуживает отдельного рассмотрения.

[Удален]  
Классификация - это регрессия с сигмойдой на оконце. Некоторые алгоритмы принимают нормализованные в диапазон 0;1 значения. 
Шумовые предсказания группируются ближе к нулю. Можно удалить их по конфиденс левелу, если в данных меньше 50% шума. Если больше, то ничего не поможет. Затея не выгорит.
[Удален]  

Не очень понимаю чем и зачем занимается Анохин, но вот


[Удален]  
mytarmailS #:
Рецепт классифиикации  ГАРАНТИРОВАНО без переообучения

Берешь метки класса

Преддикторы пропускаешь через юмап потом  в хдскан потом ищешь такие кластера в набоюдениях которых часто попаддаеться одина метка класса..

Все... :)

Класссификатор буддет прекрасно работать на новых даанных

Сделал вообще без меток. Номера кластеров - метки классов, ну то есть перебираются все кластеры, выбираются по два: один на покупку, другой на продажу.

Устойчиво, но шумно.

Сравнение с моим способом:


 
Maxim Dmitrievsky #:

Сделал вообще без меток. Номера кластеров - метки классов, ну то есть перебираются все кластеры, выбираются по два: один на покупку, другой на продажу.

Устойчиво, но шумно.

Сравнение с моим способом:


Сделок маловато. И не видно их распределение во времени.
Может оно вот так:
Вот наглядный пример с 3386 сделками за 5 лет:
Number_vs_Time
На оба графика помещены одни и те же сделки.
Верхний график построен с равномерном шагом между сделками (как сейчас показывает тестер MetaQuotes). И выглядит перспективно.
Нижний график построен по временной шкале и показывает что эксперт торговал лишь несколько недель за 5 лет. 1 пиксель по горизонтали = 1 неделе.
По нижнему графику сразу понятно, что будут 2 года бездействия вначале, потом эксперт несколько недель поторгует и снова 2,5 года бездействия. Такая торговля уже не так интересна, как создалось впечатление от первого графика.
Что в питоне нет построителей графиков во временной шкале? Вроде не сложная штука... я вот себе в броузере рисую.
[Удален]  
Forester #:
Сделок маловато. И не видно их распределение во времени.
Может оно вот так: Что в питоне нет построителей графиков во временной шкале? Вроде не сложная штука... я вот себе в броузере рисую.
Да что вы привязались к этому времени :) алгоритмы поиска закономерностей обсуждаются.

Что дальше с ними делать - каждый д. как хочет :)

Разные алгоритмы находят одинаковые закономерности, но по-разному плохо, понимаете ли.