Машинное обучение в трейдинге: теория, модели, практика и алготорговля - страница 3354

[Удален]
СанСаныч Фоменко #:

Как-то не обращаете внимания на мои посты, сосредоточившись на вероятностях. Не важно как называется вероятность, важно, что если не улучшается, то модель переобучена, в корзину. Ошибка предсказания на ООВ, ООС и ВНЕ должна быть примерно одинакова. 

Вот еще гистограмма

Другой алгоритм - другая гистограмма, хотя метки и предикторы одинаковы. Если Вы ищите некий теоретические вероятности, подразумевая, что разные алгоритмы классификации будут давать одинаковые гистограммы ... мне это в голову не приходит, так как приходится работать с конкретными алгоритмами и они будут предсказывать и их надо оценивать, а не какой-то теоретический идеал. Здесь главная оценка - это переобучение модели, а не близость вероятностей к некоему теоретическому идеалу.

Сдаетесь? Загуглите classification probability calibration, в R должно быть.

И probability curve своей модели постройте, в сравнении с эталоном.
Maxim Dmitrievsky #:
Сдаетесь? Загуглите classification probability calibration, в R должно быть.

И probability curve своей модели постройте, в сравнении с эталоном.

Мы говорим о разном.

Я пишу о результате, а Вы об идеале промежуточных данных.

Для меня очевидно, что значения вероятности конкретных меток, которые дает RF и ada, будут разными, а вот предсказания конкретных меток практически одинаково. Меня не интересуют значения вероятностей, меня интересует ошибка предсказания

Если теоретизировать, то вероятность класса в Вашем смысле скорее всего получить невозможно, так как надо доказать, что Ваша вероятность удовлетворяет предельной теореме, а это очень сомнительно.  

[Удален]
СанСаныч Фоменко #:

Мы говорим о разном.

Я пишу о результате, а Вы об идеале промежуточных данных.

Значения вероятности классов, которые дает RF и ada будут разными, а вот предсказания конкретных меток практически одинаково. Меня не интересуют значения вероятностей, меня интересует ошибка предсказания.

Если теоретизировать, то вероятность класса в Вашем смысле скорее всего получить невозможно, так как надо доказать, что Ваша вероятность удовлетворяет предельной теореме, а это очень сомнительно.  

Тем не менее, изначальный вопрос был, никто не ответил. Я говорю ровно о том, о чем спросил.
Значит есть к чему стремиться.
Maxim Dmitrievsky #:
Тем не менее, изначальный вопрос был, никто не ответил.
Значит есть к чему стремиться.

Зачем? Если в смысле диссертации....

[Удален]
СанСаныч Фоменко #:

Зачем? Если в смысле диссертации....

Потому что трейдинг с кривыми вероятностями означает получение убылей вместо прибылей. Любой классификатор нуждается в калибровке, если это чувствительное к риску приложение.
[Удален]
Ну наконец-то.
Maxim Dmitrievsky #:
Я надеялся, что кто-нибудь хотя бы загуглит по наводке.

Даже если у вас на обучении кривые вероятности, о каких новых данных может идти речь. А бустинг и форест сильно грешат этим. Бустинг слишком самоуверен, форест недоуверен. При условии, конечно, что вообще планируете использовать порог.

Я сам наблюдал, как при увеличении порога, качество сделок не улучшается даже на трейне. Тогда вероятность чего модель возвращает? Ничего :)

На картинке Саныча самоуверенный бустинг, видно по выбросам краевых столбцов. Впадина должна быть более плавной. Это переобучения модель.

Это train - показан исход модели на диапазонах "вероятности" с шагом 0,05. CatBoost достаточно точно ставит разделение классов на 0,5 (магнетта - 1, аква - 0).

Можно видеть, что фин результат положительный начинается при 0,35 - зелёная кривая подымается над красной.

Вы именно это хотите калибровать - смещение точки разделения классов к точки получения доходов?

[Удален]
Aleksey Vyazmikin #:

Вы именно это хотите калибровать - смещение точки разделения классов к точки получения доходов?

Нет.
Ля.. Тут 30 раз спросить не лень, но раз загуглить впадлу