Машинное обучение в трейдинге: теория, модели, практика и алготорговля - страница 3353

[Удален]
То, что получаете на выходе моделей, не является вероятностями классов. Аналогия - регрессия, которая отдает одно значение. Классификатор работает по тому же принципу, он отдает значение (raw value), пропущенное через сигмоиду, а не вероятность.

Как получить вероятность?
Maxim Dmitrievsky #:
Как вы поняли, что классификатор дает правильные вероятности?  А не просто значения в диапазоне. Вы читаете, что вам пишут?

Если вы поставите порог 0.8, будет ли 80% сделок прибыльными? А если 0.51?

Почти что однозначно, что у вас такого не будет. Проверяйте.

Очень много раз проверял. Это база для ТС. 

Еще раз, если это не так, то переобучена.

Maxim Dmitrievsky #:
То, что получаете на выходе моделей, не является вероятностями классов. Аналогия - регрессия, которая отдает одно значение. Классификатор работает по тому же принципу, он отдает значение (raw value), пропущенное через сигмоиду, а не вероятность.

Как получить вероятность?

Пропуская через сигмоиду получаем класс, а не вероятность класса.

[Удален]
СанСаныч Фоменко #:

Пропуская через сигмоиду получаем класс, а не вероятность класса.

Получаем какое-то значение, которое называется probability, но по факту таковым не является.
[Удален]
СанСаныч Фоменко #:

Очень много раз проверял. Это база для ТС. 

Еще раз, если это не так, то переобучена.

Не верю на слово, есть тесты для этого.
Maxim Dmitrievsky #:
Вы вопросом на вопрос отвечать будете? Я знаю однозначный ответ, если что.
Maxim Dmitrievsky #:
То, что получаете на выходе моделей, не является вероятностями классов. Аналогия - регрессия, которая отдает одно значение. Классификатор работает по тому же принципу, он отдает значение (raw value), пропущенное через сигмоиду, а не вероятность.

Как получить вероятность?

А знаете, как получается значение в листьях моделей CB, воспроизвести можете?

Суть в том, что вероятности по истории оцениваются, но гарантий что и дальше таковыми они будут, может дать только теория при репрезентативной выборке. У нас такой выборки нет. Поэтому любые подгонки в этом направлении точность не дадут на новых данных. Коррекция может быть актуально по той причине, что в листья попал мусор, и именно это надо скорректировать, завысив или занизив точку классификации по сигмойде.

Или опять же не ясно, о чём речь.

Если нашли чего то умное, поделитесь :)

[Удален]
Aleksey Vyazmikin #:

А знаете, как получается значение в листьях моделей CB, воспроизвести можете?

Суть в том, что вероятности по истории оцениваются, но гарантий что и дальше таковыми они будут, может дать только теория при репрезентативной выборке. У нас такой выборки нет. Поэтому любые подгонки в этом направлении точность не дадут на новых данных. Коррекция может быть актуально по той причине, что в листья попал мусор, и именно это надо скорректировать, зависим или занизив точку классификации по сигмойде.

Или опять же не ясно, о чём речь.

Если нашли чего то умное, поделитесь :)

Я надеялся, что кто-нибудь хотя бы загуглит по наводке.

Даже если у вас на обучении кривые вероятности, о каких новых данных может идти речь. А бустинг и форест сильно грешат этим. Бустинг слишком самоуверен, форест недоуверен. При условии, конечно, что вообще планируете использовать порог.

Я сам наблюдал, как при увеличении порога, качество сделок не улучшается даже на трейне. Тогда вероятность чего модель возвращает? Ничего :)

На картинке Саныча самоуверенный бустинг, видно по выбросам краевых столбцов. Впадина должна быть более плавной. Это переобучения модель.
Maxim Dmitrievsky #:
Я надеялся, что кто-нибудь хотя бы загуглит по наводке.

Даже если у вас на обучении кривые вероятности, о каких новых данных может идти речь. А бустинг и форест сильно грешат этим. Бустинг слишком самоуверен, форест недоуверен. При условии, конечно, что вообще планируете использовать порог.

Я сам наблюдал, как при увеличении порога, качество сделок не улучшается даже на трейне. Тогда вероятность чего они возвращают? Ничего :)

Как-то не обращаете внимания на мои посты, сосредоточившись на вероятностях. Не важно как называется вероятность, важно, что если не улучшается, то модель переобучена, в корзину. Ошибка предсказания на ООВ, ООС и ВНЕ должна быть примерно одинакова. 

Вот еще гистограмма

Другой алгоритм - другая гистограмма, хотя метки и предикторы одинаковы. Если Вы ищите некий теоретические вероятности, подразумевая, что разные алгоритмы классификации будут давать одинаковые гистограммы ... мне это в голову не приходит, так как приходится работать с конкретными алгоритмами и они будут предсказывать и их надо оценивать, а не какой-то теоретический идеал. Здесь главная оценка - это переобучение модели, а не близость вероятностей к некоему теоретическому идеалу.

[Удален]
СанСаныч Фоменко #:

Как-то не обращаете внимания на мои посты, сосредоточившись на вероятностях. Не важно как называется вероятность, важно, что если не улучшается, то модель переобучена, в корзину. Ошибка предсказания на ООВ, ООС и ВНЕ должна быть примерно одинакова. 

Модель из коробки не отдает корректные вероятности, любая. Об этом сказ. У вас предсказанные метки могут полностью совпасть, а вероятности - нет, не будут отражать реальную вероятность исхода.
Do you understand me?
Maxim Dmitrievsky #:
Модель из коробки не отдает корректные вероятности, любая. Об этом сказ. У вас предсказанные метки могут полностью совпасть, а вероятности - нет. 
Do you understand me?

Добавил свой пост. Любая модель дает корректные вероятности в том смысле, что ошибка классификации не будет колебаться.