Машинное обучение в трейдинге: теория, модели, практика и алготорговля - страница 3355

 
Maxim Dmitrievsky #:
Нет.

Тогда какая цель?

 

Про калибровку, думаю, все всё давно уже слышали, но практического толка в ней нет, как раз по причине не репрезентативности выборки.

Вероятностная оценка отдельных листьев, на мой взгляд, даёт более обоснованный результат, чем перевзвешивание суммы листьев модели.

[Удален]  
Aleksey Vyazmikin #:

Про калибровку, думаю, все всё давно уже слышали, но практического толка в ней нет, как раз по причине не репрезентативности выборки.

Вероятностная оценка отдельных листьев, на мой взгляд, даёт более обоснованный результат, чем перевзвешивание суммы листьев модели.

Все все слышали, но никто ничего не ответил. Не говоря уже о других нюансах, которые не раскрыты, а только догадались что оказывается вон оно че.

А если у вас слабая (с низким матожиданием), но стабильная на ООС модель, калибровать тоже нет смысла? А если задуматься..
 
Maxim Dmitrievsky #:
Все все слышали, но никто ничего не ответил. Не говоря уже о других нюансах, которые не раскрыты, а только догадались что оказывается вон оно че.

А если у вас слабая (с низким матожиданием), но стабильная на ООС модель, калибровать тоже нет смысла? А если задуматься..

Сейчас пришла идея о постоянной каллибровке, с каким то весом - нечто типа EMA для каждого интервала. Тогда хоть будет эффект адаптации под изменчивость рынка и устаревание модели.

В статичной калибровке на каких то отдельно взятых данных - не вижу смысла. На своих предикторах я исследовал вопрос устойчивости статистических показателей, и таких мало, и модель кишит такими непостоянными предсказателями. Поэтому я и ищу устойчивость, к которой можно будет применять нечто подобное...

На скрине выше я показал модель в разрезе - можете видеть, какой низкий Recall по краям обычно, что уже говорит о не равных статистических показателях для того же взвешивания, а зачастую их будет недостаточно, что бы как то точно говорить, даже в теории, об устойчивости в этом диапазоне "вероятности". Поэтому и с этой точки зрения калибровка суммарного показателя выглядит сомнительной затеей.

Меня больше занимает идея перевзвешивания значений в листьях, впрочем, я уже писал ранее об этом, но обратной связи не получил тут - поэтому всё сам - да сам...

[Удален]  
Опять какие-то новые определения.
Последний раз: классификатор калибруется потому, что на выходе он отдает некорректные вероятности. Они бессмысленные в изначальном виде. Переспите с этим.
 
У катбуста код открытый - можно посмотреть, чтобы точно знать, что отдается.
[Удален]  
Поясняю картинку простым языком: для классификатора первый и второй случай на гистограмме одноявственны, потому что используются метки классов. И там и там единица для самого вероятного класса. После обучения он отдаст не вероятность класса, а единицу минус ошибку предсказания, пропущенную через сигмоиду или софтмакс.

Это абсолютно не соответствует тому, что вы могли бы ожидать, устанавливая порог предсказания. 
 

Вероятностный подход - это хорошо и правильно. У нас всегда будет сильный шум и суть в том, чтобы искать отличия от того, каким он был бы при СБ. Одной лишь дисперсии шума будет для этого недостаточно.

ИМХО, задача классификации не вполне подходит, поскольку существенно отбрасывает информацию. Нужно что-то вроде того чтобы смотреть на распределение величины движения цены в нужном направлении и моделировать как это распределение зависит от признаков, а потом уже строить ТС по виду этого распределения (если в нём есть отличия от того что было бы при СБ).

 
Maxim Dmitrievsky #:
Опять какие-то новые определения.
Последний раз: классификатор калибруется потому, что на выходе он отдает некорректные вероятности. Они бессмысленные в изначальном виде. Переспите с этим.

Не выдержал.

Не бывает абстрактной, читай эталонной, идеальной,  вероятности, не привязанной к случайному процессу.

Не бывает.

Вероятность монеты, которую побрасывают и т.д.

Поэтому любой классификатор дает вероятность, которая характеризует именно этот конкретный классификатор, что дает нужную нам характеристику - ошибку предсказания. Другой классификатор даст другие вероятности с соответствующей ошибкой предсказания классов.

В зависимости от предикторов и связанных с ними меток, а также балансировки классов, возникает проблема установки порога деления вероятностей на классы. Инструменты для этой операции, называемой "калибровкой", даны выше. Можно это делать и по колхозному.

В любой случае можно существенно уменьшить ошибку предсказания  именно для тех вероятностей, которые дал конкретный классификатор, потому как нет в природе  других вероятностей при работе с конкретным классификатором. Не нравятся вероятности - работайте с классификатором или же занимайтесь калибровкой. В этом конкретном процессе нет места !идеальным" вероятностям, которых не бывает теоретически.

Ясно одно, что деление на классы по порогу 0.5 крайне сомнительно и работает в редких случаях.