Машинное обучение в трейдинге: теория, модели, практика и алготорговля - страница 3334

[Удален]  
Aleksey Vyazmikin #:

Но тут же так же работа с данными через модели. Или видите в чём то разницу?

Ну типа на автомате, не надо ничего придумывать и (что важно) делать :)
 
Maxim Dmitrievsky #:
Ну типа на автомате, не надо ничего придумывать и (что важно) делать :)

Учитывая избыток рандома у CatBoost в самом методе обучения - сложно оценивать именно сам подход. Там же они и строки мешают при построении дерева, и бачами данные подают, ну если это не запретить всё...

Интересно тут оценить, как много вот листов меняют классы на новых данных, по аналогии, как я написал выше в ветке. Это может быть метрикой качества подхода/модели.

[Удален]  
Aleksey Vyazmikin #:

Учитывая избыток рандома у CatBoost в самом методе обучения - сложно оценивать именно сам подход. Там же они и строки мешают при построении дерева, и бачами данные подают, ну если это не запретить всё...

Интересно тут оценить, как много вот листов меняют классы на новых данных, по аналогии, как я написал выше в ветке. Это может быть метрикой качества подхода/модели.

По идее, этот рандом не так страшен, как рандом в датасете
 
Maxim Dmitrievsky #:
По идее, этот рандом не так страшен, как рандом в датасете

Так случайно из рандома можно получить красивую модель - в этом то и беда, вот если бы нельзя было, то не важно.

Обучить модель же не проблема - проблема выбрать ту, у которой больше потенциал корректной работы на новых данных.

Вот и интересен подход, который позволяет увеличивать этот потенциал. А для оценки эффективности модели требуется метрика какая то, не просто стат показатель точности классификации, но и вот нечто, иное, к примеру оценка листьев по отдельности. Понятно, что меняются показатели в предикторах - поэтому и листья так шумят, "меняя" фактические классы. Поэтому это комплексная задача - нужны хорошие метки и устойчивые предикторы, ну и комбинации их должны не создавать листья с редкими значениями в модели.

В продакшене уже требуется отслеживать изменение распределения значений предикторов, используемых в модели, и тормозить модель, если изменения существенны и обширны. Правда, этот подход требует накопления статистики, что для нас равно накоплению убытков, а это не есть хорошо. Нужен более быстрый метод для исключения модели, но обоснованный, а не чисто по просадке.

Проблем много, без решения которых не хочется давать модели в управление деньги.

 
Aleksey Vyazmikin #:

Да, с бинарными сложней. Но не понял идеи, как нормирование может тут помочь.

Бинарный признак с 0и1 уже нормирован, а остальные нужно тоже нормировать.

 
Forester #:

Бинарный признак с 0и1 уже нормирован, а остальные нужно тоже нормировать.

Понял ход Вашей мысли, надеюсь.

Но, при равномерном квантовании на те же 32 отрезка, можно же считать, что отрезок "1" - 0, а отрезок "32" - 1. Так и с другими любыми цифрами. Поэтому и не пойму, в чём тут принципальная разница.

 
Aleksey Vyazmikin #:

Понял ход Вашей мысли, надеюсь.

Но, при равномерном квантовании на те же 32 отрезка, можно же считать, что отрезок "1" - 0, а отрезок "32" - 1. Так и с другими любыми цифрами. Поэтому и не пойму, в чём тут принципальная разница.


Если к 32 сводите, то растягивайте и бинарный 0 и 1 до 0 и 32 (и другие, например с 5 квантами от 0...5 до 0...32). Чтобы все соразмерно было. Ну или сжимайте классически все к единичному гиперкубу (как для нейросетей, которым нормировка обязательна.) Суть та же - в обоих вариантах получим один масштаб.

[Удален]  
СанСаныч Фоменко #:

Метки (учитель, целевая переменная) НЕ могут быть мусорными по определению.

Саныч, не позорься

ты даже еще не начинал изучать, чтобы выражать свое мнение

 

Ещё забавный факт,  я тут подумал, видимо это как раз и есть переобучение, и решил посмотреть на каких индексах произошло изменение класса - думал, что ближе к концу и это как раз хорошая иллюстрация переобучения.

По факту оказалось так


На выборке test

Получается, что это первая тысяча листов (в очередной последовательности добавления в модель) в большей мере не стабильна!

Удивлён.

На выборке exam

 
Aleksey Vyazmikin #:

Ещё забавный факт,  я тут подумал, видимо это как раз и есть переобучение, и решил посмотреть на каких индексах произошло изменение класса - думал, что ближе к концу и это как раз хорошая иллюстрация переобучения.

По факту оказалось так


На выборке test

Получается, что это первая тысяча листов (в очередной последовательности добавления в модель) в большей мере не стабильна!

Удивлён.

На выборке exam

Вы же бустнгом считаете? Там только первое дерево обучается по меткам исходного учителя.
Для всех остальных деревьев, учителем является ошибка предсказания, т.е. (Y - Pred). Да еще и с коэффициентом eta = 0.1...0.001. Влияние листьев этих деревьев - незначительно, они лишь корректируют. Что вы и показали (их незначительность).