Машинное обучение в трейдинге: теория, модели, практика и алготорговля - страница 2114

 
Maxim Dmitrievsky:

можно по разному попробовать, чисто позырить

вот хороший ноутбук https://www.kaggle.com/rafjaa/resampling-strategies-for-imbalanced-datasets

можно копировать и проверять

Так это оригинал той статьи, что я смотрел на русском.

 
Maxim Dmitrievsky:

это копипизд, ссылку на оригинал я дал

А толку - все равно нет инфы - выдернутый код.

[Удален]  
Aleksey Vyazmikin:

А толку - все равно нет инфы - выдернутый код.

все там отлично написано. У меня нет имбалансных классов, но я их искусственно делал, просто позырить

 
Maxim Dmitrievsky:

все там отлично написано. У меня нет имбалансных классов, но я их искусственно делал, просто позырить


Оказалось, что у метода "Tomek links" просто не уравнивается выборка - он уменьшил число нулевых строк с 4005 до 3402, поэтому я и думал, что не работает.
[Удален]  
Aleksey Vyazmikin:


Оказалось, что у метода "Tomek links" просто не уравнивается выборка - он уменьшил число нулевых строк с 4005 до 3402, поэтому я и думал, что не работает.
Угу. Сначала надо делать оверсемплинг потом томика
 
Maxim Dmitrievsky:
Угу. Сначала надо делать оверсемплинг потом томика

Оверсемплинг пока ничего не дает, а вот "томик" улучшил малость результат - значит в данных что т есть, надо главное правильно копать.

Гистограмма моделей с разными настройками квантования на exam выборке.


[Удален]  
Aleksey Vyazmikin:

Оверсемплинг пока ничего не дает, а вот "томик" улучшил малость результат - значит в данных что т есть, надо главное правильно копать.

Гистограмма моделей с разными настройками квантования на exam выборке.


он делает лучше границу между классами. Так же и данные надо готовить - чтобы разделение на классы было четким, примеры не пересекались

и я даже знаю как сделать.. типа шибко умный, но пока не делал
 
Maxim Dmitrievsky:

он делает лучше границу между классами. Так же и данные надо готовить - чтобы разделение на классы было четким, примеры не пересекались

и я даже знаю как сделать.. типа шибко умный, но пока не делал

Интересно, как? В нашей области обычно классы можно описать как равномерно перемешанные.

 
Maxim Dmitrievsky:

он делает лучше границу между классами. Так же и данные надо готовить - чтобы разделение на классы было четким, примеры не пересекались

и я даже знаю как сделать.. типа шибко умный, но пока не делал
Maxim Dmitrievsky:
Добавить кластеризацию в семплинг меток. Кластеризовать по тем же признакам, потом семплить с учетом кластеров. Классы будут разнесены, но что будет на новых данных непонятно. Должно улучшить, по идее

Так я эту идею тут осветил на этой неделе :)

Только я предлагаю уменьшать число мажоритарный класс.

[Удален]  
Aleksey Vyazmikin:

Так я эту идею тут осветил на этой неделе :)

Только я предлагаю уменьшать число мажоритарный класс.

Я не видел