Машинное обучение в трейдинге: теория, модели, практика и алготорговля - страница 3334
Вы упускаете торговые возможности:
- Бесплатные приложения для трейдинга
- 8 000+ сигналов для копирования
- Экономические новости для анализа финансовых рынков
Регистрация
Вход
Вы принимаете политику сайта и условия использования
Если у вас нет учетной записи, зарегистрируйтесь
Но тут же так же работа с данными через модели. Или видите в чём то разницу?
Ну типа на автомате, не надо ничего придумывать и (что важно) делать :)
Учитывая избыток рандома у CatBoost в самом методе обучения - сложно оценивать именно сам подход. Там же они и строки мешают при построении дерева, и бачами данные подают, ну если это не запретить всё...
Интересно тут оценить, как много вот листов меняют классы на новых данных, по аналогии, как я написал выше в ветке. Это может быть метрикой качества подхода/модели.
Учитывая избыток рандома у CatBoost в самом методе обучения - сложно оценивать именно сам подход. Там же они и строки мешают при построении дерева, и бачами данные подают, ну если это не запретить всё...
Интересно тут оценить, как много вот листов меняют классы на новых данных, по аналогии, как я написал выше в ветке. Это может быть метрикой качества подхода/модели.
По идее, этот рандом не так страшен, как рандом в датасете
Так случайно из рандома можно получить красивую модель - в этом то и беда, вот если бы нельзя было, то не важно.
Обучить модель же не проблема - проблема выбрать ту, у которой больше потенциал корректной работы на новых данных.
Вот и интересен подход, который позволяет увеличивать этот потенциал. А для оценки эффективности модели требуется метрика какая то, не просто стат показатель точности классификации, но и вот нечто, иное, к примеру оценка листьев по отдельности. Понятно, что меняются показатели в предикторах - поэтому и листья так шумят, "меняя" фактические классы. Поэтому это комплексная задача - нужны хорошие метки и устойчивые предикторы, ну и комбинации их должны не создавать листья с редкими значениями в модели.
В продакшене уже требуется отслеживать изменение распределения значений предикторов, используемых в модели, и тормозить модель, если изменения существенны и обширны. Правда, этот подход требует накопления статистики, что для нас равно накоплению убытков, а это не есть хорошо. Нужен более быстрый метод для исключения модели, но обоснованный, а не чисто по просадке.
Проблем много, без решения которых не хочется давать модели в управление деньги.
Да, с бинарными сложней. Но не понял идеи, как нормирование может тут помочь.
Бинарный признак с 0и1 уже нормирован, а остальные нужно тоже нормировать.
Бинарный признак с 0и1 уже нормирован, а остальные нужно тоже нормировать.
Понял ход Вашей мысли, надеюсь.
Но, при равномерном квантовании на те же 32 отрезка, можно же считать, что отрезок "1" - 0, а отрезок "32" - 1. Так и с другими любыми цифрами. Поэтому и не пойму, в чём тут принципальная разница.
Понял ход Вашей мысли, надеюсь.
Но, при равномерном квантовании на те же 32 отрезка, можно же считать, что отрезок "1" - 0, а отрезок "32" - 1. Так и с другими любыми цифрами. Поэтому и не пойму, в чём тут принципальная разница.
Если к 32 сводите, то растягивайте и бинарный 0 и 1 до 0 и 32 (и другие, например с 5 квантами от 0...5 до 0...32). Чтобы все соразмерно было. Ну или сжимайте классически все к единичному гиперкубу (как для нейросетей, которым нормировка обязательна.) Суть та же - в обоих вариантах получим один масштаб.
Метки (учитель, целевая переменная) НЕ могут быть мусорными по определению.
Саныч, не позорься
ты даже еще не начинал изучать, чтобы выражать свое мнение
Ещё забавный факт, я тут подумал, видимо это как раз и есть переобучение, и решил посмотреть на каких индексах произошло изменение класса - думал, что ближе к концу и это как раз хорошая иллюстрация переобучения.
По факту оказалось так
На выборке test
Получается, что это первая тысяча листов (в очередной последовательности добавления в модель) в большей мере не стабильна!
Удивлён.
На выборке exam
Ещё забавный факт, я тут подумал, видимо это как раз и есть переобучение, и решил посмотреть на каких индексах произошло изменение класса - думал, что ближе к концу и это как раз хорошая иллюстрация переобучения.
По факту оказалось так
На выборке test
Получается, что это первая тысяча листов (в очередной последовательности добавления в модель) в большей мере не стабильна!
Удивлён.
На выборке exam
Для всех остальных деревьев, учителем является ошибка предсказания, т.е. (Y - Pred). Да еще и с коэффициентом eta = 0.1...0.001. Влияние листьев этих деревьев - незначительно, они лишь корректируют. Что вы и показали (их незначительность).