Машинное обучение в трейдинге: теория, модели, практика и алготорговля - страница 3520
Вы упускаете торговые возможности:
- Бесплатные приложения для трейдинга
- 8 000+ сигналов для копирования
- Экономические новости для анализа финансовых рынков
Регистрация
Вход
Вы принимаете политику сайта и условия использования
Если у вас нет учетной записи, зарегистрируйтесь
Да, энтропия меток не показывает ничего. Все-таки связь фича-метка получается сильнее.
Поисследуем взаимную информацию между фичами и метками тогда :)
Суть возни в том, чтобы найти более быстрый способ перебора датасетов, чем через обучение модели. Например если хочется проверить миллион разных разметок.При увеличении горизонта прогнозирования нужно увеличивать длину подсерии (order) для PE.
Сделал небольшой перебор настроек - данные те же, что и в прошлый раз - 100 моделей
Смотрел какую либо зависимость от PE на выборке train на балансе выборки exam - использовал популярные метрики.
И то ж самое, но PE с выборке test
Ну и Recall вместо баланса
Кажется, что влияние в пределах погрешности измерения...
https://scikit-learn.org/stable/modules/generated/sklearn.feature_selection.mutual_info_classif.html
mi = mutual_info_classif(x,y).sum()
Тоже не видно явной зависимости.
Суть возни в том, чтобы найти более быстрый способ перебора датасетов, чем через обучение модели.
Думаю, как раз через мой метод это реально сделать. Достаточно оценивать смещение вероятности в квантовых отрезках, и разработать метрику для суммирования результата по всем предикторам, к примеру процент прошедших отбор квантовых отрезков. Если их мало, то обучение будет затруднено, что косвенно означает, что разметка не качественная (если в это верим).
Достаточно одного дата сета и можно перебирать разметки.
Однако, это скажет о лёгкости обучения на train, а вот что будет дальше - ответа не получите.
Впрочем, думаю собрать статистику по предикторам на разных выборках, тогда будет понятней, можно ли отдельно от выборки считать предиктор удачным, или только оценивая его относительно разметки можно делать такой вывод и выбор.
Думаю, как раз через мой метод это реально сделать. Достаточно оценивать смещение вероятности в квантовых отрезках, и разработать метрику для суммирования результата по всем предикторам, к примеру процент прошедших отбор квантовых отрезков. Если их мало, то обучение будет затруднено, что косвенно означает, что разметка не качественная (если в это верим).
Достаточно одного дата сета и можно перебирать разметки.
Однако, это скажет о лёгкости обучения на train, а вот что будет дальше - ответа не получите.
Впрочем, думаю собрать статистику по предикторам на разных выборках, тогда будет понятней, можно ли отдельно от выборки считать предиктор удачным, или только оценивая его относительно разметки можно делать такой вывод и выбор.
В принципе у меня все оптимизировано и работает быстро, просто балуюсь что можно улучшить. Тестер переписал, теперь быстро считает.
У меня основной расчет (одна итерация - которой будет достаточно для быстрой оценки), занимает примерно 2 секунды для выборки в 27000 строк на 5000 столбцов.
У меня основной расчет (одна итерация - которой будет достаточно для быстрой оценки), занимает примерно 2 секунды для выборки в 27000 строк на 5000 столбцов.
10 моделей (в каждой модели по две, основная и мета)
И сразу готовая ТС.
Запускаю пакетами по 20-100 переобучений с разными параметрами. Самое большое влияние оказывает разметка.
Поэтому хочу найти способ самой правильной разметки.
10 моделей (в каждой модели по две, основная и мета)
И сразу готовая ТС.
Запускаю пакетами по 20-100 переобучений с разными параметрами. Самое большое влияние оказывает разметка.
Поэтому хочу найти способ самой правильной разметки.
Тут ищется не "правильная" разметка, а удобная для обучения модели с конкретными настройками.
Но, даже если так, то и 1кк вполне реально перебрать.
Тут ищется не "правильная" разметка, а удобная для обучения модели с конкретными настройками.
Но, даже если так, то и 1кк вполне реально перебрать.