Машинное обучение в трейдинге: теория, модели, практика и алготорговля - страница 2791
Вы упускаете торговые возможности:
- Бесплатные приложения для трейдинга
- 8 000+ сигналов для копирования
- Экономические новости для анализа финансовых рынков
Регистрация
Вход
Вы принимаете политику сайта и условия использования
Если у вас нет учетной записи, зарегистрируйтесь
Делал подобное с кластеризацией больше года назад, потом определял средние уровни как на картинках и от них ордера выставлял. Делил на 3 кластера up, down, mean reversion. Классно работает на обучении.
Да. Видимо из цен ничего вытащить нельзя. Ничего другого как бы и нету. На бирже еще объемы есть.
Видимо, ФА только и может что-то дать. А это лучше наверное вручную. Но и там можно заблуждаться, фейк-ньюс работают активно.
Проверил информативность признаков при смещении их назад. То есть берем не последние значения истории признаков, а с отступом в прошлое. Взял 50 отступов. (от нулевого до -50 бара)
В правой колонке отступ в барах, в левой взаимная информация. Отсторитровано по возрастанию взаимной информации между фичами и метками.
Получилось, что последние цены не всегда лучше предыдущих, есть некоторый прирост на -11 баре по отношению к нулевому бару:
показательно
Что значит "взаимной информации"? Интересно влияние фичи на метку. Разве интересно обратное влияние? Как вычисляется "взаимная информация"?
Что значит "взаимной информации"? Интересно влияние фичи на метку. Разве интересно обратное влияние? Как вычисляется "взаимная информация"?
вы ставите в тупик своими вопросами
Проверил информативность признаков при смещении их назад. То есть берем не последние значения истории признаков, а с отступом в прошлое. Взял 50 отступов. (от нулевого до -50 бара)
В правой колонке отступ в барах, в левой взаимная информация. Отсторитровано по возрастанию взаимной информации между фичами и метками.
Получилось, что последние цены не всегда лучше предыдущих, есть некоторый прирост на -11 баре по отношению к нулевому бару:
показательно
Похоже на суточные циклы. 22-24 час самые информативные. Т.е. сегодня будет то же, что и вчера.
вы ставите в тупик своими вопросами
Почему в тупик?
Для меня влияние, связь, предсказательная способность признака, фичи, предиктора с меткой можно пояснить следующим примером.
Пусть имеется метка "человек", которая принимает два значения: мужчина и женщина.
Пусть есть фича "одежда", которая принимает два значения: штаны и юбки и количество значений разных штанов и юбок сотни или тысячи.
Предположим, что мужчины носят только штаны, а женщины только юбки. Тогда такая фича без ошибок определяет метку, т.е. ошибка предсказания = 0%. Можно считать, что фича влияет, связана, предсказывает метку на 100%. При сохранении таких условий в будущем ошибка не изменится и будет =- 0%.
В современном обществе это не так и возникнет ошибка предсказания, величина которой неизвестна и может меняться в зависимости от наполнения фичи.
Существует большое число подходов, реализованных в виде пакетов программ, которые для нашего примера при любви некоторой части женщин к штанам, а мужчин к юбкам покажут некое отличие от 100% связи фичи с меткой.
На графиках это очень хорошо видно.
Пример бесполезной фичи:
Пример довольно перспективной фичи. Пересечение - это ошибка предсказания. На предыдущем графике полностью накрыла одна фича другую - ошибка предсказания 50%.
Вот приведенная Вами мера различий фич она относится к первому графику или ко второму? Разница в оценках в 2.5 раза. Но цифры относительные. Все фичи барахло, часть или все прекрасные?
Ну в гугле посмотрите, википедию нет желания цитировать. Мера связи бывает геометрическая, как в случае с корреляцией, так информационная в случае Mi.
М-да, ну, ладно. Пусть будет так
М-да, ну, ладно. Пусть будет так
Оценивать фичи лучше не какими то методами и пакетами, не относящимися к модели, а самой моделью.
2 года назад сравнивал методы оценки важности https://www.mql5.com/ru/blogs/post/737458
За образец брал саму модель. Обучал ее N раз (по количеству фичей) удаляя одну из них.
Чем сильнее ухудшался результат, после удаления фичи, тем она важнее. Были и фичи удаление которой улучшали результат, т.е. она явно шумовая.
Ни один из вариантов определения важности фичей не был похож на образцовую важность. Боюсь, что и взаимная информация и др. пакеты могут так же несовпадать.
Оценивать фичи лучше не какими то методами и пакетами, не относящимися к модели, а самой моделью.
2 года назад сравнивал методы оценки важности https://www.mql5.com/ru/blogs/post/737458
За образец брал саму модель. Обучал ее N раз (по количеству фичей) удаляя одну из них.
Чем сильнее ухудшался результат, после удаления фичи, тем она важнее. Были и фичи удаление которой улучшали результат, т.е. она явно шумовая.
Ни один из вариантов определения важности фичей не был похож на образцовую важность. Боюсь, что и взаимная информация и др. пакеты могут так же несовпадать.
В первом приближении Вы, несомненно, правы - надо иметь конечную оценку, если вы имеете ввиду под оценкой моделью ее показатели результативности.
Но, есть один нюанс, который перевешивает все.
Оценка моделью через ее результативность - это оценка на исторических данных. А как поведет себя модель в будущем?
Если мы занимаемся оценкой самих фич, то можно прогнать окно и получить статистику изменения величины оценки фичи, каждой в отдельности. И, как мне кажется, предпочтительнее те фичи, у которых оценка ее важности колеблется незначительно, желательно менее 10%. У моего набора фич колебания sd от 10% до 120% на 500 барах (по памяти). А это означает, что оценка колеблется внутри канала 10%, т.е. цифру, которую мы видим - это она и есть. А вот для 120% величину оценки важности, которую мы видим - это фикция.