Машинное обучение в трейдинге: теория, модели, практика и алготорговля - страница 2017
Вы упускаете торговые возможности:
- Бесплатные приложения для трейдинга
- 8 000+ сигналов для копирования
- Экономические новости для анализа финансовых рынков
Регистрация
Вход
Вы принимаете политику сайта и условия использования
Если у вас нет учетной записи, зарегистрируйтесь
не подходит катбуст для решения задач прогнозирования временных рядов, не работает он с последовательностями
чисто поиграть с классификацией можно, но толку не будетА как Вы определили, работает или нет?
У меня есть модели, которые по году (обучены примерно год назад) профит показывают в тестере - предлагаете считать их случайностью?
Да, CatBoost уступает генетическому дереву с постобработкой листьев, но он очень быстр в обучении.
А что работает - НС?
А как Вы определили, работает или нет?
У меня есть модели, которые по году (обучены примерно год назад) профит показывают в тестере - предлагаете считать их случайностью?
Да, CatBoost уступает генетическому дереву с постобработкой листьев, но он очень быстр в обучении.
А что работает - НС?
не я определил, а сама архитектура для других задач
да, это все случайность
пока ничего не работает )
Предикторы не цены в голом виде - много относительных точек, которые могут быть похожи...
Не уверен, что отсев по корреляции будет эффективен...
Почему бы не попробовать? Отрицательный результат - тоже результат (в смысле пищи для дальнейших размышлений).
Вроде бы даже когда-то предлагал здесь формулу для коэффициента корреляции: C = (n1 - n2)/n, где n - количество баров, где хотя бы одна из двух систем даёт сигнал торговли, n1 - число баров где сигналы даются обоими системами одновременно и в одинаковом направлении и n2 - число баров где сигналы даются обоими системами одновременно и в противоположных направлениях.
Матрицу из этих коэффициентов можно использовать для кластеризации, прореживания и формирования портфеля.
не я определил, а сама архитектура для других задач
да, это все случайность
пока ничего не работает )
Конечно, тут нет заточки под времянные ряды, поэтому предикторы должны содержать информацию об X координате, а не только об Y.
Если научится выявлять такие случайные модели, то будет профит.
У меня работает более 60% листьев, отобранных в прошлых годах, что очень, и на мой взгляд, подтверждает состоятельность идеи подхода обработки плохоклассифицируемых данных. Если бы над этой идеей работало больше людей, то результат был бы лучше, но у всех свои побрякушки.
Конечно, тут нет заточки под времянные ряды, поэтому предикторы должны содержать информацию об X координате, а не только об Y.
Если научится выявлять такие случайные модели, то будет профит.
У меня работает более 60% листьев, отобранных в прошлых годах, что очень, и на мой взгляд, подтверждает состоятельность идеи подхода обработки плохоклассифицируемых данных. Если бы над этой идеей работало больше людей, то результат был бы лучше, но у всех свои побрякушки.
Вроде, статью хотели.. Набросайте суть подхода. Я до сих пор не понимаю чем занимаетесь :D
я придерживаюсь взгляда, что признаки должны извлекаться автоматически самой моделью из временного ряда (если они есть). И не нужно ничего делать вручную. Достаточно приращений. Вопрос в архитектуре. Например, как в NLP (neural language processing) нейросеть сама определяет контекст в последовательностях слов, т.е. связь между отсчетами временного ряда.
Почему бы не попробовать? Отрицательный результат - тоже результат (в смысле пищи для дальнейших размышлений).
Вроде бы даже когда-то предлагал здесь формулу для коэффициента корреляции: C = (n1 - n2)/n, где n - количество баров, где хотя бы одна из двух систем даёт сигнал торговли, n1 - число баров где сигналы даются обоими системами одновременно и в одинаковом направлении и n2 - число баров где сигналы даются обоими системами одновременно и в противоположных направлениях.
Матрицу из этих коэффициентов можно использовать для кластеризации, прореживания и формирования портфеля.
А при чем тут предикторы?
Нечто подобное я делаю для отбора листьев, но там ещё загвоздка в том, что число откликов листьев разное на выборке и нужно учитывать, что листы с похожими откликами но разной длинны могут принадлежать одной группе.
Вроде, статью хотели.. Набросайте суть подхода. Я до сих пор не понимаю чем занимаетесь :D
я придерживаюсь взгляда, что признаки должны извлекаться автоматически самой моделью из временного ряда (если они есть). И не нужно ничего делать вручную. Достаточно приращений. Вопрос в архитектуре. Например, как в NLP (neural language processing) нейросеть сама определяет контекст в последовательностях слов, т.е. связь между отсчетами временного ряда.
Генетическое дерево и CatBoost - слабо связаны, статью планирую написать про CatBoost. Отложил написание по той причине, что выявил у себя недостатки в стабильности показателей предикторов и бросил все силы на исправление этого, заодно и новые предикторы сделал. К концу недели планирую запустить вычислительный процесс (а то напрягает, когда сервера простаивают), и появится время на статью - попробую написать первую часть к концу месяца. Статья будет про мою кухню создания модели на CatBoost.
С генетическими деревьями всё сложней, тут статьи пока не будет, но подход в том, что мы отбираем листья с деревьев, стабильно классифицирующие участок данных на истории - по факту 0,5%-3% откликов от всей выборки, таких листьев чем больше, тем лучше, сейчас порядка 1000 на покупку и продажу, дополнительно я ищу листья, которые ещё и фильтруют отобранные листья, т.е. провожу дообучение, что повышает их точность. Листья группируются по похожести (тут есть ещё над чем работать), далее их ответы взвешиваются внутри каждой группы на истории и определяется порог, при котором происходит создание сигнала от группы листьев. Дополнительным фильтром тут служит генетическое дерево, построенное по откликам всех листьев или только групп. Такой подход позволяет значительно увеличить полноту классификации при несбалансированной выборке, в моем случае с 3мя целевыми, где целевая "0" - порядка 65%.
Работа над критериями отбора листьев и методикой их объединения имеет большой потенциал по улучшению, а значит и модели могут получатся более качественными.
А при чем тут предикторы?
Стало быть, напутал, задумавшись о своём)
я придерживаюсь взгляда, что признаки должны извлекаться автоматически самой моделью из временного ряда (если они есть). И не нужно ничего делать вручную. Достаточно приращений. Вопрос в архитектуре. Например, как в NLP (neural language processing) нейросеть сама определяет контекст в последовательностях слов, т.е. связь между отсчетами временного ряда.
Про архитектуру согласен, нужна совершенно иная архитектура, нужен набор сетей:
1. Идентифицирующая образы
2. Определяющая пространственное упорядочивание образов
3. Ищущая закономерности в размещенных в пространстве образов
Сейчас я своим мозгом решаю за 1 и 2 сеть - сочиняя предикторы, а с третей задачей справляется CatBoost. Свести эти сети в одну будет сложно, может попробовать работать с каждым направлением по отдельности, а потом объединить эти сети?
Сейчас я своим мозгом решаю за 1 и 2 сеть - сочиняя предикторы, а с третей задачей справляется CatBoost. Свести эти сети в одну будет сложно, может попробовать работать с каждым направлением по отдельности, а потом объединить эти сети?
надо наблюдать за новинками, они постоянно улучшаются. У современных сеток именно такая задача, все делать сразу
искать предикторы вручную это уже прошлый век, как кайлом по камню. И, как все убедились, почти не работает