Машинное обучение в трейдинге: теория, модели, практика и алготорговля - страница 3528
Вы упускаете торговые возможности:
- Бесплатные приложения для трейдинга
- 8 000+ сигналов для копирования
- Экономические новости для анализа финансовых рынков
Регистрация
Вход
Вы принимаете политику сайта и условия использования
Если у вас нет учетной записи, зарегистрируйтесь
Причём здесь это? Корреляция считалась, по сути, также как волатильность. Например, для Х=1 бралась выборка из всех приращений за 1-ю минуту и смотрелась её корреляция с выборкой из всех последующих приращений за 2-ю минуту. И так далее для всех Х<=1440. Оконная функция устроена по другому.
Код на R
Перечитал я ещё раз - для меня всё чётко и понятно. Я же не буду менять свою терминологию в желании Вам разъяснить, а свою могу - если будут вопросы.
Я допускаю, что в ваших исследованиях есть рациональное зерно, но очень сложно воспринимать. Возможно, нужен какой-то тезаурус. Например, что такое повреждение вероятностной структуры :)
Я допускаю, что в ваших исследованиях есть рациональное зерно, но очень сложно воспринимать. Возможно, нужен какой-то тезаурус. Например, что такое повреждение вероятностной структуры :)
Лично я сдался и просто листаю
Я допускаю, что в ваших исследованиях есть рациональное зерно, но очень сложно воспринимать. Возможно, нужен какой-то тезаурус. Например, что такое повреждение вероятностной структуры :)
Вот смотрите, ниже на рисунке я на скорую руку изобразил процесс явления о котором говорю.
У нас имеется три предиктора P0, P1, P2, мы оценили их квантовые отрезки на предмет смещения вероятности к одному из двух классов по отношению к подвыборке, сильные смещения к единице обозначены зеленым цветом, а к нулю - синим, красные же - это те, что не преодолели оценочный порог - пока не известно на текущей итерации к какому классу их следует отнести.
После оценки нам нужно выбрать какой квантовый отрезок исключить (сделать сплит) - я рассматриваю в примере два условных варианта - V1 и V2.
Квантовый отрезок, по которому делали сплит становится серым на рисунке. Тот квантовый отрезок, который содержит те же отклики (индексы строк), что и серый - перечеркивается серой чертой. Утрата примеров в неопределенной области (красной) не отражается на рисунке.
Если выбираем вариант V1, то видим, что у нас два квантовых отрезка, которые утратят часть примеров и будут при их оценки иметь незначительное смещение вероятности по отношению к подвыборки - эта утрата названа повреждением (Damage). После повреждения эти квантовые отрезки попадут в зону неопределенности и станут красного цвета.
Если выбрать вариант V2, то видим, что поврежден только один квантовый отрезок на предикторе P1, в то время, как на предикторе P2 появился новый квантовый отрезок синего цвета, который взял часть примеров от зеленого квантового отрезка и красной области неопределенности. Вот такое постепенное раскрытие диапазона я и назвал структурой, которая изначально скрыта, но постепенно открывается, а выбор просто сплита по лучшей метрики может привести к её повреждению, и она не сможет раскрыться. По сути это ветвление дерева внутри предиктора на новых итерациях. Ранее я показывал, как такие квантовые отрезки исчезают с каждой итерацией, теперь я смог понять причину и пытаюсь контролировать этот процесс.
И, хотя на рисунке показан процесс для квантовых отрезков, как единого целого (сразу два сплита, ограничивающих диапазон предиктора), но схожий процесс происходит и при любом построении дерева, только там выбирается на один квантовый отрезок, а сразу группа - от и до. И, выбор сплита только исходя из лучших показателей таких метрик как Джини, энтропия или логлосс может существенно ухудшить выбор из числа полученных результатов оценки сплита на последующих итерациях построения древовидной модели.
Вот смотрите, ниже на рисунке я на скорую руку изобразил процесс явления о котором говорю.
Ну так а кластеризация признаков это не то же самое? Вы разбиваете на подвыборки с похожими семплами и смотрите какая у чего там вероятность. При этом не надо лезть в дупло дерева.
Ну так а кластеризация признаков это не то же самое? Вы разбиваете на подвыборки с похожими семплами и смотрите какая у чего там вероятность. При этом не надо лезть в дупло дерева.
Хех...
Вот смотрите, как выглядит предиктор в разрезе кластеров - по вашей же выборке - видите какой перехлёст по диапазонам предиктора? Думаю это не хорошо.
В общем ну разные методы, хотя на первый взгляд происходит нечто похожее.
Вообще хотел показать про "повреждение" же в прошлом посте - ну раз не понятно - так и ладно...
Если выбрать вариант V2, то видим, что поврежден только один квантовый отрезок на предикторе P1, в то время, как на предикторе P2 появился новый квантовый отрезок синего цвета, который взял часть примеров от зеленого квантового отрезка и красной области неопределенности. Вот такое постепенное раскрытие диапазона я и назвал структурой, которая изначально скрыта, но постепенно открывается, а выбор просто сплита по лучшей метрики может привести к её повреждению, и она не сможет раскрыться. По сути это ветвление дерева внутри предиктора на новых итерациях. Ранее я показывал, как такие квантовые отрезки исчезают с каждой итерацией, теперь я смог понять причину и пытаюсь контролировать этот процесс.
Опять ваши представления о сплитах/квантах не соответствуют действительности.

В предикторе P2 не появится квант в виде подряд идущих примеров (который у вас синего цвета).
Каждый столбец после сортировки (и для определения кванта и для сплита) будет иметь разный порядок строк (кроме дубликатов столбцов). Например:
P1: 9,6,4,7,1,8,5,0,3,2
P2: 0,2,4,6,8,1,3,5,7,9
Итак, если вы удалили отрезок/квант из Р1 со строками 4,7,1, то у P2 удалятся истинные номера этих строк и они не будут идти подряд, а хаотически - и не смогут образовать квант.
P2: 0,2,4,6,8,1,3,5,7,9
Вы бы делали распечатки по строкам и проверяли свои идеи, а то тратите время за зря... ведь очевидно же, что порядок строк будет разный. Но видимо это очевидно, только когда просмотришь много распечаток.
Хех...
Вот смотрите, как выглядит предиктор в разрезе кластеров - по вашей же выборке - видите какой перехлёст по диапазонам предиктора? Думаю это не хорошо.
В общем ну разные методы, хотя на первый взгляд происходит нечто похожее.
Вообще хотел показать про "повреждение" же в прошлом посте - ну раз не понятно - так и ладно...
Так кластеризация делалась по другому предиктору, а это просто значения других предикторов, соответствующие кластерам.
Соответственно, можно замутить разные замороченные схемы на базе кластеризации.
То есть у вас перед глазами уже готовая квантовая таблица, соответствующая какому-то кластеру.
Пишется Cluster, не Klaster :)Пишется Cluster, не Klaster :)