Машинное обучение в трейдинге: теория, модели, практика и алготорговля - страница 3528

 
Aleksey Nikolayev #:

Причём здесь это? Корреляция считалась, по сути, также как волатильность. Например, для Х=1 бралась выборка из всех приращений за 1-ю минуту и смотрелась её корреляция с выборкой из всех последующих приращений за 2-ю минуту. И так далее для всех Х<=1440. Оконная функция устроена по другому.

Код на R

А что такон nb в коде?
Не могли бы вы предоставить более воспроизводимый код
[Удален]  
Aleksey Vyazmikin #:

Перечитал я ещё раз - для меня всё чётко и понятно. Я же не буду менять свою терминологию в желании Вам разъяснить, а свою могу - если будут вопросы.

Я допускаю, что в ваших исследованиях есть рациональное зерно, но очень сложно воспринимать. Возможно, нужен какой-то тезаурус. Например, что такое повреждение вероятностной структуры :)

 
Maxim Dmitrievsky #:

Я допускаю, что в ваших исследованиях есть рациональное зерно, но очень сложно воспринимать. Возможно, нужен какой-то тезаурус. Например, что такое повреждение вероятностной структуры :)

Лично я сдался и просто листаю
[Удален]  
mytarmailS #:
Лично я сдался и просто листаю
😀
 
Maxim Dmitrievsky #:

Я допускаю, что в ваших исследованиях есть рациональное зерно, но очень сложно воспринимать. Возможно, нужен какой-то тезаурус. Например, что такое повреждение вероятностной структуры :)

Вот смотрите, ниже на рисунке я на скорую руку изобразил процесс явления о котором говорю.


У нас имеется три предиктора P0, P1, P2, мы оценили их квантовые отрезки на предмет смещения вероятности к одному из двух классов по отношению к подвыборке, сильные смещения к единице обозначены зеленым цветом, а к нулю - синим, красные же - это те, что не преодолели оценочный порог - пока не известно на текущей итерации к какому классу их следует отнести.

После оценки нам нужно выбрать какой квантовый отрезок исключить (сделать сплит) - я рассматриваю в примере два условных варианта - V1 и V2.

Квантовый отрезок, по которому делали сплит становится серым на рисунке. Тот квантовый отрезок, который содержит те же отклики (индексы строк), что и серый - перечеркивается серой чертой. Утрата примеров в неопределенной области (красной) не отражается на рисунке.

Если выбираем вариант V1, то видим, что у нас два квантовых отрезка, которые утратят часть примеров и будут при их оценки иметь незначительное смещение вероятности по отношению к подвыборки - эта утрата названа повреждением (Damage). После повреждения эти квантовые отрезки попадут в зону неопределенности и станут красного цвета.

Если выбрать вариант V2, то видим, что поврежден только один квантовый отрезок на предикторе P1, в то время, как на предикторе P2 появился новый квантовый отрезок синего цвета, который взял часть примеров от зеленого квантового отрезка и красной области неопределенности. Вот такое постепенное раскрытие диапазона я и назвал структурой, которая изначально скрыта, но постепенно открывается, а выбор просто сплита по лучшей метрики может привести к её повреждению, и она не сможет раскрыться. По сути это ветвление дерева внутри предиктора на новых итерациях. Ранее я показывал, как такие квантовые отрезки исчезают с каждой итерацией, теперь я смог понять причину и пытаюсь контролировать этот процесс.

И, хотя на рисунке показан процесс для квантовых отрезков, как единого целого (сразу два сплита, ограничивающих диапазон предиктора), но схожий процесс происходит и при любом построении дерева, только там выбирается на один квантовый отрезок, а сразу группа - от и до. И, выбор сплита только исходя из лучших показателей таких метрик как Джини, энтропия или логлосс может существенно ухудшить выбор из числа полученных результатов оценки сплита на последующих итерациях построения древовидной модели.

[Удален]  
Aleksey Vyazmikin #:

Вот смотрите, ниже на рисунке я на скорую руку изобразил процесс явления о котором говорю.

Ну так а кластеризация признаков это не то же самое? Вы разбиваете на подвыборки с похожими семплами и смотрите какая у чего там вероятность. При этом не надо лезть в дупло дерева.

 
Maxim Dmitrievsky #:

Ну так а кластеризация признаков это не то же самое? Вы разбиваете на подвыборки с похожими семплами и смотрите какая у чего там вероятность. При этом не надо лезть в дупло дерева.

Хех...

Вот смотрите, как выглядит предиктор в разрезе кластеров - по вашей же выборке - видите какой перехлёст по диапазонам предиктора? Думаю это не хорошо.

В общем ну разные методы, хотя на первый взгляд происходит нечто похожее.

Вообще хотел показать про "повреждение" же в прошлом посте - ну раз не понятно - так и ладно...

 
Aleksey Vyazmikin #:

Если выбрать вариант V2, то видим, что поврежден только один квантовый отрезок на предикторе P1, в то время, как на предикторе P2 появился новый квантовый отрезок синего цвета, который взял часть примеров от зеленого квантового отрезка и красной области неопределенности. Вот такое постепенное раскрытие диапазона я и назвал структурой, которая изначально скрыта, но постепенно открывается, а выбор просто сплита по лучшей метрики может привести к её повреждению, и она не сможет раскрыться. По сути это ветвление дерева внутри предиктора на новых итерациях. Ранее я показывал, как такие квантовые отрезки исчезают с каждой итерацией, теперь я смог понять причину и пытаюсь контролировать этот процесс.

Опять ваши представления о сплитах/квантах не соответствуют действительности.
В предикторе P2 не появится квант в виде подряд идущих примеров (который у вас синего цвета).
Каждый столбец после сортировки (и для определения кванта и для сплита) будет иметь разный порядок строк (кроме дубликатов столбцов). Например:
P1: 9,6,4,7,1,8,5,0,3,2
P2: 0,2,4,6,8,1,3,5,7,9
Итак, если вы удалили отрезок/квант из Р1 со строками 4,7,1, то у P2 удалятся истинные номера этих строк и они не будут идти подряд, а хаотически - и не смогут образовать квант.
P2: 0,2,4,6,8,1,3,5,7,9

Вы бы делали распечатки по строкам и проверяли свои идеи, а то тратите время за зря... ведь очевидно же, что порядок строк будет разный. Но видимо это очевидно, только когда просмотришь много распечаток.

[Удален]  
Aleksey Vyazmikin #:

Хех...

Вот смотрите, как выглядит предиктор в разрезе кластеров - по вашей же выборке - видите какой перехлёст по диапазонам предиктора? Думаю это не хорошо.

В общем ну разные методы, хотя на первый взгляд происходит нечто похожее.

Вообще хотел показать про "повреждение" же в прошлом посте - ну раз не понятно - так и ладно...

Так кластеризация делалась по другому предиктору, а это просто значения других предикторов, соответствующие кластерам.

Соответственно, можно замутить разные замороченные схемы на базе кластеризации.

То есть у вас перед глазами уже готовая квантовая таблица, соответствующая  какому-то кластеру.

Пишется Cluster, не Klaster :)
 
Maxim Dmitrievsky #:
Пишется Cluster, не Klaster :)
 Я тоже похихикал)) 

Ну это нормально у него же своя терминология :)