Машинное обучение в трейдинге: теория, модели, практика и алготорговля - страница 3430

 
Maxim Dmitrievsky #:

несколько символов сразу в одном датасете

Наверное, как раз здесь нужна нормализация фичей, как бы я ее не презирал 

Я немного ходил в эту сторону, но я отбирал листья по выборке по одному инстурменту и смотрел их эффективность на другом, к сожалению эффективных оставалось процентов 5% от всех изначально отобранных -- на независимых выборках для двух инструментов, может чуть больше, помню, что мало. И, у меня есть нормализация, там где это требуется, т.е. информация от предикторов не в пунктах подаётся.

В планах у меня делать перебор разных вариантов нормализации - но с моими темпами - будет не скоро.

[Удален]  
Aleksey Vyazmikin #:

Я немного ходил в эту сторону, но я отбирал листья по выборке по одному инстурменту и смотрел их эффективность на другом, к сожалению эффективных оставалось процентов 5% от всех изначально отобранных -- на независимых выборках для двух инструментов, может чуть больше, помню, что мало. И, у меня есть нормализация, там где это требуется, т.е. информация от предикторов не в пунктах подаётся.

В планах у меня делать перебор разных вариантов нормализации - но с моими темпами - будет не скоро.

ну здесь она нужна только для того, чтобы сделать наборы признаков сопоставимыми. Иначе НС/бустинг запомнят примеры для каждой пары и обобщения не произойдет.

По идее, чем больше символов загнать - тем лучше. С точки зрения генерализации.
 
Maxim Dmitrievsky #:

ну здесь она нужна только для того, чтобы сделать наборы признаков сопоставимыми. Иначе НС/бустинг запомнят примеры для каждой пары и обобщения не произойдет.

Нормализация у меня решает вопрос сопоставимости одинаковых паттернов вне зависимости от рыночной волотильности.

[Удален]  
Aleksey Vyazmikin #:

Нормализация у меня решает вопрос сопоставимости одинаковых паттернов вне зависимости от рыночной волотильности.

Не путаете со стандартизацией?

 
Maxim Dmitrievsky #:

Не путаете со стандартизацией?

в моём случае, конечно, речь в большей степени о стандартизации, если о классических понятиях речь. Но, по сути цель всего этого - сделать сопоставимыми данные.

В чистом виде нормализация ничего не дают - меняет только шкалу счисления.

[Удален]  
Aleksey Vyazmikin #:

в моём случае, конечно, речь в большей степени о стандартизации, если о классических понятиях речь. Но, по сути цель всего этого - сделать сопоставимыми данные.

В чистом виде нормализация ничего не дают - меняет только шкалу счисления.

благодаря чему данные становятся сопоставимыми 

 
Maxim Dmitrievsky #:

благодаря чему данные становятся сопоставимыми 

Нормализация загоняет в одну шкалу все предиктора, а стандартизация делает сопоставимыми показатели одного предиктора при разных внешних условиях. Или у Вас другая нормализация? Если нет, то что даст сопоставимость разных предикторов для деревянных моделей?

[Удален]  
Aleksey Vyazmikin #:

Нормализация загоняет в одну шкалу все предиктора, а стандартизация делает сопоставимыми показатели одного предиктора при разных внешних условиях. Или у Вас другая нормализация? Если нет, то что даст сопоставимость разных предикторов для деревянных моделей?

В признаковом пространстве точки становятся более сопоставимыми в обоих случаях.

Только прикол в том, что делая их более сопоставимыми на is, делают их менее сопоставимыми на oos, на нестационарных рядах.

То есть везде нас как бы поджидает засада.

* пишу в контексте мультивалютника, где данные из разных источников
 
Maxim Dmitrievsky #:

В признаковом пространстве точки становятся более сопоставимыми в обоих случаях.

Только прикол в том, что делая их более сопоставимыми на is, делают их менее сопоставимыми на oos, на нестационарных рядах.

То есть везде нас как бы поджидает засада.

Я не понимаю затеи - для сетей или кластеризации это полезно может быть, а для деревьев то где польза - алгоритму это не нужно.

К тому же, если используете CatBoost, то он уже делает фактически нормализацию через квантование, оставляя одинаковое число и диапазон значений предикторов. Можете сделать квантование и сохранить выборку с номерами квантовых отрезков, тогда и на новых данных будет нормальной такая нормализация.

[Удален]  
Aleksey Vyazmikin #:

Я не понимаю затеи - для сетей или кластеризации это полезно может быть, а для деревьев то где польза - алгоритму это не нужно.

К тому же, если используете CatBoost, то он уже делает фактически нормализацию через квантование, оставляя одинаковое число и диапазон значений предикторов. Можете сделать квантование и сохранить выборку с номерами квантовых отрезков, тогда и на новых данных будет нормальной такая нормализация.

Maxim Dmitrievsky #:
* пишу в контексте мультивалютника, где данные из разных источников
И меня не обязательно понимать, меня нужно просто любить :)