Машинное обучение в трейдинге: теория, модели, практика и алготорговля - страница 3554

[Удален]  

Задача поиска ТС/закономерности сводится к простой двухмерной задаче оптимизации. Это продиктовано самой природой ВР (двухмерность).

Когда минимизируются 2 ошибки:

  1. ошибка классификации внутри бина (бай/селл)
  2. ошибка определения текущего бина
Итоговый результат = субоптимальная ТС.

Как конкретно вы это решаете, вопрос чисто технический.

И здесь абсолютно критичную роль играет, опять же, не способ дискретизации (хотя он тоже может быть важен), а способ разметки сделок внутри бинов.

 
Maxim Dmitrievsky #:

Сделать выбор )) просто выбрать бин и торговать только на нем, в чем проблема?

Сделать всегда можно, просто подумал, что есть готовый функционал - интересны были критерии отбора.

А так - по сути - если нужна именно кластеризация, то можно использовать любую, по которой можно потом применять новые данные, просто вытащить пороги по кластерам и записать в квантовую таблицу, которую уже можно подать в CatBoost. Это ускорит процесс, так как не нужно будет повторно считать кластера при эксперименте.

[Удален]  
Aleksey Vyazmikin #:

Сделать всегда можно, просто подумал, что есть готовый функционал - интересны были критерии отбора.

А так - по сути - если нужна именно кластеризация, то можно использовать любую, по которой можно потом применять новые данные, просто вытащить пороги по кластерам и записать в квантовую таблицу, которую уже можно подать в CatBoost. Это ускорит процесс, так как не нужно будет повторно считать кластера при эксперименте.

Основная проблема в разметке сделок. Если разметка мусорная, то дискретизация что-то даст, но мало.

Под каждый бин может понадобиться своя разметка.

Можно взять несколько шаблонов разметки и натянуть на каждый бин, если нет никаких представлений, как это должно выглядеть. Программно это все легко делается, здесь уже объяснять не надо. Важна сама концепция.
 
Maxim Dmitrievsky #:

Основная проблема в разметке сделок. Если разметка мусорная, то дискретизация что-то даст, но мало.

Под каждый бин может понадобиться своя разметка.

Если выборка формируется на каждом баре, то можно и в этом направлении думать. Типа разные состояния - разные ТС...

Но, главное, работать с устойчивыми (эффективными) квантовыми отрезками (бинами), иначе всё посыпеться на новых данных, как карточный домик.

[Удален]  
Aleksey Vyazmikin #:

Если выборка формируется на каждом баре, то можно и в этом направлении думать. Типа разные состояния - разные ТС...

Но, главное, работать с устойчивыми (эффективными) квантовыми отрезками (бинами), иначе всё посыпеться на новых данных, как карточный домик.

Часто достаточно посмотреть на распределения внутри бинов, они должны быть стандартными. Потому что теория МО работает только с такими.
И среди 10 бинов/кластеров 2-3 такими будут. Останется правильно из разметить.
 
Maxim Dmitrievsky #:
Часто достаточно посмотреть на распределения внутри бинов, они должны быть стандартными. Потому что теория МО работает только с такими.
И среди 10 бинов/кластеров 2-3 такими будут. Останется правильно из разметить.

Часто это вопрос репрезентативности выборки. В теории может и есть какой то смысл, но по факту - я не вижу зависимости в своих экспериментах.

К тому же, нормальное распределение как раз нужно полностью иметь для вероятностной оценки, а когда берёте только кусочек из него, то смысловая нагрузка условия теряется же.

Но, Вы конечно пробуйте сами, не верьте никому.

[Удален]  
Aleksey Vyazmikin #:

Часто это вопрос репрезентативности выборки. В теории может и есть какой то смысл, но по факту - я не вижу зависимости в своих экспериментах.

К тому же, нормальное распределение как раз нужно полностью иметь для вероятностной оценки, а когда берёте только кусочек из него, то смысловая нагрузка условия теряется же.

Но, Вы конечно пробуйте сами, не верьте никому.

Есть зависимость и она работает. Это матстат.
 
Maxim Dmitrievsky #:
Есть зависимость и она работает. Это матстат.

В статье лишь говорится о лучшем обучении на нормально распределенных данных, к тому же делается оговорка, что это имеет значение только для некоторых типов методов построения моделей.

И я согласен, что для обучения это может быть полезно в некотором роде. Но, речь то не об этом. Вы берёте подвыборку из этого распределения, и думаете, что есть связь из какого распределения подвыборка, но это не так, все оставшиеся предикторы в ней растеряли примеры из своих распределений по разному - не обязательно пропорционально - почти случайно. Таким образом, из чего вы выбираете бин не имеет значения, важней устойчивость смещения вероятности на протяжении всей истории. Ну а, если будите делать новые метки, то как раз это и нужно контролировать для верной разметки.

[Удален]  
Aleksey Vyazmikin #:

В статье лишь говорится о лучшем обучении на нормально распределенных данных, к тому же делается оговорка, что это имеет значение только для некоторых типов методов построения моделей.

И я согласен, что для обучения это может быть полезно в некотором роде. Но, речь то не об этом. Вы берёте подвыборку из этого распределения, и думаете, что есть связь из какого распределения подвыборка, но это не так, все оставшиеся предикторы в ней растеряли примеры из своих распределений по разному - не обязательно пропорционально - почти случайно. Таким образом, из чего вы выбираете бин не имеет значения, важней устойчивость смещения вероятности на протяжении всей истории. Ну а, если будите делать новые метки, то как раз это и нужно контролировать для верной разметки.

Ничего не понял, опять новые определения.
Речь о том, о чем она есть. Ни о чем другом.
Или о центральной предельной теореме.
Наверное, нет смысла продолжать спорить. Мне ведь больше заняться нечем.
Достаточно сделать все правильно и увидеть, что это хорошо. Сравнить распределения, например, во время кластеризации и на валидации.
 
Maxim Dmitrievsky #:
Достаточно сделать все правильно и увидеть, что это хорошо.

Это самое главное.