Машинное обучение в трейдинге: теория, модели, практика и алготорговля - страница 3580

 
Aleksey Vyazmikin #:

Верификацию прошёл с РФ. Но, зря, в конкурсе не дают участвовать.

мне ссылку дал чел с рф, он и на кагле фигачит.. Как то решаюш эти проблемы ребята
 
mytarmailS #:
мне ссылку дал чел с рф, он и на кагле фигачит.. Как то решаюш эти проблемы ребята

Ну, видимо для участия при регистрации нужно указать другую страну.

 
Aleksey Vyazmikin #:

Ну, видимо для участия при регистрации нужно указать другую страну.

Так он участвует не ради участвия он с етого жывет
 
mytarmailS #:
Так он участвует не ради участвия он с жтого жывет

Если есть возможность, то спросите у него, пожалуйста, как же участвовать...

Может страна - формальность. Как я понял, организатор конкретного конкурса ставит ограничение, т.е. в другом может быть разрешено участие.

 
Aleksey Vyazmikin #:

Если есть возможность, то спросите у него, пожалуйста, как же участвовать...

Может страна - формальность. Как я понял, организатор конкретного конкурса ставит ограничение, т.е. в другом может быть разрешено участие.

У них есть почта для любых вопросов, почему бы не написать???????

 
mytarmailS #:

У них есть почта для любых вопросов, почему бы не написать???????

Понятно.

 
Aleksey Nikolayev #:

Есть некие сомнения по поводу решающих деревьев (для классификации). В теории они должны хорошо находить прямоугольные области, но имхо они плохо делают это для произвольного прямоугольника, который не примыкает к краям исходного прямоугольника. Появляется много мусорных листьев, например. Особенно сильно это заметно для достаточно слабых закономерностей, каковые являются нормой для наших задач.

Возникает мысль перейти от деревьев к простому поиску прямоугольников, когда сплиты делаются не по-очереди, а одновременно несколько. Беглый поиск показал что нечто похожее уже есть - RBC (Rectangular Boundary Classifier). Потом на этом наверно можно тоже как-то делать бэггинг и возможно даже бустинг.

Ещё одна естественно возникающая идея - перейти от задачи классификации к задаче оптимизации. Например, когда просто ищется прямоугольник, максимизирующий прибыль по сумме сделок попавших в него.

С чего Вы взяли, что ДОЛЖНЫ хорошо находить прямоугольные области, Более того, являются ли проблемы с прямоугольными областями источником ошибок классификации?

Главным здесь является вопрос: что является источником ошибок классификации?

Для меня ответ очевиден: одни и те же значения предиктора в одних случаях относятся к одному классу, а в другом случае к другому классу. И это никакой алгоритм классификации не разделит.

А вот на этапе препроцессинга можно попытаться это положение исправить, например, по алгоритму  Tomeka.

 
СанСаныч Фоменко #:

Главным здесь является вопрос: что является источником ошибок классификации?

Для меня ответ очевиден: одни и те же значения предиктора в одних случаях относятся к одному классу, а в другом случае к другому классу. И это никакой алгоритм классификации не разделит.

А вот на этапе препроцессинга можно попытаться это положение исправить, например, по алгоритму  Tomeka.

Алгоритм Tomek Links (или просто Tomek) — это метод, используемый в машинном обучении для улучшения качества данных путем удаления избыточных или ошибочных образцов в задаче классификации. Этот метод особенно полезен для работы с несбалансированными данными.

Основная идея Tomek Links заключается в следующем:

  1. Определение пар Tomek Links:

    • Рассматриваются пары соседних объектов из разных классов. Например, объекты A A A и B B B являются соседними, если расстояние между ними меньше, чем расстояние до любого другого объекта.
    • Если A A A и B B B принадлежат к разным классам и являются ближайшими соседями друг для друга, то такая пара называется парой Tomek Links.
  2. Удаление объектов:

    • Если обнаружена пара Tomek Links, то один или оба объекта этой пары считаются кандидатами на удаление.
    • Обычно удаляют объект, принадлежащий к меньшинству (или к тому классу, который больше представлен в данных), или оба объекта, чтобы улучшить качество границы разделения между классами.

Пример:

  • Пусть у нас есть два класса: положительный и отрицательный.
  • Для каждого объекта из положительного класса находим его ближайшего соседа из отрицательного класса и наоборот.
  • Если два объекта являются ближайшими соседями друг для друга и принадлежат к разным классам, то они образуют пару Tomek Links.
  • Эти объекты либо удаляются, либо только один из них (в зависимости от реализации алгоритма).

Цель использования метода Tomek Links — уменьшить влияние шумовых данных и улучшить разделение между классами, что может привести к улучшению качества классификации. Этот метод часто применяется в комбинации с другими методами обработки несбалансированных данных, такими как ресемплинг (oversampling и undersampling).

[Удален]  
Экспериментировал с методами Андер/Овер семплинга давно. Они, так сказать, все ещё слишком грубо работают в задачах классификации временных рядов с большим количеством шума. Другими словами, ничего не дают :) Просто добавляют ещё немного шума или удаляют совсем немного шума.
[Удален]  
Aleksey Vyazmikin #:

Айфоны своровали на выдачи, а  те, что нет - продали уже.

Верификацию прошёл с РФ. Но, зря, в конкурсе не дают участвовать.

Покупать свежак всегда не выгодно - хайповая наценка, лучше подождать пару лет, когда и цены будут лучше, технологии обкатаны и улучшены, да и софт адаптируют.

Современные ноуты на x86 уже имеют хорошую автономность для браузерных задачь, если это очень нужно. Мне вот не нужно.

Ну в случае с техникой эпл, она обычно только дорожает :)

Когда они выпустили свой arm проц, ноут на нем стоил столько же сколько такой же ноут на интеле. Но люди перестали покупать интеловское ржавое железо после этого, ощутив разницу.