Машинное обучение в трейдинге: теория, модели, практика и алготорговля - страница 3406

[Удален]
mytarmailS #:

Кто там хотел дообучать умную LLM

Вопрос к тупому барду

Барда же замочили, осталась Гемини :)
Надо брать поменьше модель, иначе будет большой отклик в получении ответа. Гемму, например. Иначе в тестере гонять замучаешься :)
Aleksey Vyazmikin #:

Тут я уже устал - изучайте, как строятся модели...

Конструктивно не хотите общаться.
Изучай значение слова аналогия прежде чем говорить мне за модели и за конструктив.
Я могу модель с нуля построить, ты можешь? 
mytarmailS #:
Изучай значение слова аналогия прежде чем говорить мне за модели и за конструктив.
Я могу модель с нуля построить, ты можешь? 

Явно Вы видите только свой труд - год назад я выкладывал тут работу своего алгоритма построения модели, с гифками. Или память такая у Вас, хуже чем у меня...

Аналогий в моделях нет, более того, значимые листья в двух моделях различаются в 99% случаях.

И потом, речь была о постановке эксперимента - тут у Вас не появилось никаких конструктивных мыслей.

Alexey Burnakov:

Добрый день всем,

Я знаю, что на форуме есть любители машинного обучения и статистики. Предлагаю обсудить в этой теме (без холиваров), поделиться и пополнить собственный банк знаний в этой интересной области.

Для начинающих и не только есть хороший теоретический ресурс на русском языке: https: //www.machinelearning.ru/.

Небольшой обзор литературы по методам отбора информативных признаков: https://habrahabr.ru/post/264915/.

Я предлагаю проблему номер один. Ее решение я опубликую позже. СанСаныч ее уже видел, прошу не подсказывать ответ.

Введение: для того чтобы построить торговый алгоритм, необходимо знать, какие факторы будут основой для прогнозирования цены, или тренда, или направления открытия сделки. Выбор таких факторов - задача не из легких, и она бесконечно сложна.

Во вложении архив с искусственным набором данных csv, который я сделал.

Данные содержат 20 переменных с префиксом input_, и одну крайнюю правую переменную output.

Выходная переменная зависит от некоторого подмножества входных переменных(подмножество может содержать от 1 до 20 входных переменных).

Задача: с помощью любых методов (машинного обучения) выбрать входные переменные, по которым можно определить состояние выходной переменной на имеющихся данных.

Решение можно выложить здесь в виде: input_2, input_19, input_5 (пример). А также можно описать найденную зависимость между входными и выходными переменными.

Кто сможет это сделать, молодец ) От меня готовое решение и объяснение.

Алексей

Прежде чем применять алгоритмы машинного обучения, необходимо провести тщательный исследовательский анализ данных. Он включает в себя изучение распределения переменных, выявление корреляций, обнаружение выбросов и понимание структуры данных. На этом этапе неоценимую помощь могут оказать такие методы визуализации, как гистограммы, диаграммы рассеяния и корреляционные матрицы.

Такие приемы, как масштабирование признаков, нормализация, кодирование категориальных переменных и создание новых признаков с помощью математических преобразований или знаний о предметной области, могут улучшить способность модели улавливать основные закономерности в данных. Итак... Выбор правильного алгоритма машинного обучения для решения поставленной задачи также очень важен. Учитывая, что мы имеем дело с проблемой предсказания, подходящими кандидатами могут быть такие алгоритмы регрессии, как линейная регрессия, деревья решений, случайные леса, машины опорных векторов (SVM) и нейронные сети. Рекомендуется поэкспериментировать с несколькими алгоритмами и оценить их производительность с помощью соответствующих метрик, таких как средняя квадратичная ошибка (MSE), средняя квадратичная ошибка (RMSE) или точность, в зависимости от характера проблемы.

Чтобы оценить эффективность обобщения наших моделей и предотвратить перебор, важно использовать методы кросс-валидации, такие как k-fold cross-validation или leave-one-out cross-validation. Это подразумевает разбиение набора данных на несколько подмножеств, обучение модели на части данных и оценку ее эффективности на оставшихся без внимания данных. Перекрестная проверка также помогает убедиться в надежности и достоверности оценок эффективности нашей модели.

Многие алгоритмы машинного обучения имеют гиперпараметры, которые управляют их поведением и производительностью. Настройка гиперпараметров включает в себя поиск оптимальной комбинации гиперпараметров для достижения максимальной производительности модели. Для точной настройки модели и повышения точности прогнозирования можно использовать такие методы, как поиск по сетке, случайный поиск или байесовская оптимизация.

https://github.com/phil8192/ob-analytics?tab=readme-ov-file

Наткнулся на интересный пакет по визуализации ордерлога,  вот люди заморочились
https://cran.r-project.org/web/packages/obAnalytics/vignettes/guide.html
[Удален]

Выходные решил посвятить изучению нумераи, а то все никак руки не доходили.

После регистрации там предлагают туториалы как и что делать

цель - залететь в топ управляющих, еще интересно как они там данные готовят. Но второе маловероятно, потому что вся дата обфусцирована :)

Видос от них:


Nardus Van Staden #:

Прежде чем применять алгоритмы машинного обучения, необходимо провести тщательный исследовательский анализ данных. Он включает в себя изучение распределения переменных, выявление корреляций, обнаружение выбросов и понимание структуры данных. На этом этапе неоценимую помощь могут оказать такие методы визуализации, как гистограммы, диаграммы рассеяния и корреляционные матрицы.

Такие приемы, как масштабирование признаков, нормализация, кодирование категориальных переменных и создание новых признаков с помощью математических преобразований или знаний о предметной области, могут улучшить способность модели улавливать основные закономерности в данных. Итак... Выбор правильного алгоритма машинного обучения для решения поставленной задачи также очень важен. Учитывая, что мы имеем дело с проблемой предсказания, подходящими кандидатами могут быть такие алгоритмы регрессии, как линейная регрессия, деревья решений, случайные леса, машины опорных векторов (SVM) и нейронные сети. Рекомендуется поэкспериментировать с несколькими алгоритмами и оценить их производительность с помощью соответствующих метрик, таких как средняя квадратичная ошибка (MSE), средняя квадратичная ошибка (RMSE) или точность, в зависимости от характера проблемы.

Чтобы оценить эффективность обобщения наших моделей и предотвратить перебор, важно использовать методы кросс-валидации, такие как k-fold cross-validation или leave-one-out cross-validation. Это подразумевает разбиение набора данных на несколько подмножеств, обучение модели на части данных и оценку ее эффективности на оставшихся без внимания данных. Перекрестная проверка также помогает убедиться в надежности и достоверности оценок эффективности нашей модели.

Многие алгоритмы машинного обучения имеют гиперпараметры, которые управляют их поведением и производительностью. Настройка гиперпараметров включает в себя поиск оптимальной комбинации гиперпараметров для достижения максимальной производительности модели. Для точной настройки модели и повышения точности прогнозирования можно использовать такие методы, как поиск по сетке, случайный поиск или байесовская оптимизация.

Общая справка, в стиле ChatGPT. Лучший способ блеснуть энциклопедическими знаниями.
Forester #:
Общая справка, в стиле ChatGPT. Лучший способ блеснуть энциклопедическими знаниями.
Ага, еще обращаться к посту Алексея  2016-го года в 2024-ом это тоже нечто, такое только Саныч мог делать))
Я вообще сначала был уверен что это бот, но посмотрел профиль, вроде чел.  Хотя может быть все что угодно
Maxim Dmitrievsky #:

Выходные решил посвятить изучению нумераи, а то все никак руки не доходили.

И как
[Удален]
mytarmailS #:
И как
Пока только загрузил 1-ю модель из туториала, мне начислили 0.1 местной валюты. Второй урок не успел :)

Там датасеты по 4 гига, 2000 признаков 

Так понял, там стейкаешь модели, чем больше застейкал тем больше тебе будут начислять, после проверки на новых данных. Все модели от управляющих они стекают в одну большую и она типа торгует где-то на бирже. По своим формулам оценивают вклад каждой модели в общий результат.