Машинное обучение в трейдинге: теория, модели, практика и алготорговля - страница 3387

 
Maxim Dmitrievsky #:

Почему большое кол-во признаков - зло? Интересный график из книги по козулу.

Вероятность найти такой же пример в обучающей выборке, в зависимости от кол-ва признаков.

Если у вас больше 14 (и даже 10) признаков, то получится очень много правил, которые вы уже не сможете редуцировать без потерь.


Это все в рамках казуала.. 
В моделях с не структурироваными признаками (текст, картики) 
Несколько тыс. Признаков это норма
[Удален]  
mytarmailS #:
Это все в рамках казуала.. 
В моделях с не структурироваными признаками (текст, картики) 
Несколько тыс. Признаков это норма

там используются эффективные алгоритмы сжатия внутри нейронки, по типу sec2sec, поэтому тоже справедливо

 
Maxim Dmitrievsky #:

там используются эффективные алгоритмы сжатия внутри нейронки, по типу sec2sec, поэтому тоже справедливо

Если мы про текст то Там используется в 95% случаев обычный счётчик слов типа - сколько раз слово встречалось в данном наблюдении? 0, 1, 103..

А чтобы матрица признаков меньше занимала её держат в формате "разреженой матрицы"  это выгодно поскольку 95% значений матрицы это нули

В картинках свертка..

А seq2seq это екзотика на редкую задачу 
[Удален]  
mytarmailS #:
Если мы про текст то Там используется в 95% случаев обычный счётчик слов типа - сколько раз слово встречалось в данном наблюдении? 0, 1, 103..

А чтобы матрица признаков меньше занимала её держат в формате "разреженой матрицы"  это выгодно поскольку 95% значений матрицы это нули

В картинках свертка..

А seq2seq это екзотика на редкую задачу 

Это другие архитектуры, слоеные пироги. Сложно сравнивать. Говорим про обычную классификацию или регрессию. В этом случае это выглядит как универсальный закон.

 
Maxim Dmitrievsky #:

Это другие архитектуры, слоеные пироги. Сложно сравнивать. Говорим про обычную классификацию или регрессию. В этом случае это выглядит как универсальный закон.

Да все оно одно то же.. 

Я не про нейронки, а про структуру подачи признаков. 

----------------------------------------------------------------------

О Вспомнил, это называеться bag of words.



что тут нового, незнакомого, непонятного, сложного ?


Та же таблица признаков + любой МО


Вот это работа с неструктурироваными данными (текст) потом переводим в структуру  bag of words и дальше что угодно

[Удален]  
mytarmailS #:
Да все оно одно то же.. 

Я не про нейронки, а про структуру подачи признаков. 

----------------------------------------------------------------------

О Вспомнил, это называеться bag of words.



что тут нового, незнакомого, непонятного, сложного ?


Та же таблица признаков + любой МО


Вот это работа с неструктурироваными данными (текст) потом переводим в структуру  bag of words и дальше что угодно

Это из другой оперы. Как их не трансформируй, размерность входного вектора должна быть ниже указанного порога, иначе не определишь закономерность. У категориалтных, наверное, лимит на длину вектора больше. Плюс зависимость от количества строк учитывай. На огромных данных кол-во признаков может быть больше.
 
Maxim Dmitrievsky #:
Это из другой оперы. Как их не трансформируй, размерность входного вектора должна быть ниже указанного порога, иначе не определишь закономерность. У категориалтных, наверное, лимит на длину вектора больше. Плюс зависимость от количества строк учитывай. На огромных данных кол-во признаков может быть больше.
Да какая другая))
Весь мир так делает и все довольны) 
[Удален]  
mytarmailS #:
Да какая другая))
Весь мир так делает и все довольны) 
Ну делай как весь мир. Такие ответы и получишь.
Можешь взять 100500 оптимизаторов и обмазаться ими, тоже вариант :)
 
Maxim Dmitrievsky #:
Ну делай как весь мир. Такие ответы и получишь.
Можешь взять 100500 оптимизаторов и обмазаться ими, тоже вариант :)
Ну что ты за чушь лепиш..

Если есть алгоритм который РЕШАЕТ твои задачи, какого черта выдумывать свое квадратное колесо с гордо поднятой головой
 
Maxim Dmitrievsky #:

Я там по козулу основные тезисы набросал, кому сложно читать книжки на англ. Ну и пример на питоне, как это работает лучше всего, по моей версии. Ннада статью?


Нннада)))