Машинное обучение в трейдинге: теория, модели, практика и алготорговля - страница 3478

 
Maxim Dmitrievsky #:

Позже они напишут, что всегда сами так думали 😀

Всему нужно время)))

 
СанСаныч Фоменко #:

Именно это я и уточняю.

Для вас, кака пишущего на R, это является естественным,а вот остальным это даже в голову не приходит, что обучение ведется на случайно выбранных строках.

Хм, может это заразительно...

Обучение ведется согласно алгоритму - есть варианты со случайной подвыборкой на условную итерацию, а есть без.

Впрочем, я уточнял изначально терминологию fxsaber, которая из алготрейдинга в широком смысле слова. Поэтому уточнения обоих неуместны.

 
Aleksey Vyazmikin #:

Хм, может это заразительно...

Обучение ведется согласно алгоритму - есть варианты со случайной подвыборкой на условную итерацию, а есть без.

Впрочем, я уточнял изначально терминологию fxsaber, которая из алготрейдинга в широком смысле слова. Поэтому уточнения обоих неуместны.

неуместно на одно понятие иметь кучу терминологий (у каждого своя)

есть : трейн, валидация, тест.

Сабер юзает трейн и валидацию , но валидацию называет ООС при этом подразумевает тест

Ну да ладно, варитесь в этом сами если вам нравиться болтать ниочем..

 
mytarmailS #:

Сабер юзает трейн и валидацию , но валидацию называет ООС при этом подразумевает тест

Он разве писал, что делает отбор на втором участке? Он только оценивает что получилось. Вот я и спросил, какой там шанс.

И потом, мне не сложно перейти на другие термины, если я с ними знаком, для диалога с собеседником, а не делать вид, что не понимаю о чём речь.

Или по Вашему, надо писать "Извини, но у тебя две выборки, а не три - значит ты делаешь всё неправильно - забудь дорогу сюда"?

 
Еще до нашей эры Аристотель говорил: «…Иметь не одно значение — значит не иметь ни одного значения; если же у слов нет (определённых) значений, тогда утрачена всякая возможность рассуждать друг с другом, а в действительности и с самим собой, ибо невозможно ничего мыслить, если не мыслить каждый раз что-нибудь одно».
 
mytarmailS #:
Еще до нашей эры Аристотель говорил: «…Иметь не одно значение — значит не иметь ни одного значения; если же у слов нет (определённых) значений, тогда утрачена всякая возможность рассуждать друг с другом, а в действительности и с самим собой, ибо невозможно ничего мыслить, если не мыслить каждый раз что-нибудь одно».

Даже не знаю, были ли уже тогда синонимы в его родном языке...

 
Такой вопрос давно меня тревожил, а что будет, если в предикторах поменять их цифровое значение, ну, допустим поменять местами 1 и 10, изменится ли результат обучения на том же CatBoost?
 
Aleksey Vyazmikin #:
Такой вопрос давно меня тревожил, а что будет, если в предикторах поменять их цифровое значение, ну, допустим поменять местами 1 и 10, изменится ли результат обучения на том же CatBoost?
Если они категориальные - то не изменится. При отключенной рандомизации (фиксировнном seed, но может в катбусте еще что есть рандомного...).
Если числовые и есть значения от 2 до 9, то 1 окажется за 9, а 10 до 2 при сортировке. Оценка сплитов станет другой.
 
Forester #:
Если они категориальные - то не изменится. При отключенной рандомизации (фиксировнном seed, но может в катбусте еще что есть рандомного...).
Если числовые и есть значения от 2 до 9, то 1 окажется за 9, а 10 до 2 при сортировке. Оценка сплитов станет другой.

Допустим алгоритм не работает с кат предикторами. Если алгоритм силен, то, он должен найти аналогичные сплиты, как и до перестановки - одна из гипотез была. По факту обучение совсем другое. Это значит, что если просто преобразовывать шкалу так, что бы менялся порядок значений, то это изменит результат обучения.

Вот я подумал, и упорядочил значения по смещению вероятности после квантования, обучение стало проходить в раз 7 быстрей - вместо 400 деревьев - всего 60, но значительно ухудшился финансовый результат на двух остальных выборках. Получается, что из-за хауса распределения вероятности принадлежности к классу случайно удаётся обучаться чуть лучше.

 

Если смотреть по среднему logloss 100 моделей:

train был 0,518 стал 0,448

test  был 0,543 стал 0,555

exam  был 0,560 стал 0,570

Т.е. по 2 и 3 выборке результат сопоставим, а вот на первой выборке быстрей происходит обучение/обобщение после преобразования.