Машинное обучение в трейдинге: теория, модели, практика и алготорговля - страница 2426
Вы упускаете торговые возможности:
- Бесплатные приложения для трейдинга
- 8 000+ сигналов для копирования
- Экономические новости для анализа финансовых рынков
Регистрация
Вход
Вы принимаете политику сайта и условия использования
Если у вас нет учетной записи, зарегистрируйтесь
Много не знакомых функцый, потому что язык высокоуровневый.
Не думаю, что все мои извращения сможете легко реализовать в R :)
Да - остановка обучения тоже подгонка под тест. Других деталей вашей системы я не знаю, больше сказать ничего не могу
Согласен, что это в теории увеличивает результат на выборке test, но я оцениваю результат по выборке exam!
Ну, а все детали, мне казалось, я описал, если есть вопросы спрашивайте.
В кросвалидации все данные являются тестом и все они же являются трейном. Просто по очереди. Вы как раз хотели увеличить трейн участок на 40%.
Хорошо, с какой целью Вы используете кросвалидацию? Я пока вижу её смысл в поиске гиперпараметров модели, так как в среднем она покажет какие настройки лучше из всех на рандомных участках.
Не думаю, что все мои извращения сможете легко реализовать в R :)
Ахахах))))
Если я свои извращения могу реализовать, то твои как отдохнуть)
Хорошо, с какой целью Вы используете кросвалидацию? Я пока вижу её смысл в поиске гиперпараметров модели, так как в среднем она покажет какие настройки лучше из всех на рандомных участках.
Именно для этого. Вам что-то еще нужно? И конкретный набор признаков. С разными признаками и гиперпараметры будут скорее всего другими. Вот те , что отберете с лучшими гиперпараметрами и нужно запускать в работу.
Ну, а все детали, мне казалось, я описал, если есть вопросы спрашивайте.
Глубоко вникать - лень.
Ахахах))))
Если я свои извращения могу реализовать, то твои как отдохнуть)
Ну, я вот, раз делать скрипт для подготовки данных, то нужно ещё сделать файл с перечислением исключенных столбцов, к которым относятся:
1. Столбцы с коррелирующими предикторами (кстати, а как выбирается, какой столбец откидывать, допустим 5 коррелирующих предикторов?).
2. Столбцы, отброшенные из первого файла-таблицы, за исключением столбца с целевой.
Плюс в файл нужно написать столбец с меткой целевой, его желательно искать по названию столбца.
Структура файла такая
Именно для этого. Вам что-то еще нужно? И конкретный набор признаков. С разными признаками и гиперпараметры будут скорее всего другими. Вот те , что отберете с лучшими гиперпараметрами и нужно запускать в работу.
Глубоко вникать - лень.
Мне нужно отобрать нужные предикторы за меньшее число времени. Перебирать предикторы ещё - это увеличить время на обработку в сотни раз. Мой метод построен на логике, что хороший предиктор (в том числе подходящий под конкретный метод обучения) будет востребован моделью на всех интервалах выборки, что исключает подгонку под участок выборки.
Ну, я вот, раз делать скрипт для подготовки данных, то нужно ещё сделать файл с перечислением исключенных столбцов, к которым относятся:
1. Столбцы с коррелирующими предикторами (кстати, а как выбирается, какой столбец откидывать, допустим 5 коррелирующих предикторов?).
2. Столбцы, отброшенные из первого файла-таблицы, за исключением столбца с целевой.
Плюс в файл нужно написать столбец с меткой целевой, его желательно искать по названию столбца.
Структура файла такая
Мне нужно отобрать нужные предикторы за меньшее число времени. Перебирать предикторы ещё - это увеличить время на обработку в сотни раз. Мой метод построен на логике, что хороший предиктор (в том числе подходящий под конкретный метод обучения) будет востребован моделью на всех интервалах выборки, что исключает подгонку под участок выборки.
Чтобы было на всех - надо кросс валидацией проверять. А вы проверяете только тестом или экзаменом.
Если кроссвалидацию делать по 10% от выборки, то надо 10 раз обучить, а не сотни. А если 20%, то 5 раз.
Чтобы было на всех - надо кросс валидацией проверять. А вы проверяете только тестом или экзаменом.
Если кроссвалидацию делать по 10% от выборки, то надо 10 раз обучить, а не сотни. А если 20%, то 5 раз.
Я разбиваю выборку train на 8 участков и строю 100 разных моделей для каждого участка, потом анализирую модели и смотрю, какие предикторы были востребованы - это значит, что с их помощью были найдены закономерности, усредняю оценочное значение, и дальше уже использую оставшиеся предикторы для обучения на всей выборке. Логика в том, что раз на отдельно взятом участке находились закономерности из этих предикторов, то модель сможет обобщить на этих предикторах всю выборку равномерно, а не подгоняться под участки выборки, как это обычно происходит.
Ваш метод предусматривает построение модели на малой части выборки, при этом модели будут строятся разные на каждом участке, так как выбираться будут лучшие предикторы, подходящие под конкретный участок обучения, а учитывая факт неполноты (репрезентабельности) выборки, можно утверждать что таким образом исследуется только часть доступной информации, которая в будущем может повторятся, а может и не повторятся, мой метод позволят узнать о рынке больше информации при этом переобучение будет меньше. К тому же, если в CatBoost не фиксировать квантовую таблицу, то каждый раз вообще обучение будет на разных предикторах по причине разных построений квантовых таблиц под конкретный участок выборки.
теперь ответ на первый вопрос
Не понимаю, что не так - ругается