Машинное обучение в трейдинге: теория, модели, практика и алготорговля - страница 3609

[Удален]  
mytarmailS #:

как раз полный код исключит все вопросы

Нет, там начнутся вопросы к тестеру, а че там наверное где-то подглядывание, а как вот это работает, а что вот здесь нажать... А как файл правильно загрузить, а какая версия библиотеки, а какая версия питона... А чето у меня не запускается.. Там же много кода.
 
Maxim Dmitrievsky #:
Нет, там начнутся вопросы к тестеру, а че там наверное где-то подглядывание, а как вот это работает, а что вот здесь нажать... А как файл правильно загрузить, а какая версия библиотеки, а какая версия питона... А чето у меня не запускается.. Там же много кода.

ладно, возьми простой общеизвестный датасет например ирисы фишера или сделай свой синтетический и примени свою функцию и покажы код этого, без модели, тестирования , тестера итп

[Удален]  
mytarmailS #:

ладно, возьми простой общеизвестный датасет например ирисы фишера или сделай свой синтетический и примени свою функцию и покажы код этого, без модели, тестирования , тестера итп

У ирисов много классов, надо бинарный. Можно будет потом взять как пример что-нибудь, да.

Или ты можешь взять самую простую версию. Она просто исправляет метки в датасете и ничего не выбрасывает, без мета модели.

Попробуй переписать на R через чатгпт, он должен справиться.

from sklearn.cluster import KMeans

def fix_labels_subset_mean(dataset, n_clusters=200, subset_size=100) -> pd.DataFrame:
    # Применяем KMeans для кластеризации
    dataset['clusters'] = KMeans(n_clusters=n_clusters).fit(dataset[dataset.columns[:-1]]).labels_
    # Вычисляем среднее значение 'labels' для каждого кластера
    cluster_means = dataset.groupby('clusters')['labels'].mean()
    # Сортируем кластеры по их средним значениям и выбираем те, которые наиболее далеки от 0.5
    sorted_clusters = cluster_means.sub(0.5).abs().sort_values(ascending=False).index[:subset_size]
    # Создаем словарь для отображения средних значений в новые значения только для выбранных кластеров
    mean_to_new_value = {cluster: 0.0 if mean < 0.5 else 1.0 for cluster, mean in cluster_means.items() if cluster in sorted_clusters}
    # Применяем изменения к исходным значениям 'labels' только для выбранных кластеров
    dataset['labels'] = dataset.apply(lambda row: mean_to_new_value[row['clusters']] if row['clusters'] in mean_to_new_value else row['labels'], axis=1)
    dataset = dataset.drop(columns=['clusters'])
    return dataset
 
Maxim Dmitrievsky #:

У ирисов много классов, надо бинарный. Можно будет потом взять как пример что-нибудь, да.

Или ты можешь взять самую простую версию. Она просто исправляет метки в датасете и ничего не выбрасывает, без мета модели.

Попробуй переписать на R через чатгпт, он должен справиться.

У ирисов три класса, можешь сделать бинарную целевую в одну строку типа класс есть 1 и не есть 2 и не есть 3.
В результате бинарная целевая..


Да я могу загнать в гпт и перевести на другой ЯП но я не могу быть уверен что работает коректно.. те надо проконтролировать какие данные входят , как преобразовкються и какие выходят..  нужен  нормальный воспроизводимый пример понимаешь
[Удален]  
mytarmailS #:
У ирисов три класса, можешь сделать бинарную целевую в одну строку типа класс есть 1 и не есть 2 и не есть 3.
В результате бинарная целевая..


Да я могу загнать в гпт и перевести на другой ЯП но я не могу быть уверен что работает коректно.. те надо проконтролировать какие данные входят , как преобразовкються и какие выходят..  нужен  нормальный воспроизводимый пример понимаешь

Что-нибудь соображу попозже. Тогда оценивать можно будет только через ошибки моделей, если без тестера.

[Удален]  

Там прикол в том, что если ты применишь эту функцию, то сразу увидишь улучшение на новых после обучения, если датасет не полный рэндом. То есть трейн и тест будут выглядеть более похожими, меньше переобучение.

 
Maxim Dmitrievsky #:

Что-нибудь соображу попозже. Тогда оценивать можно будет только через ошибки моделей, если без тестера.

Все еще жду

Просто сделай дата сет ирисов который коректно работает с твоей функцией, все!! Больше ничего не надо
[Удален]  
mytarmailS #:
Все еще жду

Просто сделай дата сет ирисов который коректно работает с твоей функцией, все!! Больше ничего не надо
Не надо ждать, действуй 
Эта функция не для датасета ирисов, а для исправления разметки 
 
Maxim Dmitrievsky #:
Не надо ждать, действуй 
Эта функция не для датасета ирисов, а для исправления разметки 
Я же тебе написал что нужна 100% воспроизводимость а не голая фукция..  дай пример правильного применения фукции к данным, а не голый бесполезный код одной функции
[Удален]  
mytarmailS #:
Я же тебе написал что нужна 100% воспроизводимость а не голая фукция..  дай пример правильного применения фукции к данным, а не голый бесполезный код одной функции
Там же 3 строчки кода. Дам потом, если непонятно. Дай почилить :)

Ты понимаешь, что кластеризация инициируется рандомно? Все равно 1 в 1 не будет. Тем более на другом ЯП. Что с чем сравнивать будем.