Обсуждение статьи "Вероятностный метод главных компонент на MQL5"

 

Опубликована статья Вероятностный метод главных компонент на MQL5:

Рассмотрены классический PCA и его вероятностная формулировка (PPCA). Представлен универсальный класс CPPCA для MQL5 с тремя алгоритмами обучения (EIG, SVD, EM). Выполнено сопоставление результатов со scikit-learn и разобраны подходы к выбору числа главных компонент (Scree Plot, AIC/BIC, кросс-валидация). Показано применение метрики Score (средний логарифм правдоподобия) для обнаружения смены распределения данных.

Анализ главных компонент (PCA) — один из фундаментальных методов машинного обучения и анализа данных. Он широко применяется для уменьшения размерности, извлечения признаков, сжатия информации и визуализации многомерных пространств.

Традиционно PCA рассматривают как геометрический метод: данные проецируются на подпространство меньшей размерности так, чтобы сохранить максимум дисперсии. Наряду с этим существует и вероятностная формулировка метода (Probabilistic PCA), в которой та же задача записывается в виде модели с латентными переменными.

Именно вероятностный подход раскрывает дополнительные возможности PCA. Он позволяет оценивать параметры через EM-алгоритм. Также можно применять информационные критерии и кросс-валидацию для выбора числа главных компонент, а также вычислять функцию правдоподобия и оценивать соответствие новых данных обученной модели. Кроме того, PPCA служит концептуальным фундаментом для более сложных вероятностных моделей, таких как факторный анализ и анализ независимых компонент (ICA). Освоение вероятностной трактовки PCA существенно упрощает понимание этих моделей.

В данной статье мы пройдем путь от теории к практике:

  • Рассмотрим математику классического и вероятностного PCA,
  • Реализуем универсальный класс модели на MQL5, объединяющий оба подхода,
  • Проверим корректность работы класса и оценим его вычислительную эффективность путем сравнения с эталонной реализацией из библиотеки Scikit-Learn,
  • Исследуем проблему выбора числа главных компонент — от классического анализа "каменистой осыпи" (Scree Plot) до вероятностных методов (информационные критерии AIC/BIC и кросс-валидация),
  • Рассмотрим применение показателя правдоподобия (Score) для обнаружения смены распределения данных на участках Out-of-Sample.

    Автор: Evgeniy Chernish