記事「機械学習におけるガウス過程(第1回):MQL5における分類モデル」についてのディスカッション

 

新しい記事「機械学習におけるガウス過程(第1回):MQL5における分類モデル」はパブリッシュされました:

ガウス過程の分類モデルを扱います。まず、その理論的原理について学び、続いてMQL5におけるGPライブラリの実装へと進みます。

機械学習モデルであるガウス過程(GP)について、引き続き理解を深めていきます。前回の記事では、連続値を予測することを主な目的とした回帰問題について詳しく検討しました。今回は、さらに複雑なテーマである分類を扱います。る類における最大の難しさは、ガウス過程で分類する場合、推論に閉形式解が存在しないことです。そのため、ラプラス近似などの近似手法を利用する必要があります。

この複雑な問題を効果的に解決するため、今回はMQL5でモジュール型のガウス過程ライブラリを開発します。このアプローチにより、GPモデルを独立したコンポーネントに分割してコードを構造化でき、今後の改良や拡張に向けた強固な基盤を構築できます。このライブラリは、回帰と分類の両方に利用できる汎用的なツールとなることを目指します。

記事の前半では、GP分類の理論について詳しく検討します。そこでは、近似手法の基礎となる数学についても扱います。また、ライブラリの主要クラスであるGaussianProcessについて紹介します。このクラスはモデルを構成するすべてのコンポーネントを統合します。さらに、Alglib最適化ライブラリとの連携を担うGPOptimizationObjectiveクラスについても説明します。


作者: Evgeniy Chernish

 

まだ詳しく読み込んでいないが、どうやらすでに何かを見逃してしまったようだ。

В отличие от таких методов, как ... деревья решений, которые выдают только метку класса, ГП позволяют получить вероятностное предсказание.

個人的には、木構造はクラスの確率をうまく表していると思う。

ターゲットが離散的なクラスラベルである分類問題では、ガウス尤度は適していない。

いわゆる「ツリー型」の分類アルゴリズムは、確率を連続値である「logodds」に変換するようで、そうなると分類は事実上、これらの連続値であるlogoddsを用いた回帰問題に帰着される。 なぜ、それがどのようなものであれ、これをガウス尤度に適用できないのでしょうか? 残念ながら、Pythonのマニュアル以外ではそのような用語を見かけませんでしたが、ガウス分布、ガウス混合分布、最大尤度法、期待値最大化法については知っています ;-)。

 
Stanislav Korotky #:

まだ詳しく読んでいないが、どうやら何か見落としているようだ。

個人的には、木はクラスの確率をうまく表していると思う。

いわゆる「木」型の分類アルゴリズムは、確率を連続値である「logodds」に変換するようで、そうなると分類は事実上、これらの連続値であるlogoddsを用いた回帰問題に帰着される。 なぜこれをガウス尤度に適用できないのでしょうか?それがどのようなものであれ。 残念ながら、Pythonのマニュアル以外ではそのような用語を見かけませんでしたが、ガウス分布、ガウス混合分布、最大尤度、期待値最大化法については知っています ;-)。

こんにちは!

確かに、scikit-learnを確認したところ、決定木はクラスの確率を出力していました。なぜか、確率を出力するのはアンサンブル法だけだと思っていました。まあ、「生きていれば学ぶことは尽きず、愚か者のまま死ぬ」という通りですね。

さて、ガウス尤度について、そしてなぜそれが分類問題に適さないのかについてです。

ガウス尤度は、期待値と分散が与えられた場合の正規分布の確率密度関数です。ガウス尤度において、期待値の役割は隠れ関数 f が担い、分散は事実上、データの真のノイズに相当します。

尤度と通常の確率密度の違いは何でしょうか?通常の確率密度では、パラメータの値を固定した上で、ある値 y を代入し、そのy の 確率を求めます。

尤度ではその逆です。yは 固定され、分布のパラメータが変化します。つまり、尤度はパラメータの関数です。例えば、尤度によると、パラメータが0.2と1の場合、観測された軌跡y= 0.06となる確率は0.06です。 また、パラメータが0.8と1.2の場合、y= 0.12が 観測される確率はこれほどです。つまり、2つ目のパラメータの組み合わせの方が、私たちが扱っている実測データをより適切に説明していることがわかります。ここから「尤度」という名称が由来しています。

では、なぜ「logodds」をガウス尤度に適用できないのでしょうか。ガウス尤度は、観測データy が 正規分布に従うことを前提としています。つまり、y は連続値であるということです。

分類のためのGPモデルにおいて、隠れ関数f(x)は「logodds」として解釈できます。しかし、私たちはこの関数を予測するものであり、観測するものではありません。 私たちが観測するのは離散的なラベルy です。ガウス尤度はまさに観測データに適用されるものです。しかし、私たちの観測データは離 散的です。そのため、二値の場合、それらはベルヌーイ分布に従います。

分類問題において、尤度は離散ラベルの確率を記述するものであるため、ここでは当然、ロジット尤度を選択するのが自然である。

 
とても良い記事ですね。今後のガウス過程に関する連載を楽しみにしています。