汎用人工知能のための数学的形式主義
AIXI ['ai̯k͡siː]は、人工汎用知能のための理論的数学的形式主義である。これは、ソロモンオフ帰納法と逐次決定理論を組み合わせたものである。AIXIは、 2000年にマーカス・ハッターによって初めて提案され[1] 、AIXIに関するいくつかの結果は、ハッターの2005年の著書「Universal Artificial Intelligence」で証明されている。[2]
AIXI は強化学習(RL) エージェントです。環境から受け取る期待総報酬を最大化します。直感的に、AIXI は計算可能なすべての仮説 (または環境) を同時に考慮します。各タイム ステップで、すべての可能なプログラムを調べ、次に実行されるアクションに応じてプログラムが生成する報酬の数を評価します。約束された報酬は、このプログラムが真の環境を構成するという主観的な信念によって重み付けされます。この信念はプログラムの長さから計算されます。オッカムの剃刀に従って、長いプログラムは可能性が低いと見なされます。次に、AIXI は、これらすべてのプログラムの加重合計で期待総報酬が最も高いアクションを選択します。
意味
ハッターによれば、「AIXI」という単語には複数の解釈がある。AIXIはソロモンオフ分布に基づくAI (ギリシャ文字のxi)を表すこともできるし、例えば、帰納法(I)と「交差した」(X)AIを表すこともできる。他の解釈もある。[3]
AIXI は、確率的で未知だが計算可能な環境 と相互作用する強化学習エージェントです。相互作用は から までのタイム ステップで進行します。ここで はAIXI エージェントの寿命です。タイム ステップtで、エージェントはアクション(手足の動きなど) を選択して環境で実行し、環境は「知覚」 で応答します。知覚は「観測」(カメラ画像など) と報酬で構成され、条件付き確率に従って分布します。ここで はアクション、観測、報酬の「履歴」です。したがって、環境は完全な履歴に依存する「知覚」(観測と報酬) の確率分布として数学的に表現されるため、マルコフ仮定はありません(他の RL アルゴリズムとは異なります)。この確率分布は AIXI エージェントには未知であることに注意してください。さらに、は計算可能であることに再度留意してください。つまり、エージェントが環境から受け取る観測値と報酬は、 AIXIエージェントの過去の行動が与えられた場合、何らかのプログラム(チューリングマシン上で実行される)によって計算できます。[4]










AIXI エージェントの唯一の目標は、つまり、タイムステップ 1 から m までの報酬の合計を最大化することです。

AIXI エージェントは、確率的ポリシー に関連付けられています。これは、各タイム ステップでアクションを選択するために使用する関数です。ここで、 はAIXI が実行できるすべての可能なアクションの空間であり、は環境によって生成される可能性のあるすべての「知覚」の空間です。環境 (または確率分布) は、確率的ポリシー (関数) と考えることもできます。ここで、 はKleene スター演算です。






一般的に、時間ステップ(1からmの範囲)で、AIXIは以前にアクション(文献では と略されることが多い)を実行し、知覚の履歴( と略されることもある)を観察した後、環境内でアクション を選択して実行する。アクションは次のように定義される:[3]




![{\displaystyle a_{t}:=\arg \max _{a_{t}}\sum _{o_{t}r_{t}}\ldots \max _{a_{m}}\sum _{o_{m}r_{m}}[r_{t}+\ldots +r_{m}]\sum _{q:\;U(q,a_{1}\ldots a_{m})=o_{1}r_{1}\ldots o_{m}r_{m}}2^{-{\textrm {length}}(q)}}](https://wikimedia.org/api/rest_v1/media/math/render/svg/37a6bc316aa501fc998471d0e2417451e3a79bdf)
または、括弧を使用して優先順位を明確にする
![{\displaystyle a_{t}:=\arg \max _{a_{t}}\left(\sum _{o_{t}r_{t}}\ldots \left(\max _{a_{m}}\sum _{o_{m}r_{m}}[r_{t}+\ldots +r_{m}]\left(\sum _{q:\;U(q,a_{1}\ldots a_{m})=o_{1}r_{1}\ldots o_{m}r_{m}}2^{-{\textrm {length}}(q)}\right)\right)\right)}](https://wikimedia.org/api/rest_v1/media/math/render/svg/5945f3600bb4dc1cf341af2014fa61ee5b164088)
直感的に言えば、上記の定義では、AIXIは時間ステップ先までのすべての可能な「未来」の総報酬の合計(つまり、からまで)を考慮し、その未来を生成できるエージェントの過去(つまり、以前に実行されたアクション、および受信された知覚、 )と一致するプログラムの複雑さ(つまり、によって)によってそれぞれに重み付けし、予想される将来の報酬を最大化するアクションを選択します。[4]





この定義を完全に理解するために、詳しく見ていきましょう。
は、AIXI エージェントが時間ステップで環境 (未知で確率的) から受信した「知覚」(観測と報酬で構成) です。同様に、は、時間ステップ (AIXI がアクティブな最後の時間ステップ) で AIXI が受信した知覚です。





はタイムステップごとに支払われる報酬の合計なので、AIXI はタイムステップでのアクションを選択するために将来を見据える必要があります。



は単調な ユニバーサル チューリング マシンを表し、ユニバーサル マシン 上のすべての (決定論的) プログラムを対象とします。ユニバーサル マシン は、プログラムとアクションのシーケンス(つまり、すべてのアクション) を入力として受け取り、知覚のシーケンスを生成します。ユニバーサル チューリング マシンは、プログラム (環境を「モデル化」する) と AIXI エージェントのすべてのアクションが与えられた場合に、環境の応答または知覚を「シミュレート」または計算するために使用されます。この意味で、環境は「計算可能」です (上記のように)。一般に、現在の実際の環境 (AIXI が動作する必要がある環境)を「モデル化」するプログラムは、現在の環境も不明であるため不明であることに注意してください。







はプログラムの長さです(ビットの文字列としてエンコードされます)。 に注意してください。したがって、上記の定義では、 は、すべての計算可能な環境(エージェントの過去と一致する)にわたる混合物(この場合は合計)として解釈され、それぞれがその複雑さ によって重み付けされます。 は と書くこともできることに注意してください。は、AIXI エージェントによって環境ですでに実行されたアクションのシーケンスです。同様に、 、、 は、これまで環境によって生成された知覚のシーケンスです。









この方程式または定義を理解するために、これらすべての要素をまとめてみましょう。
時間ステップ t で、AIXI は関数が最大値に達するアクションを選択します。

![{\displaystyle \sum _{o_{t}r_{t}}\ldots \max _{a_{m}}\sum _{o_{m}r_{m}}[r_{t}+\ldots +r_{m}]\sum _{q:\;U(q,a_{1}\ldots a_{m})=o_{1}r_{1}\ldots o_{m}r_{m}}2^{-{\textrm {length}}(q)}}](https://wikimedia.org/api/rest_v1/media/math/render/svg/810a175d1abfcf2972804d643e2b07f6f27d50b6)
パラメータ
AIXI のパラメータは、ユニバーサルチューリングマシンUとエージェントの有効期間mであり、これらを選択する必要があります。後者のパラメータは、割引を使用して削除できます。
最適性
AIXIのパフォーマンスは、受け取る報酬の予想総数によって測定されます。AIXIは、以下の方法で最適であることが証明されています。[2]
- パレート最適性: すべての環境で AIXI と同等以上のパフォーマンスを発揮し、少なくとも 1 つの環境で AIXI より優れたパフォーマンスを発揮するエージェントは存在しません。[要出典]
- バランスのとれたパレート最適性: パレート最適性と同様ですが、環境の加重合計を考慮します。
- 自己最適化: ポリシーpは、エージェントのライフタイムの長さ (時間ではない) が無限大になったときにpのパフォーマンスが理論上の最大値に近づく場合、環境に対して自己最適化されていると呼ばれます。自己最適化ポリシーが存在する環境クラスの場合、AIXI は自己最適化されます。


その後、ハッターとヤン・ライケは、バランスのとれたパレート最適性は主観的であり、どのような政策もパレート最適とみなすことができると示し、AIXIに対するこれまでの最適性の主張を覆すものだと述べている。[5]
しかし、AIXI には限界があります。外部状態ではなく知覚に基づいて報酬を最大化することに限られています。また、AIXI は環境とアクションと知覚チャネルのみを介して相互作用することを想定しているため、損傷や変更の可能性を考慮することができません。口語的に言えば、これは AIXI が相互作用する環境によって自分自身が制限されるとは考えていないことを意味します。また、環境は計算可能であると想定しています。[6]
計算面
ソロモンオフ帰納法と同様に、AIXIは計算不可能です。しかし、計算可能な近似は存在します。そのような近似の1つがAIXI tlで、少なくとも、証明可能な最良の時間tと空間lの制限付きエージェントと同等のパフォーマンスを発揮します。[2]制限された環境クラスを持つAIXIの別の近似は、MC-AIXI(FAC-CTW)(モンテカルロAIXI FAC-コンテキストツリー重み付けの略)で、部分的に観測可能な パックマンなどの単純なゲームをプレイするのにある程度成功しています。[4] [7]
参照
参考文献
- ^ Marcus Hutter (2000). アルゴリズムの複雑性に基づく汎用人工知能の理論. arXiv : cs.AI/0004001 . Bibcode :2000cs......4001H.
- ^ abc — (2005). ユニバーサル人工知能: アルゴリズム確率に基づく逐次決定。理論計算機科学テキスト EATCS シリーズ。Springer. doi :10.1007/b138233. ISBN 978-3-540-22139-5.S2CID 33352850 。
- ^ ab Hutter, Marcus. 「Universal Artificial Intelligence」. www.hutter1.net . 2024年9月21日閲覧。
- ^ abc Veness, Joel; Kee Siong Ng; Hutter, Marcus; Uther, William; Silver, David (2009). 「モンテカルロAIXI近似」. arXiv : 0909.0801 [cs.AI].
- ^ Leike, Jan; Hutter, Marcus (2015). 不適切な普遍的事前分布と最適性の概念(PDF)。第28回学習理論会議の議事録。
- ^ Soares, Nate. 「現実的な世界モデルの2つの問題の形式化」(PDF) . Intelligence.org . 2015年7月19日閲覧。
- ^ AIXI 近似を使用してパックマンをプレイ – YouTube
- 「ユニバーサル アルゴリズム インテリジェンス: 数学的トップダウン アプローチ」、Marcus Hutter、arXiv :cs/0701125。また、Artificial General Intelligence、B. Goertzel および C. Pennachin 編、Springer、2007 年、ISBN 9783540237334、pp. 227–290、doi :10.1007/978-3-540-68677-4_8 にも掲載。