人工知能において、徒弟学習(または実演学習や模倣学習)とは、専門家を観察することによって学ぶプロセスである。[ 1 ] [ 2 ]これは、訓練データセットが実演教師によるタスク実行で構成される教師あり学習の一形態と見なすことができる。[ 2 ]
マッピング手法は、状態から行動へ[ 2 ]、または状態から報酬値へ[ 1 ]直接マッピングを形成することで、専門家を模倣しようとします。例えば、2002年に研究者たちは、 AIBOロボットに基本的なサッカーのスキルを教えるために、このようなアプローチを使用しました。[ 2 ]
逆強化学習(IRL)は、観察された行動から報酬関数を導出するプロセスです。通常の「強化学習」では、報酬と罰を用いて行動を学習しますが、IRLでは方向が逆で、ロボットが人の行動を観察して、その行動が達成しようとしている目標を把握します。[ 3 ] IRLの問題は次のように定義できます。[ 4 ]
1) さまざまな状況下でのエージェントの行動の経時的な測定値、2) そのエージェントへの感覚入力の測定値、3) 物理環境のモデル(エージェントの身体を含む)が与えられた場合、エージェントが最適化している報酬関数を決定します。
IRL 研究者のStuart J. Russell氏は、IRL は人間を観察し、その複雑な「倫理的価値観」を体系化するために使用できる可能性があると提案しています。これは、明示的に指示されなくても「猫を料理してはいけない」といつか理解できる「倫理的なロボット」を作成するための取り組みです。 [ 5 ]このシナリオは、「協調型逆強化学習ゲーム」としてモデル化できます。このゲームでは、「人間」プレイヤーと「ロボット」プレイヤーが協力して、人間とロボットのどちらにも明示的に知られていない人間の暗黙の目標を確保します。[ 6 ] [ 7 ]
2017年、OpenAIとDeepMindは、アタリゲームやバックフリップなどの単純なロボットタスクといった単純な領域で、協調型逆強化学習に深層学習を適用した。人間の役割は、2つの異なる動作のうちどちらが好ましいかをロボットから尋ねられた際に答えることに限られていた。研究者らは、この技術が現代のシステムに経済的に拡張可能であるという証拠を発見した。[ 8 ] [ 9 ]
逆強化学習による徒弟制度(AIRP) は、2004 年にバークレーのEE CS学科の教授であるPieter Abbeel 氏とスタンフォード大学のコンピュータサイエンス学科の准教授であるAndrew Ng氏によって開発されました。AIRP は、「報酬関数が明示的に与えられていないが、代わりに学習したいタスクを実行する専門家のデモンストレーションを観察できるマルコフ決定プロセスを扱います」 [ 1 ] 。AIRPは、直感的に明らかな報酬関数がない非常に動的なシナリオの報酬関数をモデル化するために使用されてきました。たとえば、運転のタスクを考えてみましょう。安全な車間距離の維持、適切な速度、車線変更の頻度の低さなど、さまざまな目的が同時に機能します。このタスクは一見簡単そうに見えますが、単純な報酬関数では、望ましいポリシーに収束しない可能性があります。
AIRPが広く利用されている分野の1つはヘリコプターの制御です。単純な軌道は直感的に導き出すことができますが、ショー用の曲技飛行のような複雑なタスクも成功しています。これには、その場での宙返り、その場でのロール、ループ、ハリケーン、さらにはオートローテーション着陸などの曲技飛行が含まれます。この研究は、Pieter Abbeel、Adam Coates、およびAndrew Ngによって開発されました - 「徒弟学習による自律型ヘリコプター曲技飛行」[ 10 ]
システムモデルは、世界のダイナミクスをモデル化することで専門家を模倣しようとします。[ 2 ]
システムは、各動作に事前条件と事後条件を関連付けるルールを学習します。1994年のデモンストレーションでは、ヒューマノイドが反復的なボール収集タスクの2回のデモンストレーションから汎用的な計画を学習しました。[ 2 ]
実演による学習は、動作するロボット制御システムが利用可能で、人間の実演者がそれを使用しているという観点から説明されることが多い。そして実際、ソフトウェアが機能していれば、人間のオペレーターがロボットアームを取り、それを使って動作を行い、ロボットは後でその動作を再現する。たとえば、彼はロボットアームにコーヒーメーカーの下にカップを置いてスタートボタンを押す方法を教えます。再生フェーズでは、ロボットはこの動作を1対1で模倣しますが、これはシステムが内部でどのように動作するかではなく、観客が観察できるものに過ぎません。実際には、実演による学習ははるかに複雑です。ロボット見習いによる学習(模倣によって学習する人型ロボット)に関する最初の研究の1つは、1995年のエイドリアン・ストイカの博士論文です。[ 11 ]
1997年、ロボット工学の専門家であるステファン・シャールは、 Sarcosロボットアームの開発に取り組んでいました。目標は単純で、振り子のタスクを解決することでした。ロボット自体は動作を実行でき、その結果として振り子が動きます。問題は、どのような動作がどのような動きにつながるかが明確ではないことです。これは最適制御の問題です。数学的な公式で記述できるが、解決が難しい問題。シャールのアイデアは、総当たり解法ではなく、人間のデモンストレーションの動きを記録することだった。振り子の角度は、y軸上に3秒間記録される。その結果、パターンを示す図が得られる。[ 12 ]
コンピュータアニメーションでは、この原理はスプラインアニメーションと呼ばれます。[ 13 ]つまり、x軸には時間(例えば0.5秒、1.0秒、1.5秒)が与えられ、y軸には変数が与えられます。ほとんどの場合、それはオブジェクトの位置です。倒立振子の場合は、角度です。
全体のタスクは、時間の経過に伴う角度の記録と、記録された動きの再現という 2 つの部分から構成されます。再現のステップは驚くほど単純です。入力として、振り子がどの時間ステップでどの角度を持つべきかがわかっています。システムをある状態にすることは、「トラッキング制御」またはPID 制御と呼ばれます。つまり、時間の経過に伴う軌跡があり、システムをこの軌跡にマッピングするための制御アクションを見つける必要があります。他の著者は、ロボットを特定の線に導くことが目的であるため、この原理を「操舵動作」[ 14 ]と呼んでいます。
{{cite book}}: CS1 maint: 複数の名前: 著者リスト (リンク)