動的システムの状態を変化させる最良の方法に関する最適制御理論の原理
ポンチャギンの最大原理は、 最適制御 理論において、 特に状態または入力制御に制約がある場合に、 動的システムを ある状態から別の状態に移行させるための最善の制御を見つけるために使用されます。これは、 最適状態軌道に沿った任意の最適制御には、いわゆるハミルトン系(2点 境界値問題)と 制御ハミルトン の最大条件を解くことが 必要であると 述べています。 [a] これらの必要条件は、 目的関数と制約関数の特定の 凸条件の下で十分になります。 [1] [2]
最大原理は1956年にロシアの数学者 レフ・ポンチャギン とその弟子たちによって定式化され、 [3] [4] 、その最初の応用はロケットの終端速度の最大化であった。 [5]この結果は、古典的な 変分法の アイデアを使って導き出された 。 [6] 最適制御をわずかに 摂動させた後、摂動に関する テイラー 展開の1次項を考慮する 。摂動をゼロにすると変分不等式が得られ、そこから最大原理が導かれる。 [7]
最大原理は最適制御理論における画期的な成果として広く認められており、その意義はハミルトニアンの最大化が元の無限次元制御問題よりもはるかに容易であるという事実にある。関数 空間 上で最大化するのではなく、問題が 点ごとの 最適化に変換される。 [8] 同様の論理から 、最適軌道が中間時点でも最適のままであるという最適制御問題への関連アプローチである ベルマンの最適性原理が生まれる。 [9] 結果として得られる ハミルトン・ヤコビ・ベルマン方程式は 最適値を得るための必要十分条件を提供し、確率的最適制御問題への 直接的な拡張 を可能にするが、最大原理ではそれができない。 [7] しかし、有効となるには状態空間全体で成り立つ必要があるハミルトン・ヤコビ・ベルマン方程式とは対照的に、ポンチャギンの最大原理は、それが指定する条件が特定の軌道上でのみ成り立つ必要があるという点で、潜在的に計算効率が高い。
表記
セット と関数
の場合
あなた
{\displaystyle {\mathcal {U}}}
Ψ
:
R
ん
→
R
{\displaystyle \Psi :\mathbb {R} ^{n}\to \mathbb {R} }
、
H
:
R
ん
×
あなた
×
R
ん
×
R
→
R
{\displaystyle H:\mathbb {R} ^{n}\times {\mathcal {U}}\times \mathbb {R} ^{n}\times \mathbb {R} \to \mathbb {R} }
、
ら
:
R
ん
×
あなた
→
R
{\displaystyle L:\mathbb {R} ^{n}\times {\mathcal {U}}\to \mathbb {R} }
、
f
:
R
n
×
U
→
R
n
{\displaystyle f:\mathbb {R} ^{n}\times {\mathcal {U}}\to \mathbb {R} ^{n}}
、
次の表記法を使用します。
Ψ
T
(
x
(
T
)
)
=
∂
Ψ
(
x
)
∂
T
|
x
=
x
(
T
)
{\displaystyle \Psi _{T}(x(T))=\left.{\frac {\partial \Psi (x)}{\partial T}}\right|_{x=x(T)}\,}
、
Ψ
x
(
x
(
T
)
)
=
[
∂
Ψ
(
x
)
∂
x
1
|
x
=
x
(
T
)
⋯
∂
Ψ
(
x
)
∂
x
n
|
x
=
x
(
T
)
]
{\displaystyle \Psi _{x}(x(T))={\begin{bmatrix}\left.{\frac {\partial \Psi (x)}{\partial x_{1}}}\right|_{x=x(T)}&\cdots &\left.{\frac {\partial \Psi (x)}{\partial x_{n}}}\right|_{x=x(T)}\end{bmatrix}}}
、
H
x
(
x
∗
,
u
∗
,
λ
∗
,
t
)
=
[
∂
H
∂
x
1
|
x
=
x
∗
,
u
=
u
∗
,
λ
=
λ
∗
⋯
∂
H
∂
x
n
|
x
=
x
∗
,
u
=
u
∗
,
λ
=
λ
∗
]
{\displaystyle H_{x}(x^{*},u^{*},\lambda ^{*},t)={\begin{bmatrix}\left.{\frac {\partial H}{\partial x_{1}}}\right|_{x=x^{*},u=u^{*},\lambda =\lambda ^{*}}&\cdots &\left.{\frac {\partial H}{\partial x_{n}}}\right|_{x=x^{*},u=u^{*},\lambda =\lambda ^{*}}\end{bmatrix}}}
、
L
x
(
x
∗
,
u
∗
)
=
[
∂
L
∂
x
1
|
x
=
x
∗
,
u
=
u
∗
⋯
∂
L
∂
x
n
|
x
=
x
∗
,
u
=
u
∗
]
{\displaystyle L_{x}(x^{*},u^{*})={\begin{bmatrix}\left.{\frac {\partial L}{\partial x_{1}}}\right|_{x=x^{*},u=u^{*}}&\cdots &\left.{\frac {\partial L}{\partial x_{n}}}\right|_{x=x^{*},u=u^{*}}\end{bmatrix}}}
、
f
x
(
x
∗
,
u
∗
)
=
[
∂
f
1
∂
x
1
|
x
=
x
∗
,
u
=
u
∗
⋯
∂
f
1
∂
x
n
|
x
=
x
∗
,
u
=
u
∗
⋮
⋱
⋮
∂
f
n
∂
x
1
|
x
=
x
∗
,
u
=
u
∗
…
∂
f
n
∂
x
n
|
x
=
x
∗
,
u
=
u
∗
]
{\displaystyle f_{x}(x^{*},u^{*})={\begin{bmatrix}\left.{\frac {\partial f_{1}}{\partial x_{1}}}\right|_{x=x^{*},u=u^{*}}&\cdots &\left.{\frac {\partial f_{1}}{\partial x_{n}}}\right|_{x=x^{*},u=u^{*}}\\\vdots &\ddots &\vdots \\\left.{\frac {\partial f_{n}}{\partial x_{1}}}\right|_{x=x^{*},u=u^{*}}&\ldots &\left.{\frac {\partial f_{n}}{\partial x_{n}}}\right|_{x=x^{*},u=u^{*}}\end{bmatrix}}}
。
ここでは関数の最小化に必要な条件を示します。
状態変数 、制御変数を持つ n 次元の 動的システム を考えます。ここで、 は 許容される制御のセットです。システムの進化は、微分方程式 に従って、状態と制御によって決定されます 。システムの初期状態を とし 、システムの進化が値 で期間にわたって制御されるとします 。後者は次の微分方程式によって決定されます。
x
∈
R
n
{\displaystyle x\in \mathbb {R} ^{n}}
u
∈
U
{\displaystyle u\in {\mathcal {U}}}
U
{\displaystyle {\mathcal {U}}}
x
˙
=
f
(
x
,
u
)
{\displaystyle {\dot {x}}=f(x,u)}
x
0
{\displaystyle x_{0}}
t
∈
[
0
,
T
]
{\displaystyle t\in [0,T]}
x
˙
=
f
(
x
,
u
)
,
x
(
0
)
=
x
0
,
u
(
t
)
∈
U
,
t
∈
[
0
,
T
]
{\displaystyle {\dot {x}}=f(x,u),\quad x(0)=x_{0},\quad u(t)\in {\mathcal {U}},\quad t\in [0,T]}
制御軌道 は目的に応じて選択される。目的は、 次のように定義される
関数である。
u
:
[
0
,
T
]
→
U
{\displaystyle u:[0,T]\to {\mathcal {U}}}
J
{\displaystyle J}
J
=
Ψ
(
x
(
T
)
)
+
∫
0
T
L
(
x
(
t
)
,
u
(
t
)
)
d
t
{\displaystyle J=\Psi (x(T))+\int _{0}^{T}L{\big (}x(t),u(t){\big )}\,dt}
、
ここで、 は 状態 で 制御を及ぼすためのコスト 率 として解釈でき 、 は 状態 に到達するためのコストとして解釈できます 。 の具体的な選択は アプリケーションによって異なります。
L
(
x
,
u
)
{\displaystyle L(x,u)}
u
{\displaystyle u}
x
{\displaystyle x}
Ψ
(
x
)
{\displaystyle \Psi (x)}
x
{\displaystyle x}
L
,
Ψ
{\displaystyle L,\Psi }
システムダイナミクスの制約は、 時間変動 ラグランジュ乗数 ベクトル を導入することで ラグランジアン に加えることができます。このベクトルの要素はシステムの コステート と呼ばれます。これにより、すべてに対して次のように定義される ハミルトニアン が構築されます 。
L
{\displaystyle L}
λ
{\displaystyle \lambda }
H
{\displaystyle H}
t
∈
[
0
,
T
]
{\displaystyle t\in [0,T]}
H
(
x
(
t
)
,
u
(
t
)
,
λ
(
t
)
,
t
)
=
λ
T
(
t
)
⋅
f
(
x
(
t
)
,
u
(
t
)
)
+
L
(
x
(
t
)
,
u
(
t
)
)
{\displaystyle H{\big (}x(t),u(t),\lambda (t),t{\big )}=\lambda ^{\rm {T}}(t)\cdot f{\big (}x(t),u(t){\big )}+L{\big (}x(t),u(t){\big )}}
ここで は の転置です 。
λ
T
{\displaystyle \lambda ^{\rm {T}}}
λ
{\displaystyle \lambda }
ポンチャギンの最小原理は、最適状態軌道 、最適制御 、および対応するラグランジュ乗数ベクトルが ハミルトニアンを最小化する必要がある こと
を述べています。
x
∗
{\displaystyle x^{*}}
u
∗
{\displaystyle u^{*}}
λ
∗
{\displaystyle \lambda ^{*}}
H
{\displaystyle H}
すべての時間 とすべての許容される制御入力に対して 。ここで、ラグランジュ乗数ベクトルの軌跡は、 共状態方程式 とその終端条件
の解です。
t
∈
[
0
,
T
]
{\displaystyle t\in [0,T]}
u
∈
U
{\displaystyle u\in {\mathcal {U}}}
λ
{\displaystyle \lambda }
が固定されている場合 、(1)-(3)の3つの条件は最適制御に必要な条件です。
x
(
T
)
{\displaystyle x(T)}
最終状態 が固定されていない場合(つまり、その差分変化がゼロでない場合)、追加の条件が存在する。
x
(
T
)
{\displaystyle x(T)}
(1)~(4)の4つの条件は最適制御に必要な条件である。
参照
注記
^ 極値が最大か最小かは、ハミルトニアンの定義に使用される符号規則によって決まります。歴史的規則では最大値が導かれ、したがって 最大原理となります。 近年では、最大や最小という形容詞を使わずに、単にポンチャギンの原理と呼ばれることが多くなっています。
参考文献
^ Mangasarian, OL (1966). 「非線形システムの最適制御のための十分条件」 SIAM Journal on Control . 4 (1): 139–152. doi :10.1137/0304013.
^ Kamien, Morton I. ; Schwartz, Nancy L. (1971). 「最適制御理論における十分条件」. Journal of Economic Theory . 3 (2): 207–214. doi :10.1016/0022-0531(71)90018-4.
^ Boltyanski, V.; Martini, H.; Soltan, V. (1998). 「最大原理 - それはどのようにして生まれたのか?」. 幾何学的手法と最適化問題 . ニューヨーク: Springer. pp. 204–227. ISBN 0-7923-5454-0 。
^ Gamkrelidze, RV (1999). 「最大原理の発見」. 動的制御システムジャーナル . 5 (4): 437–451. doi :10.1023/A:1021783020548. S2CID 122690986. Bolibruch, AA ; et al., eds. (2006). Mathematical Events of the Twentieth Century . Berlin: Springer. pp. 85–99. ISBN に 再録 3-540-23235-4 。
^ 初版については、 Fuller, AT (1963). "Bibliography of Pontryagin's Maximum Principle". J. Electronics & Control . 15 (5): 513–517. doi :10.1080/00207216308937602 の参考文献を参照してください。
^ McShane, EJ (1989). 「変分法の初歩から最適制御理論まで」 SIAM J. Control Optim . 27 (5): 916–939. doi :10.1137/0327049.
^ ab Yong, J.; Zhou, XY (1999). 「最大原理と確率的ハミルトンシステム」. 確率的制御: ハミルトンシステムと HJB 方程式 . ニューヨーク: Springer. pp. 101–156. ISBN 0-387-98723-1 。
^ Sastry, Shankar (2009 年 3 月 29 日). 「講義ノート 8. 最適制御と動的ゲーム」 (PDF) 。
^ Zhou, XY (1990). 「 最大原理、動的計画法、および決定論的制御におけるそれらの関係」。 最適化理論と応用ジャーナル 。65 (2): 363–373。doi :10.1007/BF01102352。S2CID 122333807 。
さらに読む
Geering, HP (2007)。 最適制御とエンジニアリングアプリケーション 。Springer。ISBN 978-3-540-69437-3 。
カーク、DE (1970)。 最適制御理論入門 。プレンティスホール 。ISBN 0-486-43484-2 。
Lee, EB; Markus, L. (1967). 最適制御理論の基礎 . ニューヨーク: Wiley.
Seierstad, Atle; Sydsæter, Knut (1987)。 最適制御理論と経済的応用 。アムステルダム:北ホラント 。ISBN 0-444-87923-4 。
外部リンク