オペラント条件づけ(道具的条件づけとも呼ばれる)とは、報酬または嫌悪刺激の追加(または除去)との関連付けによって自発的な行動が変化する学習過程である。行動の頻度や持続時間は、強化によって増加し、罰や消去によって減少する。
オペラント条件づけはエドワード・ソーンダイクに端を発し、彼の効果の法則は、行動は満足感や不快感といった結果の結果として生じるという理論を提唱した。20世紀には、オペラント条件づけは行動心理学者によって研究され、彼らは心と行動の多くは環境条件づけによって説明できると考えた。強化とは行動を増加させる環境刺激であり、罰とは行動を減少させる刺激である。どちらの種類の刺激も、環境刺激の追加または除去を伴う正の刺激と負の刺激にさらに分類できる。
オペラント条件づけは、そのメカニズムと結果の両面において、古典的条件づけとは異なります。古典的条件づけは刺激を対にして、不随意的な反射行動(例えば、食べ物を見ると唾液が出るなど)を引き起こしますが、オペラント条件づけは、行動の結果を通して随意的な行動を形成します。報酬が伴う行動は繰り返される傾向があり、負の結果が伴う行動は減少します。
20世紀の動物学習の研究は、これら2種類の学習の分析が中心であり、[ 1 ]これらは現在も行動分析の中核をなしている。また、これらは社会心理学の研究にも応用され、偽の合意効果などの特定の現象を解明するのに役立っている。[ 2 ]

オペラント条件づけ(道具的学習とも呼ばれる)は、エドワード・L・ソーンダイク(1874~1949)によって初めて大規模に研究されました。彼は、自作のパズルボックスから脱出しようとする猫の行動を観察しました。[ 3 ]猫は紐を引いたり棒を押したりといった簡単な反応で箱から脱出できましたが、最初に閉じ込められたときは、脱出するのに時間がかかりました。試行を繰り返すと、効果のない反応は減り、成功する反応は増えたため、猫はますます早く脱出できるようになりました。[ 3 ]ソーンダイクはこの発見を効果の法則に一般化しました。効果の法則とは、満足のいく結果を伴う行動は繰り返される傾向があり、不快な結果をもたらす行動は繰り返される可能性が低いというものです。つまり、結果によっては行動が強化され、結果によっては行動が弱まるということです。ソーンダイクは、脱出時間と試行回数をプロットすることで、この手順を通して動物の学習曲線を初めて作成しました。[ 4 ]
人間は、ソーンダイクが研究したようなプロセス(現在ではオペラント条件づけと呼ばれている)を通して、多くの単純な行動を学習するようです。つまり、反応は、成功につながる場合は保持され、そうでない場合や嫌悪効果が生じる場合は破棄されます。これは通常、「教師」によって計画されることなく起こりますが、オペラント条件づけは何千年もの間、親が子供を教える際に使用されてきました。[ 5 ]

BF スキナー(1904–1990) はオペラント条件付けの父と呼ばれ、彼の研究はこのテーマに関連して頻繁に引用される。1938 年に出版された著書『生物の行動:実験的分析』[ 6 ]は、オペラント条件付けとその人間や動物の行動への応用に関する彼の生涯にわたる研究の始まりとなった。エルンスト・マッハの考えに倣い、スキナーはソーンダイクが言及した満足感などの観察不可能な精神状態を否定し、観察可能な行動とその同様に観察可能な結果に基づいて分析を構築した。[ 7 ]
スキナーは、古典的条件づけは人間の行動のような複雑なものを説明するには単純すぎると考えていた。彼の見解では、オペラント条件づけは意図的な行動の原因と結果を考察するため、人間の行動をより適切に説明できる。
To implement his empirical approach, Skinner invented the operant conditioning chamber, or "Skinner Box", in which subjects such as pigeons and rats were isolated and could be exposed to carefully controlled stimuli. Unlike Thorndike's puzzle box, this arrangement allowed the subject to make one or two simple, repeatable responses, and the rate of such responses became Skinner's primary behavioral measure.[8] Another invention, the cumulative recorder, produced a graphical record from which these response rates could be estimated. These records were the primary data that Skinner and his colleagues used to explore the effects on response rate of various reinforcement schedules.[9] A reinforcement schedule may be defined as "any procedure that delivers reinforcement to an organism according to some well-defined rule".[10] The effects of schedules became, in turn, the basic findings from which Skinner developed his account of operant conditioning. He also drew on many less formal observations of human and animal behavior.[11]
Many of Skinner's writings are devoted to the application of operant conditioning to human behavior.[12] In 1948 he published Walden Two, a fictional account of a peaceful, happy, productive community organized around his conditioning principles.[13] In 1957, Skinner published Verbal Behavior,[14] which extended the principles of operant conditioning to language, a form of human behavior that had previously been analyzed quite differently by linguists and others. Skinner defined new functional relationships such as "mands" and "tacts" to capture some essentials of language, but he introduced no new principles, treating verbal behavior like any other behavior controlled by its consequences, which included the reactions of the speaker's audience.
オペラント行動は「発せられる」と言われます。つまり、最初は特定の刺激によって引き起こされるわけではありません。では、そもそもなぜオペラント行動が起こるのでしょうか。この問いへの答えは、ダーウィンが「新しい」身体構造の起源について答えたのと同様に、変異と選択です。同様に、個体の行動は、具体的な動作、加える力の量、反応のタイミングなど、刻々と変化します。強化につながる変化は強化され、強化が一貫していれば、行動は安定する傾向があります。しかし、行動の変動性自体も、特定の変数を操作することによって変化させることができます。[ 15 ]
強化と罰は、オペラント行動を修正するための主要な手段です。これらの用語は、行動への影響によって定義されます。「正」と「負」は、それぞれ刺激が加えられたか取り除かれたかを示します。同様に、「強化」と「罰」は、行動の将来の頻度を示します。強化は、将来行動がより頻繁に起こるようにする結果を表し、罰は、行動がより少なく起こるようにする結果を表します。[ 16 ]
結果は全部で4つあります。
ある研究では、モバイルデバイスからの触覚振動などの触覚フィードバックが二次強化因子(つまり、関連付けによって強化価値を獲得する学習報酬)として機能し、オンライン購入などの消費者の行動を強化する可能性があることが示唆されている。[ 19 ]
強化スケジュールは、強化の提供を制御するルールです。ルールは、強化が利用可能になる時間、または行われる反応の数、またはその両方を指定します。多くのルールが可能ですが、以下は最も基本的で一般的に使用されているものです[ 20 ] [ 9 ]
強化と罰の効果は変化する可能性がある。
これらの要因のほとんどは生物学的機能に関わっています。例えば、満腹感のプロセスは、生物が安定した内部環境(恒常性)を維持するのに役立ちます。例えば、生物が糖分を摂取していない場合、砂糖の味は効果的な強化因子となります。生物の血糖値が最適値に達するかそれを超えると、砂糖の味は効果が薄れ、場合によっては嫌悪感さえ覚えるようになります。
シェーピングは、動物の訓練や非言語的な人間の教育によく用いられる条件付け方法です。これは、前述のように、オペラント条件付けの変動性と強化に基づいています。トレーナーはまず、望ましい最終行動(または「ターゲット」行動)を特定します。次に、動物または人がすでに一定の確率で示す行動を選択します。そして、ターゲット行動にますます近づく行動を強化することで、この行動の形式を連続する試行の中で徐々に変化させていきます。最終的にターゲット行動が示されるようになったら、強化スケジュールを用いてその行動を強化し、維持することができます。
非随伴性強化とは、生物の行動に関係なく強化刺激を与えることである。非随伴性強化は、標的反応を消去しながら複数の代替反応を強化することによって、望ましくない標的行動を減らす試みに用いられることがある。[ 23 ]測定された行動が強化されたと特定されないため、非随伴性「強化」という用語の使用をめぐっては議論がある。[ 24 ]
オペラント行動は最初は特定の刺激との関連が特定されないまま発現しますが、オペラント条件付けの過程で、行動が強化される際に存在する刺激によって制御されるようになります。このような刺激は「弁別刺激」と呼ばれます。その結果、いわゆる「三項随伴性」が生まれます。つまり、弁別刺激は報酬または罰を生み出す反応のきっかけとなるのです。例:ネズミはライトが点灯した時だけレバーを押すように訓練できます。犬は餌袋のガラガラという音を聞くと台所へ駆けつけます。子供はテーブルの上にキャンディーがあると手を伸ばします。
ほとんどの行動は刺激によって制御される。これにはいくつかの側面がある。
ほとんどの行動は、個々の反応が一つずつ強化されるという単純な説明では容易には捉えられません。オペラント分析の範囲は、行動連鎖という概念によって拡張されます。行動連鎖とは、上述の3項随伴性によって結び付けられた一連の反応のことです。連鎖は、弁別刺激が後続の行動のきっかけとなるだけでなく、先行する行動を強化することもできるという事実に基づいています。つまり、弁別刺激は「条件付けられた強化子」でもあるのです。例えば、レバーを押すきっかけとなる光は、騒音がある状況下で「振り返る」行動を強化するために使用できます。その結果、「騒音→振り返る→光→レバーを押す→餌」という一連の行動が生まれます。刺激と反応をさらに追加することで、より長い連鎖を構築することも可能です。
回避学習では、行動によって(嫌悪)刺激が終結します。例えば、日光から目を覆うことで、目に強い光が当たるという(嫌悪)刺激が終結します。(これは、前述の負の強化の一例です。)刺激を防ぐことで維持される行動は「回避」と呼ばれ、例えば、外出前にサングラスをかけることが挙げられます。回避行動は、いわゆる「回避のパラドックス」を引き起こします。なぜなら、刺激が発生しないことが、どのように強化因子として機能するのかという疑問が生じるからです。この疑問は、いくつかの回避理論によって説明されています(下記参照)。
実験設定としては、弁別学習と自由操作回避学習の2種類が一般的に用いられる。
弁別回避実験では、光などの中性刺激の後に電気ショックなどの嫌悪刺激が続く一連の試行が行われます。中性刺激が現れた後、レバーを押すなどのオペラント反応によって嫌悪刺激が阻止または終了されます。初期の試行では、被験者は嫌悪刺激が現れるまで反応しないため、これらの初期の試行は「逃避」試行と呼ばれます。学習が進むにつれて、被験者は中性刺激中に反応するようになり、嫌悪刺激の発生を阻止します。このような試行は「回避試行」と呼ばれます。この実験は、中性条件刺激(CS)と嫌悪無条件刺激(US)が対提示されるため、古典的条件付けを伴うと言われています。この考え方は、後述する回避学習の二要因理論の基礎となっています。
自由操作回避では、被験者はオペラント反応を行わない限り、定期的に嫌悪刺激(多くの場合、電気ショック)を受けます。反応によってショックの開始が遅れます。この状況では、弁別回避とは異なり、ショックを知らせる事前の刺激はありません。回避学習の速度を決定する2つの重要な時間間隔があります。1つ目はSS(ショック-ショック)間隔です。これは、反応がない場合の連続するショック間の時間です。2つ目はRS(反応-ショック)間隔です。これは、オペラント反応によって次のショックの開始が遅れる時間を示します。被験者がオペラント反応を行うたびに、ショックのないRS間隔が新たに始まります。
この理論はもともと、生物が嫌悪刺激の信号から逃れることでその刺激を避けることを学習する、弁別回避学習を説明するために提唱された。そこには2つのプロセスが関わっている。まず信号の古典的条件付けが行われ、次に逃避反応のオペラント条件付けが行われる。
a)恐怖の古典的条件づけ。まず、生物は条件刺激(CS)と嫌悪的な無条件刺激(US)の対提示を経験します。この理論では、この対提示によって古典的条件づけを通してCSとUSの間に連合が形成され、USの嫌悪的な性質のために、CSは条件づけられた情動反応(CER)である「恐怖」を引き起こすと想定しています。 b)恐怖の軽減によるオペラント反応の強化。最初のプロセスの結果、CSは恐怖を知らせる信号となります。この不快な情動反応はオペラント反応を動機づけ、CSを終了させる反応は恐怖の終了によって強化されます。この理論は、生物がUSを予測するという意味でUSを「回避」するとは言っていません。むしろ、生物はCSによって引き起こされる嫌悪的な内部状態から「逃れる」と述べています。いくつかの実験結果は、二要因理論に反しているように見えます。例えば、最初のCS-USペアリングが二度と起こらなくても、回避行動は非常にゆっくりと消えることが多いので、恐怖反応は消えると予想される(古典的条件付けを参照)。さらに、回避を学習した動物は恐怖の兆候をほとんど示さないことが多く、恐怖からの逃避は回避行動を維持するために必要ではないことを示唆している。[ 25 ]
回避行動は、結果によって維持されるオペラント行動の特殊なケースにすぎないという理論家もいる。この見方では、「結果」という概念は、一連の出来事に対する感受性を含むように拡張される。つまり、回避行動では、反応の結果は嫌悪刺激の頻度の減少である。実際、実験的証拠は、「見逃されたショック」が刺激として検出され、強化子として作用することを示唆している。回避の認知理論はこの考えをさらに一歩進めている。例えば、ラットはレバーを押さなかった場合にショックを「期待」し、レバーを押した場合は「ショックを受けない」と期待するようになり、これらの期待が確認されると回避行動が強化される。[ 25 ]
オペラント貯蔵とは、特定の方法で強化されたラットが、餌のペレットを取り出す代わりに、餌のペレットを餌皿に蓄積させるという観察結果を指します。この手順では、ペレットを取り出すと必ず1分間の消去期間が設けられ、その間は追加の餌のペレットは入手できませんが、以前に蓄積されたペレットは食べることができました。この発見は、ラットがすぐに小さな餌と、少し遅れて大きな餌のどちらかを選択できる状況では衝動的に行動するという通常の発見と矛盾しているように見えます。強化スケジュールを参照してください。[ 26 ]
条件刺激を符号化することを示唆するような反応を示すニューロンを特定した最初の科学的研究は、 Mahlon deLong [ 27 ] [ 28 ]と RT Richardson [ 28 ]の研究によるものでした。彼らは、大脳皮質全体に広くアセチルコリンを放出する基底核ニューロンが、条件刺激の直後、または条件刺激が存在しない場合は一次報酬の直後に活性化されることを示しました。これらのニューロンは、正の強化因子と負の強化因子に対して同様に活性化し、多くの皮質領域の神経可塑性に関連していることが示されています。 [ 29 ]ドーパミンも同様のタイミングで活性化されるという証拠も存在します。 [ 30 ]ドーパミンが強化学習と嫌悪学習の両方に関与しているという証拠はかなりあります。[ 31 ]ドーパミン経路は、前頭皮質領域に非常に密に投射しています。対照的に、コリン作動性投射は、一次視覚野のような後部皮質領域でも密です。ドーパミンの作用が不十分なことが原因とされるパーキンソン病患者を対象とした研究では、正の強化におけるドーパミンの役割がさらに明らかになった。[ 32 ]この研究では、服薬していない患者は、正の強化よりも嫌悪的な結果の方が学習しやすいことが示された。服薬中の患者ではその逆で、ドーパミン活性が高い場合は正の強化の方が学習に効果的であることが示された。
ドーパミンが関与する神経化学的プロセスが強化の根底にあると考えられている。生物が強化刺激を受けると、脳内のドーパミン経路が活性化される。この経路のネットワークは「多くの樹状突起にドーパミンの短いパルスを放出し、シナプス後ニューロンに全体的な強化シグナルを伝達する」[ 33 ] 。これにより、最近活性化されたシナプスは遠心性(外向きに伝導する)シグナルに対する感受性を高め、強化に先行する最近の反応の発生確率を高めることができる。これらの反応は、統計的に、強化を成功裏に達成した行動である可能性が最も高い。しかし、強化の適用が即時的でない、または条件付き性が低い(一貫性が低い)場合、ドーパミンが適切なシナプスに作用する能力は低下する。
オペラント行動は、上記で定義した意味での強化なしに確立できることが、いくつかの観察から明らかになっている。最もよく引用されるのは、オートシェイピング (「サイントラッキング」と呼ばれることもある)という現象で、刺激の後に繰り返し強化が行われ、その結果、動物が刺激に反応し始める。たとえば、反応キーが点灯し、次に餌が提示される。これを数回繰り返すと、ハトは、餌が与えられるかどうかにかかわらず、キーをつつくようになる。同様に、ラットは、近くに餌が提示されると、レバーなどの小さな物体を扱うようになる。[ 34 ] [ 35 ]驚くべきことに、ハトとラットは、キーをつついたりレバーを押したりすると餌が少なくなる(省略訓練)場合でも、この行動を続ける。[ 36 ] [ 37 ]強化なしに現れるもう1つの明らかなオペラント行動は、コントラフリーローディングである。
これらの観察結果などは効果の法則と矛盾するように見え、一部の研究者はオペラント強化の新しい概念化を提案するに至った(例:[ 38 ] [ 39 ] [ 40 ])。より一般的な見解としては、オートシェイピングは古典的条件付けの一例であり、実際、オートシェイピング手続きは古典的条件付けを測定する最も一般的な方法の1つとなっている。この見解では、多くの行動は古典的随伴性(刺激-反応)とオペラント随伴性(反応-強化)の両方の影響を受ける可能性があり、実験者の課題はこれらがどのように相互作用するかを解明することである。[ 41 ]
強化と罰は人間の社会的な相互作用において遍在しており、オペラント条件付けの原理の応用例が数多く提案され、実施されてきた。
オペラント条件づけは、神経生物学と心理学の分野を結びつける概念です。これは、外的な行動原理が内的なプロセスとどのように対応しているかを示すことによって可能になります。心理学者は学習を、結果によって形作られる観察可能な行動という観点から説明するのに対し、神経生物学者は異なる考え方を持っています。神経生物学者は、これらの行動がどのように神経回路によって支えられているかを分析するのです。
正の強化と負の強化の両方が脳の報酬系を活性化することが示されている。これは、側坐核などの特定の領域でのドーパミンの放出によって可能になる。[ 42 ]
ポイントシステム、行動チャート、トークンエコノミーといったツールは、オペラント条件付けに基づいた原理です。これらのシステムは条件付け強化子として機能し、つまり、具体的な報酬などの一次強化子と交換できることを意味します。
正の強化と負の強化は、中毒と薬物依存の発達と維持において中心的な役割を果たします。依存性薬物は本質的に報酬的であり、つまり、薬物使用の主要な正の強化因子として機能します。脳の報酬系は、薬物にインセンティブ顕著性(つまり、「欲しい」または「望ましい」)を割り当てます[ 43 ] [ 44 ] [ 45 ]。そのため、中毒が発達すると、薬物の剥奪は渇望につながります。さらに、薬物使用に関連する刺激 (例えば、注射器の視覚や使用場所 )は、薬物によって誘発される強い強化と関連付けられるようになります[ 43 ] [ 44 ] [ 45 ] 。これらの以前は中立的だった刺激は、いくつかの特性を獲得します。それらの出現は渇望を誘発する可能性があり、継続使用の条件付けられた正の強化因子になる可能性があります。[ 43 ] [ 44 ] [ 45 ]したがって、薬物中毒者がこれらの薬物の手がかりのいずれかに遭遇すると、関連する薬物への渇望が再び現れる可能性があります。たとえば、薬物対策機関は以前、薬物使用の危険性を示すために、薬物関連器具の画像を含むポスターを使用していました。しかし、ポスターに描かれた刺激を見たときに再発を引き起こすインセンティブ顕著性の影響により、そのようなポスターはもはや使用されていません。
薬物依存者においては、薬物離脱症状中に生じる身体的依存(例:震えや発汗)および/または精神的依存(例:快感消失、落ち着きのなさ、易怒性、不安)の症状を軽減または「逃れる」ために薬物を自己投与すると、負の強化が生じる。[ 43 ]
動物の訓練士やペットの飼い主は、これらの概念が命名され研究されるずっと前からオペラント条件付けの原理と実践を適用しており、動物の訓練は今でもオペラント制御の最も明確で説得力のある例の 1 つを提供しています。この記事で説明されている概念と手順のうち、最も顕著なもののいくつかは次のとおりです。(a) 一次強化子の入手可能性 (例: 犬用のおいしいおやつが入った袋)、(b) 二次強化子の使用 (例: 望ましい反応の直後にクリッカーを鳴らし、おいしいおやつを与える)、(c) 随伴性、強化子 (例: クリッカー) が望ましい行動の後に続き、他のものには続かないようにすること、(d) シェーピング、犬が徐々に高くジャンプするようにすること、(e) 間欠的強化、飽和することなく持続的な行動を誘発するために強化の頻度を徐々に減らすこと、(f) 連鎖、より小さな単位から複雑な行動を徐々に構築すること。[ 46 ]
応用行動分析(ABA)は、 BFスキナーによって創始された学問分野であり、条件付けの原理を社会的に重要な人間の行動の修正に応用するものです。条件付け理論の基本概念、すなわち条件刺激(S C)、弁別刺激(S d)、反応(R)、強化刺激(強化子の場合はS reinまたはS r、嫌悪刺激の場合はS save)を使用します。[ 25 ]
ABA(応用行動分析)の実践者は、これらの手法、そしてそれらの多くのバリエーションや発展形を、社会的に重要な様々な行動や問題に適用します。多くの場合、実践者はオペラント条件付けの技法を用いて、逸脱行動を建設的で社会的に受け入れられる行動に置き換えることを目指します。 ABAの手法は、自閉症児に対する早期集中行動介入[ 47 ] 、犯罪行動に影響を与える原理の研究、HIV予防[ 48 ] 、天然資源の保全[ 49 ] 、教育[ 50] 、老年学[ 51 ] 、健康と運動[ 52 ]、産業安全[ 53 ]、言語習得[ 54 ]、ポイ捨て[ 55 ]、医療処置[ 56] 、子育て[ 57 ] 、心理療法、シートベルトの使用[ 58 ] 、重度の精神障害[ 59 ]、スポーツ[ 60 ]、薬物乱用、恐怖症、小児の摂食障害、動物園の管理と動物の世話[ 61 ]など、さまざまなことに効果的に応用されてきました。これらの応用例のいくつかは、 以下に説明します。
適切な子どもの行動に対して肯定的な強化を与えることは、親の養育訓練の主要な焦点です。通常、親は、社会的報酬(褒め言葉、笑顔、抱擁など)と具体的な報酬(子どもと共同で作成したインセンティブシステムの一部として、シールやより大きな報酬へのポイントなど)を通じて適切な行動に報酬を与えることを学びます。[ 62 ]さらに、親は、最初の焦点として単純な行動を選択し、子どもがより大きな目標に到達するために達成する小さなステップごとに報酬を与えることを学びます(この概念は「逐次近似」と呼ばれます)。[ 62 ] [ 63 ]
心理学者と経済学者の両方が、オペラント条件付けの概念と研究結果を市場における人間の行動に適用することに関心を持つようになった。その一例として、購入される商品の量によって指標化される消費者需要の分析が挙げられる。経済学では、価格が消費に及ぼす影響の度合いを「需要の価格弾力性」と呼ぶ。特定の商品の弾力性は他の商品よりも高い。例えば、特定の食品の価格の変化は購入量に大きな影響を与える可能性があるが、ガソリンやその他の日用品は価格の変化による影響が少ない可能性がある。オペラント分析の観点から、このような影響は消費者の動機と強化子としての商品の相対的価値という観点から解釈できる。[ 64 ]
この記事で既に述べたように、変動比率スケジュールでは、予測不可能な数の反応の後に強化が与えられます。このスケジュールは通常、迅速かつ持続的な反応を生み出します。スロットマシンは変動比率スケジュールでペイオフを行い、ギャンブラーにまさにこのような持続的なレバー引き行動を引き起こします。スロットマシンやその他のギャンブル形態における変動比率ペイオフは、ギャンブル依存症の根本的な要因としてしばしば挙げられています。[ 65 ]
人間は殺生に対して生来の抵抗感を持っており、たとえ命を救うためであっても、同種の仲間に対して直接的かつ攻撃的な行動をとることをためらう。この殺生への抵抗感は、軍事戦争の歴史を通じて歩兵の効率性を著しく低下させてきた。[ 66 ]
この現象は、SLAマーシャル(准将で軍事史家)が第二次世界大戦の歩兵を戦闘直後にインタビュー調査するまで理解されていなかった。マーシャルのよく知られた物議を醸した著書『Men Against Fire; The Problem of Battle Command in Future Wars』では、戦闘で殺傷目的でライフルを発砲した兵士はわずか15%だったことが明らかになった。[ 67 ]
1946年にマーシャルの研究が米陸軍に受け入れられた後、米陸軍の人事研究室はオペラント条件付け法に似た新しい訓練プロトコルの実施を開始した。その後、このような方法を適用した結果、殺傷能力のある兵士の割合は朝鮮戦争で約50%、ベトナム戦争で90%以上に増加した。[ 66 ] 訓練の革命には、従来のポップアップ射撃場を、命中すると崩れる3次元の人型ポップアップ標的に置き換えることが含まれていた。これにより即座にフィードバックが得られ、兵士の行動に対する正の強化として機能した。[ 68 ]軍事訓練方法のその他の改善には、時間制限付き射撃コース、より現実的な訓練、高反復、上官からの賞賛、射撃の腕前に対する報酬、およびグループによる表彰が含まれる。負の強化には、仲間の責任やコースの再受講の要求が含まれる。
現代の軍事訓練は、主にパブロフの古典的条件付けとスキナーのオペラント条件付け(どちらも行動主義の一形態)を用いて、実際の戦闘を綿密にシミュレートすることで、戦闘圧力に対する中脳の反応を条件付ける。[ 66 ]
現代の射撃訓練は行動主義の優れた例であり、長年にわたり、ウェストポイントにある米国陸軍士官学校の全士官候補生に教えられる入門心理学コースで、オペラント条件付けの古典的な例として使用されてきました。1980年代にウェストポイントを訪れたBFスキナーは、現代の軍事射撃訓練がオペラント条件付けのほぼ完璧な応用であると指摘しました。[ 68 ]
デイブ・グロスマン中佐は、オペラント条件付けと米軍の訓練について次のように述べています。
誰も意図的にオペラント条件付けや行動修正技術を用いて兵士を訓練しようとしたわけではない可能性は十分にあるが…歴史家であり職業軍人でもある心理学者の立場からすると、まさにそれが達成されたことはますます明らかになってきている。[ 66 ]
ナッジ理論(またはナッジ)とは、行動科学、政治理論、経済学における概念であり、強制されない服従を促すための間接的な提案は、直接的な指示、法律、強制よりも効果的ではないにしても、少なくとも同等の効果で、集団や個人の動機、インセンティブ、意思決定に影響を与えることができると主張するものである。
行動強化の手段としての賞賛の概念は、BF スキナーのオペラント条件付けモデルに根ざしています。この観点から、賞賛は正の強化の手段として捉えられてきました。つまり、観察された行動を条件的に賞賛することによって、その行動が発生する可能性が高くなります。[ 69 ] 何百もの研究が、賞賛が肯定的な行動を促進するのに効果的であることを実証しており、特に教師や親が子供に賞賛を用いることで行動や学業成績の向上を促進するという研究[ 70 ] [ 71 ]だけでなく、仕事のパフォーマンスに関する研究[ 72 ]でも実証されています。賞賛はまた、代理強化によって、賞賛されていない周囲の人々(賞賛を受けた人のクラスメートなど)の肯定的な行動を強化することも実証されています。[ 73 ]賞賛は、その形式、内容、および伝達方法によって、行動を変えるのに効果的である場合もあれば、そうでない場合もあります。褒め言葉が肯定的な行動変化をもたらすためには、肯定的な行動に依存していること(つまり、目標とする行動が実行された後にのみ与えられること)、強化すべき行動の詳細を明確にすること、そして誠実かつ信頼できる形で伝えられることが不可欠である。[ 74 ]
褒め言葉が肯定的な強化戦略として効果的であることを認識して、数多くの行動療法や認知行動療法の介入では、プロトコルに褒め言葉の使用が組み込まれています。[ 75 ] [ 76 ]褒め言葉の戦略的な使用は、教室管理[ 75 ]と子育てトレーニング介入[ 71 ]の両方においてエビデンスに基づいた実践として認識されていますが、介入研究では、褒め言葉は戦略的な注意や行動報酬などの戦略を含む、より大きなカテゴリーの肯定的な強化に包含されることがよくあります。
認知行動療法とオペラント行動療法が様々な疾患に及ぼす影響について、数多くの研究が行われてきました。患者が行動、態度、感情を変える認知行動療法を習得すると、痛みの程度が軽減しました。これらの研究結果は、認知が痛みの知覚に影響を与えることを示しており、その結果は認知行動療法(CBT)とオペラント行動療法(OBT)の一般的な有効性を説明するものでした。
ほとんどのビデオゲームは強迫ループを中心に設計されており、変動レートスケジュールを通じて一種の正の強化を追加することで、プレイヤーがプレイし続けるようにしています。これはビデオゲーム中毒の病理につながる可能性があります。[ 77 ]
2010年代のビデオゲームの収益化のトレンドの一環として、一部のゲームでは報酬として、または現実のお金で購入できるアイテムとしてルートボックスが提供されました。ボックスには、ゲーム内アイテムのランダムな選択が含まれています。この方法は、変動レートスケジュールに従うため、スロットマシンやその他のギャンブル機器が報酬を分配する方法と同じ方法に関連付けられています。ルートボックスはギャンブルの一種であるという一般的な認識がありますが、この行為をギャンブルとして分類しているのはごく一部の国だけです。しかし、これらのアイテムをオンラインギャンブルの仮想通貨として使用したり、現実のお金と交換したりする方法により、スキンギャンブル市場が生まれ、法的評価を受けています。[ 78 ]
医療費が莫大な額になる理由として挙げられる多くの理由の一つに、防御医療の実践がある。プラブーはコールの記事をレビューし、2つの脳神経外科医グループの反応が典型的なオペラント行動であることを論じている。一方のグループは医療訴訟に制限のある州で診療を行い、もう一方のグループは制限のない州で診療を行っている。脳神経外科医グループは匿名で診療パターンについて質問された。医師たちは、医療訴訟に制限のない州で診療を行っているグループからの否定的なフィードバック(訴訟への恐怖)に応じて診療方法を変更した。[ 79 ]
オペラント条件付けにおける報酬は正の強化子である。
... オペラント行動は報酬の良い定義を与えている。個人がもっと求めてくるものはすべて正の強化子であり、したがって報酬である。良い定義を与えているとはいえ、正の強化は報酬機能の1つにすぎない。
... 報酬は魅力的である。報酬は動機付けとなり、努力を促す。
... 報酬は接近行動(食欲行動または準備行動とも呼ばれる)と消費行動を誘発する。
... したがって、接近して消費する可能性のある刺激、物体、出来事、活動、または状況は、定義上報酬である。
報酬物質への繰り返しの曝露が二次強化イベントの連鎖を引き起こし、それによって薬物使用に関連する手がかりや状況自体が強化となり、選択された物質の継続的な使用と乱用につながる可能性があるということです。...
依存
症プロセス(特に再発)に非常に関連のある強化の重要な側面は、二次強化です(Stewart、1992)。二次強化子(多くの場合、条件付け強化子とも考えられています)は、人間の強化プロセスの大部分を推進していると考えられます。薬物依存症の場合、薬物使用と密接かつ繰り返し関連付けられる手がかりや状況自体が強化因子となることが多い
。ロビンソンとベリッジの依存症のインセンティブ感作理論の基本的な部分は、一次強化因子自体に加えて、そのような二次強化プロセスのインセンティブ価値または魅力的な性質が、薬物依存症の発達と連携して、時間の経過とともに持続し、感作される可能性があると仮定している(ロビンソンとベリッジ、1993)。
負
の強化は、進行中の(おそらく嫌悪的な)刺激を終了させる行動反応の強化に関連する特別な状態である。この場合、負の強化因子を、そのような「逃避」反応を強化する動機付け刺激として定義することができる。歴史的に、薬物依存症に関連して、この現象は、離脱状態における動機付けニーズを満たすために乱用薬物が自己投与されるという点で、人間において一貫して観察されてきた(ウィクラー、1952)。
{{cite book}}:|journal=無視されました (ヘルプ)パブロフの条件付け条件 CS+ にインセンティブ顕著性が付与されると、その UCS に対する「欲求」が引き起こされるだけでなく、多くの場合、キュー自体が非常に魅力的になり、非合理的な程度にさえなります。このキューの魅力は、インセンティブ顕著性のもう 1 つの特徴です。 CSは、見ないわけにはいかなくなる(Wiers & Stacy, 2006; Hickey et al., 2010a; Piech et al., 2010; Anderson et al., 2011)。CSは、UCSと同様の誘因特性さえ帯びる。魅力的なCSは、行動的に動機づけられた接近行動を誘発することが多く、時には個人がCSをUCSのように「消費」しようとすることさえある(例えば、食べる、飲む、吸う、セックスをする、薬物として摂取する)。CSを「欲する」ことで、以前は中立的だった刺激が道具的条件付け強化子に変わり、個人は手がかりを得るために努力するようになる(ただし、条件付け強化には別の心理的メカニズムも存在する)。
生み出す感作または過剰反応性のドーパミンシステムによって生成される過剰なインセンティブ顕著性に部分的に起因していると考えられている (Robinson および Berridge、1993)。しかし、なぜあるターゲットが他のすべてのターゲットよりも「欲しくなる」のかは、完全には解明されていない。中毒者やアゴニスト刺激を受けた患者では、インセンティブ顕著性のドーパミン刺激の繰り返しが、依存性薬物の摂取や特定の強迫行為など、個々の特定の追求に結び付けられるようになる。パブロフの条件付けによる報酬状況では、報酬の手がかりの中には、個人によって異なる方法で、強力な動機付けの磁石として、他の手がかりよりも「欲しい」ものとなるものがある(Robinson et al., 2014b; Saunders and Robinson, 2013)。
…しかし、快楽効果は時間とともに変化する可能性がある。薬物を繰り返し摂取すると、感受性の高い人では中脳辺縁系ドーパミン作動性感作が起こり、「欲求」が増幅される可能性がある(Leyton and Vezina, 2013; Lodge and Grace, 2011; Wolf and Ferrario, 2010)。これは、継続的な薬物刺激によってオピオイド快楽メカニズムがダウンレギュレーションされ、「好き」耐性が生じた場合でも同様である。インセンティブ感作は、薬物を再び摂取したいというキューによって引き起こされる「欲求」を選択的に増幅することで依存症を引き起こし、薬物の快楽が減ったとしても強力な動機付けとなる(Robinson and Berridge, 1993)。
{{cite book}}ISBN /日付の不一致(ヘルプ)