Operant conditioning, also called instrumental conditioning, is a learning process in which voluntary behaviors are modified by association with the addition (or removal) of reward or aversive stimuli. The frequency or duration of the behavior may increase through reinforcement or decrease through punishment or extinction.
Operant conditioning originated with Edward Thorndike, whose law of effect theorised that behaviors arise as a result of consequences as satisfying or discomforting. In the 20th century, operant conditioning was studied by behavioral psychologists, who believed that much of mind and behaviour is explained through environmental conditioning. Reinforcements are environmental stimuli that increase behaviors, whereas punishments are stimuli that decrease behaviors. Both kinds of stimuli can be further categorised into positive and negative stimuli, which respectively involve the addition or removal of environmental stimuli.
Operant conditioning differs from classical conditioning in both mechanism and outcome. While classical conditioning pairs stimuli to produce involuntary, reflexive behaviors (like salivating at food), operant conditioning shapes voluntary behaviors through their consequences. Actions followed by rewards tend to be repeated, while those followed by negative outcomes diminish.
The study of animal learning in the 20th century was dominated by the analysis of these two sorts of learning,[1] and they are still at the core of behavior analysis. They have also been applied to the study of social psychology, helping to clarify certain phenomena such as the false consensus effect.[2]

オペラント条件づけ(道具的学習とも呼ばれる)は、エドワード・L・ソーンダイク(1874~1949)によって初めて大規模に研究されました。彼は、自作のパズルボックスから脱出しようとする猫の行動を観察しました。[ 3 ]猫は紐を引いたり棒を押したりといった簡単な反応で箱から脱出できましたが、最初に閉じ込められたときは、脱出するのに時間がかかりました。試行を繰り返すと、効果のない反応は減り、成功する反応は増えたため、猫はますます早く脱出できるようになりました。[ 3 ]ソーンダイクはこの発見を効果の法則に一般化しました。効果の法則とは、満足のいく結果を伴う行動は繰り返される傾向があり、不快な結果をもたらす行動は繰り返される可能性が低いというものです。つまり、結果によっては行動が強化され、結果によっては行動が弱まるということです。ソーンダイクは、脱出時間と試行回数をプロットすることで、この手順を通して動物の学習曲線を初めて作成しました。[ 4 ]
人間は、ソーンダイクが研究したようなプロセス(現在ではオペラント条件づけと呼ばれている)を通して、多くの単純な行動を学習するようです。つまり、反応は、成功につながる場合は保持され、そうでない場合や嫌悪効果が生じる場合は破棄されます。これは通常、「教師」によって計画されることなく起こりますが、オペラント条件づけは何千年もの間、親が子供を教える際に使用されてきました。[ 5 ]

BF スキナー(1904–1990) はオペラント条件付けの父と呼ばれ、彼の研究はこのテーマに関連して頻繁に引用される。1938 年に出版された著書『生物の行動:実験的分析』[ 6 ]は、オペラント条件付けとその人間や動物の行動への応用に関する彼の生涯にわたる研究の始まりとなった。エルンスト・マッハの考えに倣い、スキナーはソーンダイクが言及した満足感などの観察不可能な精神状態を否定し、観察可能な行動とその同様に観察可能な結果に基づいて分析を構築した。[ 7 ]
スキナーは、古典的条件づけは人間の行動のような複雑なものを説明するには単純すぎると考えていた。彼の見解では、オペラント条件づけは意図的な行動の原因と結果を考察するため、人間の行動をより適切に説明できる。
スキナーは経験的アプローチを実行するために、オペラント条件付けチャンバー、すなわち「スキナーボックス」を発明した。このチャンバーでは、ハトやラットなどの被験体を隔離し、慎重に制御された刺激にさらすことができた。ソーンダイクのパズルボックスとは異なり、この装置では被験体が1つか2つの単純で反復可能な反応をすることができ、そのような反応の頻度がスキナーの主要な行動指標となった。[ 8 ] もう一つの発明である累積記録装置は、これらの反応率を推定できるグラフ記録を作成した。これらの記録は、スキナーとその同僚がさまざまな強化スケジュールが反応率に及ぼす影響を調査するために使用した主要なデータであった。[ 9 ]強化スケジュールは、「明確に定義された規則に従って生物に強化を与えるあらゆる手順」と定義できる。[ 10 ]スケジュールの効果は、今度はスキナーがオペラント条件付けの説明を発展させる基本的な発見となった。彼はまた、人間や動物の行動に関する多くの非公式な観察も参考にした。[ 11 ]
スキナーの著作の多くは、オペラント条件付けを人間の行動に応用することに費やされている。[ 12 ] 1948年に彼は、自身の条件付けの原理に基づいて組織された平和で幸福で生産的なコミュニティの架空の物語である『ウォールデン・ツー』を出版した。 [ 13 ] 1957年にスキナーは『言語行動』を出版し[ 14 ]、オペラント条件付けの原理を言語に拡張した。言語は、それまで言語学者などによって全く異なる方法で分析されてきた人間の行動の一形態である。スキナーは、言語の本質を捉えるために「要求」や「命名」などの新しい機能的関係を定義したが、新しい原理は導入せず、言語行動を、話し手の聴衆の反応を含む結果によって制御される他の行動と同様に扱った。
オペラント行動は「発せられる」と言われます。つまり、最初は特定の刺激によって引き起こされるわけではありません。では、そもそもなぜオペラント行動が起こるのでしょうか。この問いへの答えは、ダーウィンが「新しい」身体構造の起源について答えたのと同様に、変異と選択です。同様に、個体の行動は、具体的な動作、加える力の量、反応のタイミングなど、刻々と変化します。強化につながる変化は強化され、強化が一貫していれば、行動は安定する傾向があります。しかし、行動の変動性自体も、特定の変数を操作することによって変化させることができます。[ 15 ]
強化と罰は、オペラント行動を修正するための主要な手段です。これらの用語は、行動への影響によって定義されます。「正」と「負」は、それぞれ刺激が加えられたか取り除かれたかを示します。同様に、「強化」と「罰」は、行動の将来の頻度を示します。強化は、将来行動がより頻繁に起こるようにする結果を表し、罰は、行動がより少なく起こるようにする結果を表します。[ 16 ]
結果は全部で4つあります。
ある研究では、モバイルデバイスからの触覚振動などの触覚フィードバックが二次強化因子(つまり、関連付けによって強化価値を獲得する学習報酬)として機能し、オンライン購入などの消費者の行動を強化する可能性があることが示唆されている。[ 19 ]
強化スケジュールは、強化の提供を制御するルールです。ルールは、強化が利用可能になる時間、または行われる反応の数、またはその両方を指定します。多くのルールが可能ですが、以下は最も基本的で一般的に使用されているものです[ 20 ] [ 9 ]
強化と罰の効果は変化する可能性がある。
これらの要因のほとんどは生物学的機能に関わっています。例えば、満腹感のプロセスは、生物が安定した内部環境(恒常性)を維持するのに役立ちます。例えば、生物が糖分を摂取していない場合、砂糖の味は効果的な強化因子となります。生物の血糖値が最適値に達するかそれを超えると、砂糖の味は効果が薄れ、場合によっては嫌悪感さえ覚えるようになります。
シェーピングは、動物の訓練や非言語的な人間の教育によく用いられる条件付け方法です。これは、前述のように、オペラント条件付けの変動性と強化に基づいています。トレーナーはまず、望ましい最終行動(または「ターゲット」行動)を特定します。次に、動物または人がすでに一定の確率で示す行動を選択します。そして、ターゲット行動にますます近づく行動を強化することで、この行動の形式を連続する試行の中で徐々に変化させていきます。最終的にターゲット行動が示されるようになったら、強化スケジュールを用いてその行動を強化し、維持することができます。
非随伴性強化とは、生物の行動に関係なく強化刺激を与えることである。非随伴性強化は、標的反応を消去しながら複数の代替反応を強化することによって、望ましくない標的行動を減らす試みに用いられることがある。[ 23 ]測定された行動が強化されたと特定されないため、非随伴性「強化」という用語の使用をめぐっては議論がある。[ 24 ]
オペラント行動は最初は特定の刺激との関連が特定されないまま発現しますが、オペラント条件付けの過程で、行動が強化される際に存在する刺激によって制御されるようになります。このような刺激は「弁別刺激」と呼ばれます。その結果、いわゆる「三項随伴性」が生まれます。つまり、弁別刺激は報酬または罰を生み出す反応のきっかけとなるのです。例:ネズミはライトが点灯した時だけレバーを押すように訓練できます。犬は餌袋のガラガラという音を聞くと台所へ駆けつけます。子供はテーブルの上にキャンディーがあると手を伸ばします。
ほとんどの行動は刺激によって制御される。これにはいくつかの側面がある。
ほとんどの行動は、個々の反応が一つずつ強化されるという単純な説明では容易には捉えられません。オペラント分析の範囲は、行動連鎖という概念によって拡張されます。行動連鎖とは、上述の3項随伴性によって結び付けられた一連の反応のことです。連鎖は、弁別刺激が後続の行動のきっかけとなるだけでなく、先行する行動を強化することもできるという事実に基づいています。つまり、弁別刺激は「条件付けられた強化子」でもあるのです。例えば、レバーを押すきっかけとなる光は、騒音がある状況下で「振り返る」行動を強化するために使用できます。その結果、「騒音→振り返る→光→レバーを押す→餌」という一連の行動が生まれます。刺激と反応をさらに追加することで、より長い連鎖を構築することも可能です。
回避学習では、行動によって(嫌悪)刺激が終結します。例えば、日光から目を覆うことで、目に強い光が当たるという(嫌悪)刺激が終結します。(これは、前述の負の強化の一例です。)刺激を防ぐことで維持される行動は「回避」と呼ばれ、例えば、外出前にサングラスをかけることが挙げられます。回避行動は、いわゆる「回避のパラドックス」を引き起こします。なぜなら、刺激が発生しないことが、どのように強化因子として機能するのかという疑問が生じるからです。この疑問は、いくつかの回避理論によって説明されています(下記参照)。
実験設定としては、弁別学習と自由操作回避学習の2種類が一般的に用いられる。
弁別回避実験では、光などの中性刺激の後に電気ショックなどの嫌悪刺激が続く一連の試行が行われます。中性刺激が現れた後、レバーを押すなどのオペラント反応によって嫌悪刺激が阻止または終了されます。初期の試行では、被験者は嫌悪刺激が現れるまで反応しないため、これらの初期の試行は「逃避」試行と呼ばれます。学習が進むにつれて、被験者は中性刺激中に反応するようになり、嫌悪刺激の発生を阻止します。このような試行は「回避試行」と呼ばれます。この実験は、中性条件刺激(CS)と嫌悪無条件刺激(US)が対提示されるため、古典的条件付けを伴うと言われています。この考え方は、後述する回避学習の二要因理論の基礎となっています。
自由操作回避では、被験者はオペラント反応を行わない限り、定期的に嫌悪刺激(多くの場合、電気ショック)を受けます。反応によってショックの開始が遅れます。この状況では、弁別回避とは異なり、ショックを知らせる事前の刺激はありません。回避学習の速度を決定する2つの重要な時間間隔があります。1つ目はSS(ショック-ショック)間隔です。これは、反応がない場合の連続するショック間の時間です。2つ目はRS(反応-ショック)間隔です。これは、オペラント反応によって次のショックの開始が遅れる時間を示します。被験者がオペラント反応を行うたびに、ショックのないRS間隔が新たに始まります。
この理論はもともと、生物が嫌悪刺激の信号から逃れることでその刺激を避けることを学習する、弁別回避学習を説明するために提唱された。そこには2つのプロセスが関わっている。まず信号の古典的条件付けが行われ、次に逃避反応のオペラント条件付けが行われる。
a)恐怖の古典的条件づけ。まず、生物は条件刺激(CS)と嫌悪的な無条件刺激(US)の対提示を経験します。この理論では、この対提示によって古典的条件づけを通してCSとUSの間に連合が形成され、USの嫌悪的な性質のために、CSは条件づけられた情動反応(CER)である「恐怖」を引き起こすと想定しています。 b)恐怖の軽減によるオペラント反応の強化。最初のプロセスの結果、CSは恐怖を知らせる信号となります。この不快な情動反応はオペラント反応を動機づけ、CSを終了させる反応は恐怖の終了によって強化されます。この理論は、生物がUSを予測するという意味でUSを「回避」するとは言っていません。むしろ、生物はCSによって引き起こされる嫌悪的な内部状態から「逃れる」と述べています。いくつかの実験結果は、二要因理論に反しているように見えます。例えば、最初のCS-USペアリングが二度と起こらなくても、回避行動は非常にゆっくりと消えることが多いので、恐怖反応は消えると予想される(古典的条件付けを参照)。さらに、回避を学習した動物は恐怖の兆候をほとんど示さないことが多く、恐怖からの逃避は回避行動を維持するために必要ではないことを示唆している。[ 25 ]
回避行動は、結果によって維持されるオペラント行動の特殊なケースにすぎないという理論家もいる。この見方では、「結果」という概念は、一連の出来事に対する感受性を含むように拡張される。つまり、回避行動では、反応の結果は嫌悪刺激の頻度の減少である。実際、実験的証拠は、「見逃されたショック」が刺激として検出され、強化子として作用することを示唆している。回避の認知理論はこの考えをさらに一歩進めている。例えば、ラットはレバーを押さなかった場合にショックを「期待」し、レバーを押した場合は「ショックを受けない」と期待するようになり、これらの期待が確認されると回避行動が強化される。[ 25 ]
オペラント貯蔵とは、特定の方法で強化されたラットが、餌のペレットを取り出す代わりに、餌のペレットを餌皿に蓄積させるという観察結果を指します。この手順では、ペレットを取り出すと必ず1分間の消去期間が設けられ、その間は追加の餌のペレットは入手できませんが、以前に蓄積されたペレットは食べることができました。この発見は、ラットがすぐに小さな餌と、少し遅れて大きな餌のどちらかを選択できる状況では衝動的に行動するという通常の発見と矛盾しているように見えます。強化スケジュールを参照してください。[ 26 ]
The first scientific studies identifying neurons that responded in ways that suggested they encode for conditioned stimuli came from work by Mahlon deLong[27][28] and by R.T. Richardson.[28] They showed that nucleus basalis neurons, which release acetylcholine broadly throughout the cerebral cortex, are activated shortly after a conditioned stimulus, or after a primary reward if no conditioned stimulus exists. These neurons are equally active for positive and negative reinforcers, and have been shown to be related to neuroplasticity in many cortical regions.[29] Evidence also exists that dopamine is activated at similar times.[30] There is considerable evidence that dopamine participates in both reinforcement and aversive learning.[31] Dopamine pathways project much more densely onto frontal cortex regions. Cholinergic projections, in contrast, are dense even in the posterior cortical regions like the primary visual cortex. A study of patients with Parkinson's disease, a condition attributed to the insufficient action of dopamine, further illustrates the role of dopamine in positive reinforcement.[32] It showed that while off their medication, patients learned more readily with aversive consequences than with positive reinforcement. Patients who were on their medication showed the opposite to be the case, positive reinforcement proving to be the more effective form of learning when dopamine activity is high.
ドーパミンが関与する神経化学的プロセスが強化の根底にあると考えられている。生物が強化刺激を受けると、脳内のドーパミン経路が活性化される。この経路のネットワークは「多くの樹状突起にドーパミンの短いパルスを放出し、シナプス後ニューロンに全体的な強化シグナルを伝達する」[ 33 ] 。これにより、最近活性化されたシナプスは遠心性(外向きに伝導する)シグナルに対する感受性を高め、強化に先行する最近の反応の発生確率を高めることができる。これらの反応は、統計的に、強化を成功裏に達成した行動である可能性が最も高い。しかし、強化の適用が即時的でない、または条件付き性が低い(一貫性が低い)場合、ドーパミンが適切なシナプスに作用する能力は低下する。
オペラント行動は、上記で定義した意味での強化なしに確立できることが、いくつかの観察から明らかになっている。最もよく引用されるのは、オートシェイピング (「サイントラッキング」と呼ばれることもある)という現象で、刺激の後に繰り返し強化が行われ、その結果、動物が刺激に反応し始める。たとえば、反応キーが点灯し、次に餌が提示される。これを数回繰り返すと、ハトは、餌が与えられるかどうかにかかわらず、キーをつつくようになる。同様に、ラットは、近くに餌が提示されると、レバーなどの小さな物体を扱うようになる。[ 34 ] [ 35 ]驚くべきことに、ハトとラットは、キーをつついたりレバーを押したりすると餌が少なくなる(省略訓練)場合でも、この行動を続ける。[ 36 ] [ 37 ]強化なしに現れるもう1つの明らかなオペラント行動は、コントラフリーローディングである。
これらの観察結果などは効果の法則と矛盾するように見え、一部の研究者はオペラント強化の新しい概念化を提案するに至った(例:[ 38 ] [ 39 ] [ 40 ])。より一般的な見解としては、オートシェイピングは古典的条件付けの一例であり、実際、オートシェイピング手続きは古典的条件付けを測定する最も一般的な方法の1つとなっている。この見解では、多くの行動は古典的随伴性(刺激-反応)とオペラント随伴性(反応-強化)の両方の影響を受ける可能性があり、実験者の課題はこれらがどのように相互作用するかを解明することである。[ 41 ]
Reinforcement and punishment are ubiquitous in human social interactions, and a great many applications of operant principles have been suggested and implemented.
Operant conditioning bridges the field of neurobiology and the field of psychology. It's able to do this by demonstrating how exterior behavioral principles correspond with internal processes. While psychologists describe learning in terms of observable behaviors that can be shaped by consequences, neurobiologist share a different sentiment. neurobiologist analyze how these behaviors are underpinned by neural circuits.
Both positive and negative reinforcement has been shown to activate a reward system in the brain. This is able to take place because of the release of dopamine in specific areas such as the nucleus accumbens.[42]
Tools such as point systems, charts of behavior and token economies are principles that are grounded in operant conditioning. These systems function as conditioned reinforcers, which means that they can be exchanged for primary reinforcers such as a tangible reward.
Positive and negative reinforcement play central roles in the development and maintenance of addiction and drug dependence. An addictive drug is intrinsically rewarding; that is, it functions as a primary positive reinforcer of drug use. The brain's reward system assigns it incentive salience (i.e., it is "wanted" or "desired"),[43][44][45] so as an addiction develops, deprivation of the drug leads to craving. In addition, stimuli associated with drug use – e.g., the sight of a syringe, and the location of use – become associated with the intense reinforcement induced by the drug.[43][44][45] These previously neutral stimuli acquire several properties: their appearance can induce craving, and they can become conditioned positive reinforcers of continued use.[43][44][45] Thus, if an addicted individual encounters one of these drug cues, a craving for the associated drug may reappear. For example, anti-drug agencies previously used posters with images of drug paraphernalia as an attempt to show the dangers of drug use. However, such posters are no longer used because of the effects of incentive salience in causing relapse upon sight of the stimuli illustrated in the posters.
薬物依存者においては、薬物離脱症状中に生じる身体的依存(例:震えや発汗)および/または精神的依存(例:快感消失、落ち着きのなさ、易怒性、不安)の症状を軽減または「逃れる」ために薬物を自己投与すると、負の強化が生じる。[ 43 ]
動物の訓練士やペットの飼い主は、これらの概念が命名され研究されるずっと前からオペラント条件付けの原理と実践を適用しており、動物の訓練は今でもオペラント制御の最も明確で説得力のある例の 1 つを提供しています。この記事で説明されている概念と手順のうち、最も顕著なもののいくつかは次のとおりです。(a) 一次強化子の入手可能性 (例: 犬用のおいしいおやつが入った袋)、(b) 二次強化子の使用 (例: 望ましい反応の直後にクリッカーを鳴らし、おいしいおやつを与える)、(c) 随伴性、強化子 (例: クリッカー) が望ましい行動の後に続き、他のものには続かないようにすること、(d) シェーピング、犬が徐々に高くジャンプするようにすること、(e) 間欠的強化、飽和することなく持続的な行動を誘発するために強化の頻度を徐々に減らすこと、(f) 連鎖、より小さな単位から複雑な行動を徐々に構築すること。[ 46 ]
応用行動分析(ABA)は、 BFスキナーによって創始された学問分野であり、条件付けの原理を社会的に重要な人間の行動の修正に応用するものです。条件付け理論の基本概念、すなわち条件刺激(S C)、弁別刺激(S d)、反応(R)、強化刺激(強化子の場合はS reinまたはS r、嫌悪刺激の場合はS save)を使用します。[ 25 ]
ABA(応用行動分析)の実践者は、これらの手法、そしてそれらの多くのバリエーションや発展形を、社会的に重要な様々な行動や問題に適用します。多くの場合、実践者はオペラント条件付けの技法を用いて、逸脱行動を建設的で社会的に受け入れられる行動に置き換えることを目指します。 ABAの手法は、自閉症児に対する早期集中行動介入[ 47 ] 、犯罪行動に影響を与える原理の研究、HIV予防[ 48 ] 、天然資源の保全[ 49 ] 、教育[ 50] 、老年学[ 51 ] 、健康と運動[ 52 ]、産業安全[ 53 ]、言語習得[ 54 ]、ポイ捨て[ 55 ]、医療処置[ 56] 、子育て[ 57 ] 、心理療法、シートベルトの使用[ 58 ] 、重度の精神障害[ 59 ]、スポーツ[ 60 ]、薬物乱用、恐怖症、小児の摂食障害、動物園の管理と動物の世話[ 61 ]など、さまざまなことに効果的に応用されてきました。これらの応用例のいくつかは、 以下に説明します。
適切な子どもの行動に対して肯定的な強化を与えることは、親の養育訓練の主要な焦点です。通常、親は、社会的報酬(褒め言葉、笑顔、抱擁など)と具体的な報酬(子どもと共同で作成したインセンティブシステムの一部として、シールやより大きな報酬へのポイントなど)を通じて適切な行動に報酬を与えることを学びます。[ 62 ]さらに、親は、最初の焦点として単純な行動を選択し、子どもがより大きな目標に到達するために達成する小さなステップごとに報酬を与えることを学びます(この概念は「逐次近似」と呼ばれます)。[ 62 ] [ 63 ]
心理学者と経済学者の両方が、オペラント条件付けの概念と研究結果を市場における人間の行動に適用することに関心を持つようになった。その一例として、購入される商品の量によって指標化される消費者需要の分析が挙げられる。経済学では、価格が消費に及ぼす影響の度合いを「需要の価格弾力性」と呼ぶ。特定の商品の弾力性は他の商品よりも高い。例えば、特定の食品の価格の変化は購入量に大きな影響を与える可能性があるが、ガソリンやその他の日用品は価格の変化による影響が少ない可能性がある。オペラント分析の観点から、このような影響は消費者の動機と強化子としての商品の相対的価値という観点から解釈できる。[ 64 ]
この記事で既に述べたように、変動比率スケジュールでは、予測不可能な数の反応の後に強化が与えられます。このスケジュールは通常、迅速かつ持続的な反応を生み出します。スロットマシンは変動比率スケジュールでペイオフを行い、ギャンブラーにまさにこのような持続的なレバー引き行動を引き起こします。スロットマシンやその他のギャンブル形態における変動比率ペイオフは、ギャンブル依存症の根本的な要因としてしばしば挙げられています。[ 65 ]
人間は殺生に対して生来の抵抗感を持っており、たとえ命を救うためであっても、同種の仲間に対して直接的かつ攻撃的な行動をとることをためらう。この殺生への抵抗感は、軍事戦争の歴史を通じて歩兵の効率性を著しく低下させてきた。[ 66 ]
この現象は、SLAマーシャル(准将で軍事史家)が第二次世界大戦の歩兵を戦闘直後にインタビュー調査するまで理解されていなかった。マーシャルのよく知られた物議を醸した著書『Men Against Fire; The Problem of Battle Command in Future Wars』では、戦闘で殺傷目的でライフルを発砲した兵士はわずか15%だったことが明らかになった。[ 67 ]
1946年にマーシャルの研究が米陸軍に受け入れられた後、米陸軍の人事研究室はオペラント条件付け法に似た新しい訓練プロトコルの実施を開始した。その後、このような方法を適用した結果、殺傷能力のある兵士の割合は朝鮮戦争で約50%、ベトナム戦争で90%以上に増加した。[ 66 ] 訓練の革命には、従来のポップアップ射撃場を、命中すると崩れる3次元の人型ポップアップ標的に置き換えることが含まれていた。これにより即座にフィードバックが得られ、兵士の行動に対する正の強化として機能した。[ 68 ]軍事訓練方法のその他の改善には、時間制限付き射撃コース、より現実的な訓練、高反復、上官からの賞賛、射撃の腕前に対する報酬、およびグループによる表彰が含まれる。負の強化には、仲間の責任やコースの再受講の要求が含まれる。
現代の軍事訓練は、主にパブロフの古典的条件付けとスキナーのオペラント条件付け(どちらも行動主義の一形態)を用いて、実際の戦闘を綿密にシミュレートすることで、戦闘圧力に対する中脳の反応を条件付ける。[ 66 ]
現代の射撃訓練は行動主義の優れた例であり、長年にわたり、ウェストポイントにある米国陸軍士官学校の全士官候補生に教えられる入門心理学コースで、オペラント条件付けの古典的な例として使用されてきました。1980年代にウェストポイントを訪れたBFスキナーは、現代の軍事射撃訓練がオペラント条件付けのほぼ完璧な応用であると指摘しました。[ 68 ]
デイブ・グロスマン中佐は、オペラント条件付けと米軍の訓練について次のように述べています。
誰も意図的にオペラント条件付けや行動修正技術を用いて兵士を訓練しようとしたわけではない可能性は十分にあるが…歴史家であり職業軍人でもある心理学者の立場からすると、まさにそれが達成されたことはますます明らかになってきている。[ 66 ]
ナッジ理論(またはナッジ)とは、行動科学、政治理論、経済学における概念であり、強制されない服従を促すための間接的な提案は、直接的な指示、法律、強制よりも効果的ではないにしても、少なくとも同等の効果で、集団や個人の動機、インセンティブ、意思決定に影響を与えることができると主張するものである。
行動強化の手段としての賞賛の概念は、BF スキナーのオペラント条件付けモデルに根ざしています。この観点から、賞賛は正の強化の手段として捉えられてきました。つまり、観察された行動を条件的に賞賛することによって、その行動が発生する可能性が高くなります。[ 69 ] 何百もの研究が、賞賛が肯定的な行動を促進するのに効果的であることを実証しており、特に教師や親が子供に賞賛を用いることで行動や学業成績の向上を促進するという研究[ 70 ] [ 71 ]だけでなく、仕事のパフォーマンスに関する研究[ 72 ]でも実証されています。賞賛はまた、代理強化によって、賞賛されていない周囲の人々(賞賛を受けた人のクラスメートなど)の肯定的な行動を強化することも実証されています。[ 73 ]賞賛は、その形式、内容、および伝達方法によって、行動を変えるのに効果的である場合もあれば、そうでない場合もあります。褒め言葉が肯定的な行動変化をもたらすためには、肯定的な行動に依存していること(つまり、目標とする行動が実行された後にのみ与えられること)、強化すべき行動の詳細を明確にすること、そして誠実かつ信頼できる形で伝えられることが不可欠である。[ 74 ]
褒め言葉が肯定的な強化戦略として効果的であることを認識して、数多くの行動療法や認知行動療法の介入では、プロトコルに褒め言葉の使用が組み込まれています。[ 75 ] [ 76 ]褒め言葉の戦略的な使用は、教室管理[ 75 ]と子育てトレーニング介入[ 71 ]の両方においてエビデンスに基づいた実践として認識されていますが、介入研究では、褒め言葉は戦略的な注意や行動報酬などの戦略を含む、より大きなカテゴリーの肯定的な強化に包含されることがよくあります。
認知行動療法とオペラント行動療法が様々な疾患に及ぼす影響について、数多くの研究が行われてきました。患者が行動、態度、感情を変える認知行動療法を習得すると、痛みの程度が軽減しました。これらの研究結果は、認知が痛みの知覚に影響を与えることを示しており、その結果は認知行動療法(CBT)とオペラント行動療法(OBT)の一般的な有効性を説明するものでした。
ほとんどのビデオゲームは強迫ループを中心に設計されており、変動レートスケジュールを通じて一種の正の強化を追加することで、プレイヤーがプレイし続けるようにしています。これはビデオゲーム中毒の病理につながる可能性があります。[ 77 ]
2010年代のビデオゲームの収益化のトレンドの一環として、一部のゲームでは報酬として、または現実のお金で購入できるアイテムとしてルートボックスが提供されました。ボックスには、ゲーム内アイテムのランダムな選択が含まれています。この方法は、変動レートスケジュールに従うため、スロットマシンやその他のギャンブル機器が報酬を分配する方法と同じ方法に関連付けられています。ルートボックスはギャンブルの一種であるという一般的な認識がありますが、この行為をギャンブルとして分類しているのはごく一部の国だけです。しかし、これらのアイテムをオンラインギャンブルの仮想通貨として使用したり、現実のお金と交換したりする方法により、スキンギャンブル市場が生まれ、法的評価を受けています。[ 78 ]
医療費が莫大な額になる理由として挙げられる多くの理由の一つに、防御医療の実践がある。プラブーはコールの記事をレビューし、2つの脳神経外科医グループの反応が典型的なオペラント行動であることを論じている。一方のグループは医療訴訟に制限のある州で診療を行い、もう一方のグループは制限のない州で診療を行っている。脳神経外科医グループは匿名で診療パターンについて質問された。医師たちは、医療訴訟に制限のない州で診療を行っているグループからの否定的なフィードバック(訴訟への恐怖)に応じて診療方法を変更した。[ 79 ]
Rewards in operant conditioning are positive reinforcers. ... Operant behavior gives a good definition for rewards. Anything that makes an individual come back for more is a positive reinforcer and therefore a reward. Although it provides a good definition, positive reinforcement is only one of several reward functions. ... Rewards are attractive. They are motivating and make us exert an effort. ... Rewards induce approach behavior, also called appetitive or preparatory behavior, and consummatory behavior. ... Thus any stimulus, object, event, activity, or situation that has the potential to make us approach and consume it is by definition a reward.
報酬物質への繰り返しの曝露が二次強化イベントの連鎖を引き起こし、それによって薬物使用に関連する手がかりや状況自体が強化となり、選択された物質の継続的な使用と乱用につながる可能性があるということです。...
依存
症プロセス(特に再発)に非常に関連のある強化の重要な側面は、二次強化です(Stewart、1992)。二次強化子(多くの場合、条件付け強化子とも考えられています)は、人間の強化プロセスの大部分を推進していると考えられます。薬物依存症の場合、薬物使用と密接かつ繰り返し関連付けられる手がかりや状況自体が強化因子となることが多い
。ロビンソンとベリッジの依存症のインセンティブ感作理論の基本的な部分は、一次強化因子自体に加えて、そのような二次強化プロセスのインセンティブ価値または魅力的な性質が、薬物依存症の発達と連携して、時間の経過とともに持続し、感作される可能性があると仮定している(ロビンソンとベリッジ、1993)。
負
の強化は、進行中の(おそらく嫌悪的な)刺激を終了させる行動反応の強化に関連する特別な状態である。この場合、負の強化因子を、そのような「逃避」反応を強化する動機付け刺激として定義することができる。歴史的に、薬物依存症に関連して、この現象は、離脱状態における動機付けニーズを満たすために乱用薬物が自己投与されるという点で、人間において一貫して観察されてきた(ウィクラー、1952)。
{{cite book}}:|journal=無視されました (ヘルプ)パブロフの条件付け条件 CS+ にインセンティブ顕著性が付与されると、その UCS に対する「欲求」が引き起こされるだけでなく、多くの場合、キュー自体が非常に魅力的になり、非合理的な程度にさえなります。このキューの魅力は、インセンティブ顕著性のもう 1 つの特徴です。 CSは、見ないわけにはいかなくなる(Wiers & Stacy, 2006; Hickey et al., 2010a; Piech et al., 2010; Anderson et al., 2011)。CSは、UCSと同様の誘因特性さえ帯びる。魅力的なCSは、行動的に動機づけられた接近行動を誘発することが多く、時には個人がCSをUCSのように「消費」しようとすることさえある(例えば、食べる、飲む、吸う、セックスをする、薬物として摂取する)。CSを「欲する」ことで、以前は中立的だった刺激が道具的条件付け強化子に変わり、個人は手がかりを得るために努力するようになる(ただし、条件付け強化には別の心理的メカニズムも存在する)。
生み出す感作または過剰反応性のドーパミンシステムによって生成される過剰なインセンティブ顕著性に部分的に起因していると考えられている (Robinson および Berridge、1993)。しかし、なぜあるターゲットが他のすべてのターゲットよりも「欲しくなる」のかは、完全には解明されていない。中毒者やアゴニスト刺激を受けた患者では、インセンティブ顕著性のドーパミン刺激の繰り返しが、依存性薬物の摂取や特定の強迫行為など、個々の特定の追求に結び付けられるようになる。パブロフの条件付けによる報酬状況では、報酬の手がかりの中には、個人によって異なる方法で、強力な動機付けの磁石として、他の手がかりよりも「欲しい」ものとなるものがある(Robinson et al., 2014b; Saunders and Robinson, 2013)。
…しかし、快楽効果は時間とともに変化する可能性がある。薬物を繰り返し摂取すると、感受性の高い人では中脳辺縁系ドーパミン作動性感作が起こり、「欲求」が増幅される可能性がある(Leyton and Vezina, 2013; Lodge and Grace, 2011; Wolf and Ferrario, 2010)。これは、継続的な薬物刺激によってオピオイド快楽メカニズムがダウンレギュレーションされ、「好き」耐性が生じた場合でも同様である。インセンティブ感作は、薬物を再び摂取したいというキューによって引き起こされる「欲求」を選択的に増幅することで依存症を引き起こし、薬物の快楽が減ったとしても強力な動機付けとなる(Robinson and Berridge, 1993)。
{{cite book}}ISBN /日付の不一致(ヘルプ)