「群衆の知恵」または「多数派の知恵」とは、(一人の専門家の意見ではなく)多様で独立した個人の集団の意見が最良の判断をもたらすという考え方を表す。[ 1 ]この概念は情報化時代に新しいものではないが、 Quora、Reddit、Stack Exchange、Wikipedia、Yahoo! Answersなどのソーシャル情報サイトや、集合的な人間の知識に依存するその他のウェブリソースによって注目を集めるようになった。 [ 2 ]この仮説の説明としては、個々の判断に伴う特異なノイズが、多数の回答にわたって平均化されたノイズに置き換えられ、ノイズの影響が緩和されるということが挙げられる。[ 3 ]
陪審裁判は、少なくとも部分的には集団の知恵に依拠していると言える。一方、裁判官による裁判は、一人または少数の専門家に頼っている。政治の世界では、抽選が集団の知恵の一例として挙げられることがある。意思決定は、比較的均質な政治集団や政党ではなく、多様なグループによって行われる。認知科学の研究では、集団の知恵の効果と個人の認知との関係をモデル化しようと試みられてきた。
数量推定、一般的な世界知識、空間推論に関する質問に対する、大人数のグループによる集計された回答は、一般的に、グループ内の個々の回答と同等、あるいは多くの場合、それよりも優れていることがわかっている。
社会選択理論における陪審定理は、多かれ少なかれ妥当な様々な仮定の下で、群衆の知恵を形式的に論証するものである。定理自体は議論の余地がないものの、仮定と結論の両方については依然として議論が続いている。最も古く、最も単純な定理は、コンドルセの陪審定理(1785年)である。
アリストテレスは、著書『政治学』の中で「群衆の知恵」について最初に書いた人物として知られています。[ 4 ] [ 5 ]アリストテレスによれば、「個々には善人ではない多くの人々が集まると、個々ではなく集団として、善人である人々よりも優れている可能性がある。ちょうど、多くの人が費用を出し合って用意する宴会が、一人の費用で用意する宴会よりも優れているのと同じである」[ 6 ] 。

群衆の知恵に関する古典的な発見は、連続量の点推定に関するものです。1906年にプリマスで開催された地方博覧会で、800人が屠殺され処理された牛の重量を推定するコンテストに参加しました。統計学者のフランシス・ゴルトンは、中央値の推定値である1207ポンドが、実際の重量1198ポンドの1%以内の精度であることを観察しました。 [ 7 ]これは、群衆の個々の判断は、推定される量の真の値の近くに中央値を持つ応答の確率分布としてモデル化できるという認知科学の洞察に貢献しました。[ 8 ]
近年、「群衆の知恵」現象は、ビジネス戦略、広告分野、そして政治調査においても活用されている。マーケティング会社は、顧客のために消費者のフィードバックやブランドイメージを集約している。一方、Tradaのような企業は、顧客の要望に基づいて広告をデザインするために群衆の知恵を活用している。[ 9 ]最後に、政治的嗜好を集約して政治選挙を予測または予測している。[ 10 ] [ 11 ]
古典的な「群衆の知恵」に関する研究は、単一の連続量の点推定に焦点を当てていますが、この現象は、平均値を取るなどの集計方法に適さない高次元の問題にも適用できます。こうした目的のために、より複雑なモデルが開発されています。群衆の知恵の効果を示す高次元問題の例をいくつか挙げると、次のようになります。
結果を改善する方法をさらに探る中で、MITのスローン神経経済学研究所の科学者たちがプリンストン大学と共同で「驚くほど人気のある」と呼ばれる新しい手法を開発しました。与えられた質問に対して、人々は2つの回答を求められます。1つは正しいと思う答え、もう1つは世論がどう思うかです。この2つの平均差が正解を示します。「驚くほど人気のある」アルゴリズムは、単純多数決と比較してエラーを21.3%、回答に対する自信度を表す基本的な信頼度加重投票と比較して24.2%、平均が最も高い回答のみを使用する高度な信頼度加重投票と比較して22.2%削減することが分かりました。[ 18 ]
群衆の知恵という文脈では、群衆という用語は広い意味を持つ。ある定義では、群衆とは参加への公開の呼びかけによって集められた人々の集団であると特徴づけている。[ 19 ]
デジタル時代において、情報技術やGoogle、Facebook、Twitterなどのソーシャルメディアプラットフォームの出現により、集合知の可能性が拡大しました。これらのプラットフォームは、意見や知識を大規模に集約することを可能にし、一部の人々が「インテリジェントコミュニティ」と定義するものを生み出しています。[ 20 ]しかし、これらのデジタル群衆の有効性は、人口統計的バイアス、非常にアクティブなユーザーの影響、ボットの存在などの問題によって損なわれる可能性があります。これらは、群衆が真に賢明であるために必要な多様性と独立性を歪める可能性があります。これらの問題を軽減するために、研究者は、さまざまなプラットフォームからインテリジェンスを集約するためにマルチメディアアプローチを使用すること、または因子分析を使用してバイアスとノイズをフィルタリングすることを提案しています。[ 21 ]
オンラインアプリケーションでは群衆の力が活用されることが多いが、オフラインの文脈でも活用できる。[ 19 ]場合によっては、群衆のメンバーに、参加に対する金銭的なインセンティブが提供されることもある。[ 22 ]米国の陪審員制度のように、「群衆の知恵」の特定の応用例では、群衆の参加が義務付けられている。[ 23 ]
推定タスクに対する群衆の反応を確率分布からのサンプルとしてモデル化できるという洞察は、個人の認知との比較を促す。特に、個人の認知は、個々の推定が「内部確率分布」から抽出されるという意味で確率的である可能性がある。もしそうであれば、同じ人物による同じ量の2つ以上の推定の平均値は、それぞれの判断内の統計的ノイズの影響が軽減されるため、個々の判断のどちらよりも真実に近い値になるはずである。もちろん、これは各判断に関連するノイズが(少なくともある程度)統計的に独立しているという仮定に基づいている。したがって、さまざまな回答を可能にするためには、群衆は独立しているだけでなく、多様である必要がある。スペクトルの両端にある回答は互いに打ち消し合い、群衆の知恵現象がその代わりとなる。もう1つの注意点は、個々の確率判断は極端な値(たとえば0または1)に偏っていることが多いということである。したがって、同じ人物による複数の判断の有益な効果は、偏りのない分布からのサンプルに限定される可能性が高い。[ 24 ]
VulとPashler(2008)は参加者に、「世界の空港のうち、米国にあるのは何パーセントですか?」といった、一般的な世界知識に関連する連続量の点推定値を尋ねました。事前に手順を知らされずに、参加者の半数は同じ質問に対してすぐに2回目の異なる推測をするように求められ、残りの半数は3週間後に同じことをするように求められました。参加者の2回の推測の平均は、どちらの個別の推測よりも正確でした。さらに、3週間の遅延条件で行われた推測の平均は、すぐに連続して行われた推測よりも正確でした。この効果の1つの説明は、即時条件での推測は互いに独立性が低く(アンカリング効果)、したがって(ある程度)同じ種類のノイズの影響を受けていたということです。一般的に、これらの結果は、個人の認知は、人が持っているすべての知識に基づいて常に最良の答えを生成するのではなく、確率的ノイズによって特徴付けられる内部確率分布の影響を受ける可能性があることを示唆しています。[ 24 ]これらの結果は、高検出力の事前登録された再現実験でほぼ確認されました。[ 25 ]完全に再現されなかった唯一の結果は、2回目の推測を遅らせるとより良い推定値が得られるということだった。
HourihanとBenjamin(2010)は、VulとPashlerが遅延応答条件で観察した推定値の改善は、推定値の独立性の向上によるものであるという仮説を検証した。そのために、HourihanとBenjaminは参加者間の記憶スパンのばらつきを利用した。その結果、記憶スパンが低い参加者の繰り返し推定値を平均すると、記憶スパンが高い参加者の繰り返し推定値を平均するよりも推定値の改善が大きいことがわかった。[ 26 ]
RauhutとLorenz(2011)は、参加者に現実世界の知識に関連する連続量の推定を再度依頼することで、この研究を拡張しました。この場合、参加者には5回連続して推定を行うように伝えられました。このアプローチにより、研究者は、まず、他人に尋ねるのと同等の精度を得るために自分自身に何回尋ねる必要があるか、そして次に、自分自身が行った推定が他人に尋ねる場合と比較してどの程度精度が向上するかを判断することができました。著者らは、自分自身に無限に尋ねても、たった1人の他の人に尋ねる場合の精度を超えることはないという結論を下しました。全体として、彼らは、個人が推定を行う際に用いるいわゆる「メンタル分布」を支持する証拠はほとんど見つかりませんでした。実際、場合によっては、自分自身に複数回尋ねると精度が低下することが分かりました。最終的に、彼らは、VulとPashler(2008)の結果は「内なる群衆」の知恵を過大評価していると主張している。なぜなら、彼らの結果によれば、3回以上自問自答すると、VulとPashler(参加者に2回の推定しか求めなかった)が報告したレベルよりも精度が低下するからである。[ 27 ]
ミュラー=トレデ(2011)は、「内なる群衆」を活用することが最も効果的な質問の種類を調査しようと試みた。彼は、自分の推定値を他の人と平均化することによって期待されるよりも精度の向上は小さいものの、繰り返し判断することで、年推定に関する質問(例:温度計はいつ発明されたか?)と推定パーセンテージに関する質問(例:インターネットユーザーのうち中国から接続している割合は?)の両方で精度が向上することを発見した。一般的な数値に関する質問(例:音速は時速何キロメートルか?)は、繰り返し判断しても改善されなかったが、個々の判断をランダムな他の人の判断と平均化すると精度が向上した。ミュラー=トレデは、これは年とパーセンテージに関する質問によって暗示される制約の結果であると主張している。[ 28 ]
Van DolderとVan den Assem(2018)は、Holland Casinoが主催した3つの推定コンテストの大規模データベースを使用して「群衆の内的効果」を研究しました。これらのコンテストのそれぞれについて、彼らは個人内集計が推定の精度を実際に向上させることを発見しました。さらに、彼らは、連続する判断の間に時間遅延がある場合、この方法がより効果的であることも確認しました。推定の間にかなりの遅延があっても、個人間集計の方がより有益です。同じ人による多数の判断の平均は、異なる人による2つの判断の平均よりもわずかに優れているだけです。[ 29 ]
ヘルツォークとヘルトヴィヒ(2009)は、参加者に弁証法的ブートストラップ法を用いるよう求めることで、「多数の知恵が一つになった知恵」(すなわち「内なる群衆」)を改善しようと試みた。弁証法的ブートストラップ法とは、弁証法(最良の答えを見つけようと、相反する見解を持つ2人以上の当事者間で行われる論理的な議論)とブートストラップ法(外部の力に頼らずに自ら前進すること)を組み合わせたものである。彼らは、人々は2回目の推定を対照的な情報に基づいて行うことで、最初の推定値を大幅に改善できるはずだと考えた。したがって、最初の推定値を生成するために使用されたものとは異なる仮定と知識に基づくこれらの2回目の推定値は、最初の推定値とは異なる誤差(系統誤差とランダム誤差の両方)を持つため、平均的な判断の精度が向上する。分析的な観点から言えば、弁証法的推定値があまりかけ離れておらず、最初の推定値と弁証法的推定値の誤差が異なる限り、弁証法的ブートストラップ法は精度を向上させるはずである。これを検証するために、ヘルツォークとヘルトヴィヒは、参加者に、2回目の推定を求められることを知らされないまま、歴史上の出来事(例えば、電気が発見された時期)に関する一連の日付推定を行うよう求めました。次に、参加者の半数には、単に2回目の推定を行うよう求めました。残りの半数には、反対の立場から考える戦略を用いて弁証法的な推定を行うよう求めました(最初の推定を基準点として使用)。具体的には、参加者は、最初の推定が間違っていたと想像し、どのような情報が間違っていた可能性があるか、この代替情報が何を示唆するか、それによって推定が過大評価になるか過小評価になるか、そして最後に、この観点に基づいて新しい推定はどうなるかを検討するよう求められました。この研究の結果、弁証法的なブートストラップは、群衆の知恵(各参加者の最初の推定とランダムな他の参加者の推定の平均)を上回ることはなかったものの、単に個人に2つの推定を求めるよりも優れた推定値が得られることが明らかになりました。[ 30 ]
HirtとMarkman(1995)は、参加者が判断を改善するために反対の選択肢を検討する戦略に限定される必要はないことを発見した。研究者は参加者に代替案を検討するよう求めた(単に「反対」の選択肢に焦点を当てるのではなく、もっともらしい代替案として操作的に定義した)。その結果、代替案を検討するだけで判断が改善されることがわかった。[ 31 ]
すべての研究が「内なる群衆」が判断を向上させることを支持しているわけではない。アリエリーらは参加者に、真偽問題への回答とそれらの回答に対する自信に基づいて回答するよう求めた。彼らは、個人間の判断推定値を平均すると推定値が大幅に改善される一方で、同じ個人が繰り返し行った判断推定値を平均しても推定値が大幅に改善されないことを発見した。[ 32 ]
群衆の知恵に関する研究では、群衆の平均が個人の判断よりも優れているのは、個人のノイズが排除されるためだと一般的に考えられているが、[ 33 ]この説明は、個々の判断が互いに独立していることを前提としている。 [ 8 ] [ 24 ]したがって、群衆は多様な意見やイデオロギーで構成されている場合、最良の決定を下す傾向がある。
平均化は、各人の回答に異なる影響を与えるランダムな誤差を排除できますが、集団全体の意見に同じように影響を与える系統的な誤差を排除することはできません。たとえば、集団の知恵の手法は、認知バイアスを補償するとは期待できません。[ 34 ] [ 35 ]
スコット・E・ペイジは多様性予測定理を提唱した。「集団予測の二乗誤差は、平均二乗誤差から予測多様性を引いた値に等しい」。したがって、集団内の多様性が大きいほど、群衆の誤差は小さくなる。[ 36 ]
ヘニング・ピエズンカとオリバー・シルケは、群衆の知恵を活用する目的で意見の集約に参加する人々は、しばしば自分の正直な意見を共有せず、戦略的な投票を行うという実験的証拠を提示している。[ 37 ]
ミラーとスティーヴァーズは、参加者間のコミュニケーションを制限することで、群衆の知恵実験における個々の回答の独立性を低下させた。参加者は、米国大統領の順序などの一般知識に関する質問に対して、順序付けの質問に答えるよう求められた。質問の半分については、各参加者は他の参加者が提出した順序から始め(そしてその事実を知らされた)、残りの半分については、ランダムな順序から始め、どちらの場合も(必要に応じて)正しい順序に並べ替えるよう求められた。参加者が他の参加者の順位から始めた回答は、ランダムに開始した条件からの回答よりも平均して正確であった。ミラーとスティーヴァーズは、参加者間の項目レベルの知識の違いがこの現象の原因であり、参加者は以前の参加者の知識を自身の知識と統合および拡張したと結論付けている。[ 38 ]
群衆は、地理や数学に関する質問のように、提示された質問に対する正しい答えがある場合に最も効果的に機能する傾向があります。[ 39 ]正確な答えがない場合、群衆は恣意的な結論に達する可能性があります。[ 40 ]群衆の知恵アルゴリズムは、個々の回答が、未知の正しい答えの周りに近接し、対称的な分布を示す場合に成功します。この対称性により、平均化プロセス中に回答のエラーが互いに打ち消し合います。逆に、これらのアルゴリズムは、正しい回答のサブセットが限られており、ランダムなバイアスに対抗できない場合に失敗する可能性があります。この課題は、多くの場合さまざまなレベルの専門知識を持つ個人が匿名で回答するオンライン環境で特に顕著です。一部の「群衆の知恵」アルゴリズムは、期待値最大化投票技術を使用してこの問題に対処します。wisdom- in -the-crowd (WICRO) アルゴリズム[ 35 ]は、1回のパスの分類ソリューションを提供します。このアルゴリズムは、個人間の相対的な「距離」を評価することで、個人の専門知識レベルを測定します。具体的には、専門分野内の質問に答える際に、回答が互いに相対的に「近い」と想定することで、専門家を特定します。このアプローチにより、特定のドメインに精通している参加者がごく少数しかいないシナリオでも、アルゴリズムが専門知識レベルを識別する能力が向上し、匿名のオンラインインタラクション中に発生する可能性のあるバイアスの影響が軽減されます。[ 35 ] [ 41 ]
群衆の知恵の効果は容易に損なわれる。社会的影響により、群衆の回答の平均が不正確になる可能性があるが、幾何平均と中央値はより頑健である。[ 42 ]これは、個人の不確実性と推定に対する信頼を知ることに依存する。あるトピックについて知識のある個人の平均回答は、そのトピックについて何も知らない個人の平均とは異なる。知識のある意見と経験のない意見の単純平均は、回答の不確実性と信頼に基づいて平均の重み付けを行う平均よりも精度が低くなる。
群衆の知恵を活用する組織は、自らのメンバーの学習を阻害する可能性がある。[ 43 ]組織が群衆の知恵を活用して意思決定を行う場合、反対意見は軽視され、実行に移されない。その結果、反対意見を表明した投票者は、意見が行動に移されないため、フィードバックを受け取ることができない。
スイス連邦工科大学が行った実験では、複数の人が一緒に質問に答えるよう求められた場合、合意に達しようとする傾向があり、その結果、回答の正確性が低下することがよくあることがわかった。この影響に対処するための提案の1つは、グループに多様な背景を持つ人々を含めることである。[ 40 ]
グッドジャッジメントプロジェクトの研究によると、予測投票で組織されたチームは、時期尚早な合意を避け、予測市場で生成されるものよりも正確な集計確率推定値を生成することができることが示された。[ 44 ]
{{cite web}}: CS1 maint: 複数名: 著者リスト (リンク) CS1 maint: 数値名: 著者リスト (リンク){{cite web}}: CS1 maint: 複数名: 著者リスト (リンク) CS1 maint: 数値名: 著者リスト (リンク)