ベスト・ワースト・スケーリング(BWS)[ 1 ]手法は、選択モデリング(または離散選択実験(DCE))を伴い、1987年にアルバータ大学の教員であったジョーダン・ルヴィエールによって考案されました。一般的に、BWSでは、調査回答者にマスターリストから項目のサブセットが提示され、最良の項目と最悪の項目(または最も重要で、最も重要で、最も魅力的で、最も魅力的で、など)を示すように求められます。このタスクは、特定の項目のサブセットを体系的に変更しながら、通常は統計的設計に従って複数回繰り返されます。分析は、より一般的なDCEと同様に、回答者がランダム効用モデル(RUM)に従って選択を行うと仮定して行われます。RUMは、回答者が項目Aを項目Bよりもどれだけ好むかの推定値は、繰り返しの選択において項目Aが項目Bよりも選択される頻度によって提供されると仮定します。したがって、選択頻度は、関連する潜在尺度上の効用を推定します。 BWSは基本的に、下位の項目に特化した追加の質問を必要とせずに、この尺度の下位層においてより多くの選択肢情報を提供することを目的としている。
ルヴィエールはこのアイデアを、アンソニー・A・J・マーリーが博士論文で行った初期の研究に由来するものとしている。マーリーは1960年代にダンカン・ルースと共に、効用理論を公理化するための数学心理学と精神物理学における画期的な研究の多くを生み出した。マーリーは特定の種類のランキングデータを公理化する際に問題に直面し、論文の考察の中で、リスト内の「劣った」項目と「優れた」項目の検討が今後の研究にとって有益なテーマになるかもしれないと推測した。その後、このアイデアは30年間停滞し、1990年代初頭に最初のワーキングペーパーや出版物が発表された。理論、方法、応用を解説した決定版の教科書は、ジョーダン・ルヴィエール(南オーストラリア大学) 、テリー・N・フリン(TF Choices Ltd.)、アンソニー・A・J・マーリー(ビクトリア大学および南オーストラリア大学)によって2015年9月にケンブリッジ大学出版局から出版された。[ 1 ]本書は、さまざまな学術分野や実務分野からのばらばらの研究をまとめ、再現や実施上の誤りを回避することを目的としています。3 人の著者は、(個別に、また共同で)すでに、BWS理論[ 2 ] [ 3 ] [ 4 ]、実践[ 5 ] [ 6 ] 、および健康[ 5 ]、ソーシャル ケア[ 7 ] 、マーケティング[ 6 ]、輸送、投票[ 8 ] 、環境経済学[ 9 ]における多数の応用について記述した主要な学術査読付き論文を多数発表しています。しかし、この方法は現在、より広範な研究者や実務家の間で人気があり、他の研究者は、学生による授業評価[ 10 ]、ワインのマーケティング[ 11 ] 、 ADHD治療薬に対する懸念の定量化[ 12 ] 、環境の持続可能性の重要性[ 13 ] 、遺伝子検査の優先順位付け[ 14 ]、自閉症介入目標に対する介護者の好みなど、さまざまな分野でその使用を模索しています。[ 15 ]最後の研究は、自閉症介入研究に最良・最悪尺度法を適用した最初の事例であり、自閉症研究において利害関係者の視点や経験を理解するために一般的に用いられる、主にインタビューに基づく定性的な方法とは対照的に、介入目標に対する利害関係者の好みを引き出すための定量的アプローチを導入したものである。
ベスト・ワースト・スケーリング(BWS)は、コンジョイント分析や離散選択実験(DCE)と密接に関連しており、ランダム効用理論という共通の理論的基盤を共有しています。[ 16 ] [ 17 ] [ 18 ] [ 19 ]コンジョイント法と同様に、BWSは、スケールバイアスや文脈効果の影響を受けやすい直接的な評価やランキングに頼るのではなく、構造化された実験設計の下で回答者が行った選択を観察することによって、属性や項目の相対的な重要性を推測します。[ 20 ] [ 21 ]
しかし、BWSはタスク構造と認知的要求の両方において、従来のコンジョイント分析とは異なります。BWSタスクでは、回答者は複数の属性プロファイルのセットから好ましいオプションを1つ選択するのではなく、単一のセット内で最も好ましい項目と最も好ましくない項目(または最も重要な項目と最も重要でない項目)を特定するように求められます。[ 22 ] [ 23 ]この2つの選択により、タスクごとに多くの情報が得られ、特に健康や社会福祉の研究など、プロファイル全体を対象としたコンジョイントタスクが認知的に負担となる可能性がある状況では、統計的効率を向上させることができます。[ 24 ] [ 25 ]
方法論的には、BWS は、回答者がペアの極値判断を行う選択ベースのコンジョイント分析の特殊なケースと見なすことができ、結果として得られるデータは、コンジョイント分析や離散選択分析で一般的に使用される多項ロジット、混合ロジット、または関連モデルを使用して分析できます。[ 26 ] [ 27 ] [ 28 ]これらの類似性から、BWS は、コンジョイント分析の簡略化された、またはより焦点を絞った代替手段として説明されることがあり、特に属性が抽象的、多数、または現実的なプロファイルに組み合わせるのが難しい場合の選好の引き出しに適しています。[ 29 ] [ 30 ]
応用研究では、BWSは、健康、社会福祉、政策、交通、環境経済学など、従来のコンジョイント分析が非現実的な場面で採用されており、コンジョイント分析から得られる効用と比較可能な共通の定量的尺度上に選好推定値を置くことができる。[ 31 ] [ 32 ]
BWSには2つの異なる目的があります。データ収集の方法として、そして/または3つ以上の項目に直面したときに人々がどのように選択を行うかの理論としてです。この区別は、この方法を説明するためにmaxdiffという用語が誤用され続けていることを考えると重要です。MarleyとLouviereが指摘するように、maxdiffは、人々がどのように選択を行うかについて非常に具体的な仮定を持つ、長年確立された学術的な数学理論です。[ 2 ]回答者は、表示されたセット内のすべての可能な項目のペアを評価し、好みまたは重要性の最大差を反映するペアを選択することを想定しています。
回答者がA、B、C、Dの4つの項目を評価する場合を考えてみましょう。回答者がAが最高でDが最低だと答えた場合、これらの2つの回答から、考えられる6つの暗黙の比較のうち5つがわかります。
推測できない唯一のペア比較はB対Cです。5つの項目から選択する場合、MaxDiff質問法は、暗黙の10個のペア比較のうち7個について情報を提供します。したがって、BWSはペア比較法の変形と考えることができます。
しかし、回答者はさまざまな方法で最良-最悪データを生成することができます。可能なすべてのペアを評価する代わりに(maxdiffモデル)、n 個の項目から最良を選択し、残りの n-1 個から最悪を選択するか、その逆を行う可能性があります。あるいは、まったく別の方法を使用する可能性もあります。したがって、maxdiff が BWS のサブセットであることは明らかです。maxdiff モデルは、BWS のさまざまな推定量の特性を証明するのに役立つことが証明されています。[ 2 ] [ 3 ] [ 4 ]しかし、人間が実際に最良および最悪データを提供する方法の説明としてのその現実性は、次の理由で疑問視される可能性があります。項目の数が増えると、可能なペアの数は乗法的に増加します。n 個の項目は n(n-1) 個のペアを生成します (最良-最悪順序が重要)。回答者がすべての可能なペアを評価すると仮定するのは強い仮定であり、14 年間のプレゼンテーションで、3 人の共著者は、最良の選択肢と最悪の選択肢を決定するためにこの方法を使用したと認めたコースや会議の参加者を事実上一度も見つけていません。[ 1 ]事実上全員が、逐次モデル (最良の次に最悪の場合、または最悪の次に最良の場合) を使用していると認めました。[ 33 ]
初期の研究(ルヴィエール自身によるものを含む)では、BWSを指すのにmaxdiffという用語が使われていましたが、マーリーがこの手法の開発チームに加わったことで、ヨーロッパとアジア太平洋地域(北米では引き続きmaxdiffという用語が使われている)では正しい学術用語が普及しました。実際、maxdiffの機能を宣伝し続けているにもかかわらず、離散選択maxdiffルーチンの主要ソフトウェアメーカーが実際にパラメータ推定にmaxdiffモデルを実装しているかどうかは未解決の問題です。
BWS の 2 つ目の用途は、データ収集の方法 (人間が最良および最悪のアイテムをどのように生成するかの理論としてではなく) としてです。特にウェブベースの調査の時代において、BWS は、(1) すべての回答者に同じ方法で最良および最悪のデータを提供するよう強制する (たとえば、最初に最良を尋ね、選択されたオプションをグレーアウトし、次に最悪を尋ねる)、(2) 「内部ランキング」を収集するために BWS 質問が繰り返される場合、完全なランキングを収集できる、といった体系的な方法でデータを収集するために使用できます。多くの文脈において、データ収集のための BWS は、データ拡張 (より多くの選択肢セットを持つ条件付きロジットモデルを推定するため) や従来の順位付けロジットモデルを推定するために、そのようなデータを取得する方法としてのみ考えられてきました。[ 34 ]
この手法の名称変更は、maxdiff スケーリングが BWS であるが、BWS が必ずしも maxdiff ではないことを明確にするために、Louviere が著書の準備中に 2 人の主要な貢献者 (Flynn と Marley) と協議して決定し、Flynn による記事で発表された。[ 35 ]この論文では、実際には BWS には 3 つのタイプ (「ケース」) があることも明確にする機会として取り上げられた。ケース 1 (「オブジェクト ケース」)、ケース 2 (「プロファイル ケース」)、ケース 3 (「マルチ プロファイル ケース」)。これら 3 つのケースは、提供される選択肢項目の複雑さにおいて大きく異なっている。
ケース 1 では、態度表明、政策目標、マーケティング スローガン、または属性やレベル構造を持たないあらゆる種類の項目を提示します。これは主に、評価 (リッカート) 尺度データに影響を与えることが知られている尺度バイアスを回避するために使用されます。[ 36 ] [ 37 ]これは、回答者が一連の記述に帰属する重要度や同意度を引き出す場合、および研究者が項目同士が競合するようにしたい場合 (回答者が複数の項目を同じ重要度として簡単に評価できないようにするため) に特に役立ちます。
ケース 2 は健康分野で主流となっており、項目は選択モデル作成者に馴染みのあるタイプの単一のプロファイルを記述する属性レベルです。回答者はプロファイル間で選択するのではなく、プロファイル内で最良と最悪(最も良いと最も悪い)の選択をしなければなりません。したがって、携帯電話の例では、選択肢は特定の電話の最も受け入れられる機能と最も受け入れられない機能になります。ケース 2 は、従来のマルチプロファイル離散選択実験が難しい高齢者[ 38 ] [ 39 ] 、高齢の介護者[ 40 ] 、子供[ 41 ]などの脆弱なグループの間で好みを引き出すのに効果的であることが証明されています。実際、ケース 2 と DCE を単一モデルで初めて比較したところ、BWS タスクでは回答者の大多数(高齢)が使用可能なデータを提供したのに対し、DCE では約半数しか提供しなかったことがわかりました。[ 38 ]
ケース3は、選択モデル開発者にとっておそらく最も馴染み深いもので、離散選択モデルの単なる拡張です。プロファイルの数は3つ以上でなければならず、回答者は購入したいプロファイルを単純に選択するのではなく、最良のプロファイルと最悪のプロファイルを選択します。
ケース 1 BWS 研究では、通常、バランス型不完全ブロック設計(BIBD) を使用します。これにより、すべての項目が同じ回数出現し、すべての項目が他のすべての項目と同じ回数競合することになります。これらの特徴は、回答者が項目に関する誤った情報 (設計者が「本当に」関心を持っている項目) を推測することを防ぐため魅力的です。[ 1 ]また、尺度の最上位または最下位で重要度/顕著性に「同点」が発生しないことも保証されます。
ケース2 BWS研究では、直交主効果計画(OMEP)または効率的なデザインを使用できますが、現在まで前者が主流となっています。
ケース3のBWS研究では、DCEで一般的に使用される設計のいずれのタイプでも使用できますが、 BWSタスクが意味を成すためには、選択肢セット内のプロファイル(選択肢)の数が3つ以上である必要があります。
スティーブ・コーエンは、 2002年にバルセロナで開催されたESOMAR会議で発表した「市場セグメンテーションの刷新:古い問題を解決するための新しいツール」と題する論文で、 BWSをマーケティングリサーチの世界に紹介しました。この論文は、同会議で最優秀論文にノミネートされました。2003年、ウルグアイのプンタ・デル・エステで開催されたESOMARラテンアメリカ会議で、スティーブと共著者のレオプルド・ネイラ博士は、BWSの結果を評価尺度法で得られた結果と比較しました。この論文は、同会議で最優秀方法論論文賞を受賞しました。同年後半には、2003年のすべてのESOMAR会議で最優秀論文に贈られるジョン・アンド・メアリー・グッドイヤー賞を受賞し、その後、ESOMARが発行した「Excellence in International Research 2004」の巻頭論文として掲載されました。 2003年のSawtooth Softwareカンファレンスにおいて、スティーブ・コーエン氏の論文「最大差分スケーリング:セグメンテーションにおける重要度と選好度の改善された尺度」が最優秀プレゼンテーションに選ばれました。コーエン氏とSawtooth Software社長のブライアン・オーム氏は、MaxDiffをSawtoothパッケージに含めるべきであるという点で意見が一致し、同年後半に導入されました。その後、2004年には、コーエン氏とオーム氏は、マーケティングリサーチ誌に掲載された論文「あなたの好みは?アンケート回答者に好みを尋ねることで、新たなスケーリング決定が生まれる」で、AMA(米国マーケティング協会)のデビッド・K・ハーディン賞を受賞しました。
これと並行して、エマ・マッキントッシュとジョーダン・ルヴィエールは、2002年の医療経済学者研究グループ会議で、医療コミュニティにBWS(ケース2)を紹介しました。これがきっかけとなり、フリンとの共同研究が始まり、最終的には、BWS推定量の特性を証明するためにルヴィエールと独自に研究を始めていたマーリーとの連携へと繋がりました。3つのケースの人気は学問分野によって大きく異なり、ケース1はマーケティングと食品研究で人気があり、ケース2は主に医療分野で採用され、ケース3はDCEを既に使用しているさまざまな分野で使用されています。多くの分野でBWSには実際には3つのケースがあるということが十分に理解されていなかったことが、3人の主要開発者が教科書を執筆するきっかけの一つとなりました。
本書には、BWSの歴史と3つの事例を要約した序章があり、回答者が意思決定の理論(プロセス)を理解するためにBWSを使用するのか、それとも単に体系的にデータを収集するために使用するのかを検討する必要がある理由が述べられています。続いて、各事例ごとに1章ずつ、計3章が続き、それぞれの直感と応用について詳しく解説しています。その後、マーリーの研究をまとめ、主要な推定量の特性を証明し、いくつかの未解決問題を提示する章が続きます。さらに分析すべき未解決問題を提示した後、9章(各事例につき3章ずつ、さまざまな分野からの応用を記述)が続きます。
あらゆる種類のBWS研究を実施する際の基本的な手順は以下のとおりです。
効用関数の推定は、様々な方法を用いて行われる。
BWSアンケートは、ほとんどの回答者にとって比較的理解しやすいものです。さらに、人間は重要度や好みが中程度の項目を区別するよりも、極端な項目を判断する方がはるかに得意です。また、回答は好みの強さを表明するのではなく、項目を選択することなので、尺度の使用によるバイアスが生じる余地はありません。
回答者はこれらの評価尺度を非常に簡単だと感じていますが、結果的にすべてが「かなり重要」と示される傾向があり、データはあまり実用的ではありません。一方、BWSは回答者に選択肢の中から選ばせる一方で、評価対象項目の相対的な重要度を示すランキングを提供します。また、以下の結果も得られます。
最良・最悪尺度法では、少なくとも2つのデータセットの収集が必要です。最低限、最良と最悪の1つ、場合によっては追加のランク(2番目に良い、2番目に悪いなど)も収集します。これらのデータをどのように組み合わせるかという問題は重要です。初期の研究では、最良は最悪の逆であると仮定されていました。つまり、回答者はすべての項目を内部的にランク付けし、特定の質問に対して最も高い/最も低いランクの項目を選択するだけだと考えられていました。最近の研究では、状況によってはそうではないことが示唆されています。たとえば、人は(属性間のトレードオフ)については従来の経済理論に従って最良を選択する一方で、属性による排除戦略(1つの属性で単純に受け入れられない項目を最悪として選択する)を使用して最悪を選択する可能性があります。このような異なる決定ルールが存在する場合、データをどのように組み合わせるかを知ることは不可能になります。つまり、人はランキングを下げる際に、どの時点で「経済トレードオフ」から「属性による排除」に移行するのかがわからなくなります。
これは、BWSにおけるデータ拡張の動機付けにとっては明らかな問題となるが、プロセス(意思決定)を理解するための手段としてBWSを用いる場合には必ずしも問題とはならない。特に心理学者は、さまざまな種類の意思決定に強い関心を持つだろう。また、マーケティング担当者は、特定の製品に許容できない機能があるかどうかを知りたいと思うかもしれない。異なる意思決定ルールがいつ発生するのか、そしてそのような異なるソースからのデータを組み合わせられるのか、あるいは組み合わせられるのかどうかについて、現在研究が進められている。
BWSもまた、表明選好法のすべてに共通する欠点を抱えている。選好が現実世界での選択(顕示選好)と一致するかどうかは不明である。顕示選好(通常は実際の市場決定)が利用可能な場合もあり、BWSの選択を検証することができる。しかし、多くの場合、健康分野では顕示選好データがなく、検証は不可能と思われる。最近では、視線追跡や反応時間などの生理学的データを使用してSPデータを検証する試みが行われている。[ 43 ]初期の研究では、反応時間モデルは医療分野でBWSモデルの結果と一致することが示唆されているが、他の文脈ではさらなる研究が必要である。