
A/B テスト(バケット テスト、スプリット ラン テスト、スプリット テストとも呼ばれる)は、ユーザー エクスペリエンスの研究手法です。[1] A/B テストは、通常 2 つのバリアント (A と B) を含むランダム化実験で構成されますが、 [2] [3] [4]この概念は、同じ変数の複数のバリアントに拡張することもできます。統計の分野で使用されている統計的仮説検定または「2 サンプル仮説検定」の適用が含まれます。A/B テストは、単一の変数の複数のバージョンを比較する方法です。たとえば、バリアント A とバリアント B に対する被験者の反応をテストし、どちらのバリアントがより効果的かを判断します。[5]
多変量テストまたは多項式テストは A/B テストに似ていますが、同時に 2 つ以上のバージョンをテストしたり、より多くのコントロールを使用したりする場合があります。単純な A/B テストは、調査データ、オフライン データ、その他のより複雑な現象でよく見られる、観察、準実験、またはその他の非実験的な状況には有効ではありません。
意味
「A/B テスト」とは、単純なランダム化比較実験の略称で、単一のベクトル変数のサンプル数 (例: A と B) を比較するものです。[1] A/B テストは、特に 2 つのバリアントのみを使用する場合、最も単純な形式の比較実験であると広く考えられています。ただし、テストにバリアントを追加すると、複雑さが増します。[6]
次の例は、単一の変数を使用した A/B テストを示しています。
ある会社が 2,000 人の顧客データベースを持っていて、自社の Web サイトを通じて売上を上げるために割引コード付きのメール キャンペーンを作成することにしたとします。会社は、異なる CTA (顧客に何か行動を起こすよう促すコピーの部分。販売キャンペーンの場合は購入) と識別用プロモーション コードを含む 2 つのバージョンのメールを作成します。
- 1,000人に「オファーは今週の土曜日までです!コードA1を使用してください」という行動喚起のメールを送ります。
- 残りの 1,000 人には、「オファーはまもなく終了します。コード B1 を使用してください」という行動喚起の電子メールが送信されます。
- 電子メールのコピーとレイアウトのその他の要素はすべて同一です。
次に、プロモーション コードの使用状況を分析して、どのキャンペーンの成功率が高いかを監視します。コード A1 を使用したメールの応答率は 5% (メールを受け取った 1,000 人のうち 50 人がコードを使用して製品を購入)、コード B1 を使用したメールの応答率は 3% (受信者の 30 人がコードを使用して製品を購入) です。したがって、この例では最初の CTA の方が効果的であると判断し、今後の販売で使用します。より微妙なアプローチとしては、統計テストを適用して、A1 と B1 の応答率の差が統計的に有意であるかどうか(つまり、差が実際に存在し、再現可能であり、偶然によるものではない可能性が高いかどうか) を判断することが挙げられます。[7]
上記の例では、テストの目的は、顧客に購入を促すのにどの方法が最も効果的かを判断することです。ただし、テストの目的が、どのメールのクリック率(つまり、メールを受け取った後に実際に Web サイトをクリックする人の数) が高くなるかを確認することだった場合、結果は異なっていた可能性があります。
たとえば、コード B1 を受け取った顧客の多くがウェブサイトにアクセスしたとしても、CTA にプロモーションの終了日が明記されていないため、多くの顧客はすぐに購入する必要性を感じないかもしれません。したがって、テストの目的が単にどのメールがウェブサイトへのトラフィックを増やすかを確認することであった場合、コード B1 を含むメールの方が成功していた可能性があります。A/B テストでは、販売数、クリック率の変換、サインアップ/登録者数など、測定可能な結果が明確に定義されている必要があります。[8]
共通テスト統計
2 サンプル仮説検定は、実験で 2 つのコントロール ケースによってサンプルが分割される 2 つのサンプルを比較するのに適しています。Z検定は、正規性と既知の標準偏差に関する厳格な条件下で平均を比較するのに適しています。スチューデントの t 検定は、より少ない仮定がされている緩和された条件下で平均を比較するのに適しています。ウェルチの t 検定は、仮定が最も少ないため、メトリックの平均が最適化される2 サンプル仮説検定で最も一般的に使用される検定です。最適化される変数の平均は、推定量として最も一般的に選択されますが、他のものも定期的に使用されます。
クリックスルー率などの2 つの二項分布を比較する場合は、フィッシャーの正確検定を使用します。
セグメンテーションとターゲティング
A/Bテストでは、通常、すべてのユーザーに対して同じバリアント(ユーザーインターフェイス要素など)を均等な確率で適用します。ただし、状況によっては、バリアントに対する反応が不均一になることがあります。つまり、バリアントAは全体的に高い反応率を示すかもしれませんが、バリアントBは顧客ベースの特定のセグメント内でさらに高い反応率を示す可能性があります。[10]
たとえば、上記の例では、性別別の回答率の内訳は次のようになります。
この場合、バリアント A は全体的に応答率が高かったものの、バリアント B は男性に対して実際に応答率が高かったことがわかります。
その結果、企業は A/B テストの結果としてセグメント化された戦略を選択し、将来的にはバリアント B を男性に、バリアント A を女性に送信する可能性があります。この例では、セグメント化された戦略により、予想される応答率が から に増加し、 30 % の増加となります。
A/Bテストからセグメント化された結果が期待される場合、テストは性別などの主要な顧客属性に均等に分散されるように最初から適切に設計する必要があります。つまり、テストには(a)男性と女性の代表的なサンプルが含まれ、(b)男性と女性を各「バリアント」(バリアントAとバリアントB)にランダムに割り当てる必要があります。そうしないと、実験の偏りが生じ、テストから不正確な結論が導き出される可能性があります。[11]
このセグメンテーションとターゲティングのアプローチは、単一の顧客属性ではなく複数の顧客属性(たとえば、顧客の年齢や性別)を含めるようにさらに一般化でき、テスト結果に存在する可能性のあるより微妙なパターンを識別できます。
トレードオフ
良い点
A/B テストの結果は簡単に解釈でき、あるオプションを他のオプションよりも直接テストするため、ユーザーが何を好むかを明確に把握するために使用できます。実際のユーザー行動に基づいているため、2 つのオプションのうちどちらがより効果的かを判断するときに特にデータが非常に役立ちます。
A/B テストは、非常に具体的なデザイン上の疑問に対する答えも提供します。その一例が、Google のハイパーリンクの色を使った A/B テストです。収益を最適化するために、Google は数十種類のハイパーリンクの色をテストし、ユーザーがどの色をクリックする傾向があるかを調べました。[12]
マイナス面
A/B テストは分散に敏感です。標準誤差を減らして統計的に有意な結果を出すためには、大きなサンプル サイズが必要です。人気のオンライン ソーシャル メディア プラットフォームなど、アクティブ ユーザーが豊富なアプリケーションでは、大きなサンプル サイズを取得するのは簡単です。その他のケースでは、実験登録期間を長くすることで大きなサンプル サイズが得られます。ただし、Microsoft が考案した、実験前データを使用した制御実験 (CUPED) という手法を使用すると、実験開始前の分散を考慮できるため、統計的に有意な結果を出すために必要なサンプル数が少なくなります。[13] [14]
A/B テストは実験という性質上、テストによってビジネス指標にマイナスの影響や影響がないなどの望ましくない結果が生成された場合、時間とリソースが無駄になるリスクが生じます。
2018年12月、13の異なる組織(Airbnb、Amazon、Booking.com、Facebook、Google、LinkedIn、Lyft、Microsoft、Netflix、Twitter、Uber、スタンフォード大学)の大規模なA/Bテストの経験を持つ代表者が、SIGKDD Explorationsペーパーで主な課題をまとめました。[15] 課題は、分析、エンジニアリングと文化、従来のA/Bテストからの逸脱、データ品質の4つの領域に分類できます。
歴史
A/B テストが最初に使用された時期を明確に特定することは困難です。ホメオパシー薬の有効性を評価するための最初のランダム化二重盲検試験は 1835 年に行われました。 [16]現代の A/B テストと比較される広告キャンペーンの実験は、20 世紀初頭に始まりました。[17]広告の先駆者であるクロード・ホプキンスは、キャンペーンの効果をテストするためにプロモーション クーポンを使用しました。しかし、ホプキンスがScientific Advertisingで説明したこのプロセスには、統計的仮説検定で使用される統計的有意性や帰無仮説などの概念が組み込まれていませんでした。[18]サンプル データの有意性を評価するための現代の統計的手法は、同じ時期に別途開発されました。この作業は、1908 年にウィリアム・シーリー・ゴセットがZ 検定を変更してスチューデントの t 検定を作成したときに行われました。[19] [20]
インターネットの成長に伴い、人口をサンプリングする新しい方法が利用可能になりました。Google のエンジニアは、検索エンジンの結果ページに表示される結果の最適な数を決定するために、2000 年に最初の A/B テストを実行しました。[5]最初のテストは、読み込み時間の遅さから生じた不具合のために失敗しました。その後、A/B テストの研究はより進歩しましたが、基礎と基本原則は一般的に同じままであり、Google の最初のテストから 11 年後の 2011 年に、Google は 7,000 を超えるさまざまな A/B テストを実行しました。[5]
2012年、検索エンジンMicrosoft Bingに携わるマイクロソフトの社員が、広告の見出しを表示するさまざまな方法をテストする実験を行いました。数時間で、代替フォーマットはユーザーエクスペリエンス指標に影響を与えることなく、収益を12%増加させました。[4]現在、マイクロソフトやグーグルなどの大手ソフトウェア企業は、それぞれ年間10,000件以上のA/Bテストを実施しています。[4]
A/Bテストは、特定のニッチ分野では哲学やビジネス戦略の変化であると主張する人もいますが、そのアプローチは、さまざまな研究分野で一般的に使用されている被験者間デザインと同一です。[21] [22] [23] Web開発の哲学としてのA/Bテストは、この分野を証拠に基づく実践に向けたより広範な動きと一致させます。
現在、多くの企業がマーケティング上の意思決定を行う際に「計画的実験」アプローチを採用しており、関連するサンプル結果がポジティブなコンバージョン結果を改善できると期待している。[要出典]この分野のツールと専門知識が増加するにつれて、この手法はますます一般的になりつつある。[24]
アプリケーション
オンラインソーシャルメディアにおけるA/Bテスト
A/Bテストは、 LinkedIn、Facebook、Instagramなどの大規模なソーシャルメディアサイトで、新機能や新製品などのオンライン機能に対するユーザーのエンゲージメントと満足度を把握するために使用されています。A/Bテストは、ユーザーがオフラインのときのネットワーク効果、オンラインサービスがユーザーの行動に与える影響、ユーザーが互いに影響を与える方法などのテーマに関する複雑な実験を行うためにも使用されています。[25]
電子商取引のA/Bテスト
電子商取引のウェブサイトでは、購入ファネルはA/Bテストの適切な候補です。離脱率がわずかに低下しただけでも、売上が大幅に増加する可能性があるからです。コピーテキスト、レイアウト、画像、色などの要素をテストすることで、大幅な改善が見られる場合もありますが、 [26]常にそうとは限りません。これらのテストでは、2つのバージョンのうちどちらが好ましいかを見つけることが目的であるため、ユーザーは2つのバージョンのうちの1つだけを見ることになります。[27]
製品価格設定のA/Bテスト
A/B テストは、製品の適正価格を決定するために使用できます。これは、新製品や新サービスが発売されるときにおそらく最も難しい作業の 1 つです。A/B テスト (特にデジタル商品に有効) は、どの価格帯と提供内容が総収益を最大化するかを調べる優れた方法です。
政治的A/Bテスト
A/Bテストは政治キャンペーンでも使用されています。2007年、バラク・オバマの大統領選挙キャンペーンは、オンラインでの注目を集め、有権者が大統領候補に何を求めているかを理解するためにA/Bテストを使用しました。 [28]たとえば、オバマのチームは、ユーザーがニュースレターにサインアップできるように、Webサイトで4つの異なるボタンをテストしました。さらに、チームはユーザーを引き付けるために6つの異なる付随画像を使用しました。A/Bテストを通じて、スタッフは有権者を効果的に引き付け、さらなる関心を集める方法を決定することができました。[28]
HTTPルーティングとAPI機能のテスト

A/B テストは、API の新しいバージョンを展開するときに非常に一般的です。[29]リアルタイムのユーザー エクスペリエンス テストでは、HTTP レイヤー 7 リバース プロキシは、HTTPトラフィックのN % がバックエンド インスタンスの新しいバージョンに送られ、残りの100-N % の HTTP トラフィックがバックエンド HTTP アプリケーション サービスの (安定した) 古いバージョンに送信されるよう構成されます。[29]これは通常、新しいバックエンド インスタンスへの顧客の露出を制限するために行われ、新しいバージョンにバグがある場合、ユーザー エージェントまたはクライアント全体のN %のみが影響を受け、その他は安定したバックエンドにルーティングされます。これは一般的なイングレス制御メカニズムです。[29]
参照
参考文献
- ^ ab Young, Scott WH (2014 年 8 月). 「A/B テストによる図書館ユーザー エクスペリエンスの向上: 原則とプロセス」. Weave: Journal of Library User Experience . 1 (1). doi : 10.3998/weave.12535642.0001.101 . hdl : 2027/spo.12535642.0001.101 .
- ^ Kohavi, Ron; Xu, Ya; Tang, Diane (2000). 信頼できるオンライン制御実験:A/Bテストの実践ガイド。ケンブリッジ大学出版局。2021年10月22日時点のオリジナルよりアーカイブ。 2021年10月22日閲覧。
- ^ Kohavi, Ron; Longbotham, Roger (2023). 「オンライン制御実験と A/B テスト」。Phung, Dinh; Webb, Geoff; Sammut, Claude (編)。機械学習とデータサイエンスの百科事典。Springer。pp. 891– 892。doi :10.1007 / 978-1-4899-7502-7_891-2。ISBN 978-1-4899-7502-7. 2023年4月21日時点のオリジナルよりアーカイブ。2023年4月21日閲覧。
- ^ abc Kohavi, Ron; Thomke, Stefan (2017年9月~10月). 「オンライン実験の驚くべき力」. Harvard Business Review . pp. 74– 82. 2021年8月14日時点のオリジナルよりアーカイブ。2020年1月27日閲覧。
- ^ abc Hanington, Jenna (2012年7月12日). 「A/BテストのABC」. Pardot . 2015年12月24日時点のオリジナルよりアーカイブ。 2016年2月21日閲覧。
- ^ Kohavi, Ron; Longbotham, Roger (2017). 「オンライン制御実験と A/B テスト」。機械学習とデータマイニングの百科事典。pp . 922– 929。doi : 10.1007/978-1-4899-7687-1_891。ISBN 978-1-4899-7685-7。
- ^ 「A/B テストの背後にある数学」。developer.amazon.com。2015年 9 月 21 日時点のオリジナルよりアーカイブ。2015 年4 月 12 日閲覧。
- ^ Kohavi, Ron; Longbotham, Roger; Sommerfield , Dan ; Henne, Randal M. (2009 年 2 月)。「Web 上での制御された実験: 調査と実践ガイド」。データマイニングと知識発見。18 (1): 140– 181。doi : 10.1007/ s10618-008-0114-1。S2CID 17165746。
- ^ Krishnamoorthy, K.; Thomson, Jessica (2004). 「2つのポアソン平均を比較するためのより強力なテスト」. Journal of Statistical Planning and Inference . 119 : 23–35 . doi :10.1016/S0378-3758(02)00408-1. S2CID 26753532.
- ^ 「知っておくべき高度な A/B テスト戦術 | テストとユーザビリティ」Online-behavior.com。 2014 年 3 月 19 日時点のオリジナルよりアーカイブ。2014 年3 月 18 日閲覧。
- ^ 「A/B テストを誤って構成した 8 つの方法」。Dr . Jason Davis。2013年 9 月 12 日。2014 年 3 月 18 日時点のオリジナルよりアーカイブ。2014年3 月 18 日閲覧。[自費出版ソース]
- ^ Statt, Nick (2016年5月9日). 「Googleは検索結果を青から黒に変える実験を行っている」The Verge . 2024年9月25日閲覧。
- ^ Deng, Alex (2013 年 2 月)。事前実験データの利用によるオンライン制御実験の感度の向上。WSDM '13: Web 検索およびデータマイニングに関する第 6 回 ACM 国際会議の議事録。doi : 10.1145 /2433396.2433413。
- ^ Sexauer, Craig (2023年5月18日). 「CUPED Explained」. ブログ. 2024年9月4日時点のオリジナルよりアーカイブ。 2024年9月11日閲覧。
- ^ Gupta, Somit; Kohavi, Ronny; Tang, Diane; Xu, Ya; Andersen, Reid; Bakshy, Eytan; Cardin, Niall; Chandran, Sumitha; Chen, Nanyu; Coey, Dominic; Curtis, Mike; Deng, Alex; Duan, Weitao; Forbes, Peter; Frasca, Brian; Guy, Tommy; Imbens, Guido W.; Saint Jacques, Guillaume; Kantawala, Pranav; Katsev, Ilya; Katzwer, Moshe; Konutgan, Mikael; Kunakova, Elena; Lee, Minyong; Lee, MJ; Liu, Joseph; McQueen, James; Najmi, Amir; Smith, Brent; Trehan, Vivek; Vermeer, Lukas; Walker, Toby; Wong, Jeffrey; Yashkov, Igor (2019年6月). 「第1回実践オンライン制御実験サミットの主な課題」。SIGKDD探究。21 (1): 20–35。doi :10.1145/3331651.3331655。S2CID 153314606。2021 年10月13日時点のオリジナルよりアーカイブ。 2021年10月24日閲覧。
- ^ Stolberg, M (2006年12月). 「ランダム化二重盲検試験の発明:1835年のニュルンベルク塩テスト」. Journal of the Royal Society of Medicine . 99 (12): 642– 643. doi :10.1177/014107680609901216. PMC 1676327. PMID 17139070 .
- ^ 「A/Bテストとは」。Convertize 。 2020年8月17日時点のオリジナルよりアーカイブ。 2020年1月28日閲覧。
- ^ 「クロード・ホプキンスが広告を科学に変えた」インベスターズ・ビジネス・デイリー。2018年12月20日。2021年8月10日時点のオリジナルよりアーカイブ。2019年11月1日閲覧。
- ^ Pereira, Ron (2007年6月20日). 「ビールが統計に与えた影響」. ブログ. Gemba Academy . 2015年1月5日時点のオリジナルよりアーカイブ。 2014年7月22日閲覧。
- ^ Box, Joan Fisher (1987). 「ギネス、ゴセット、フィッシャー、および小規模サンプル」.統計科学. 2 (1): 45– 52. doi : 10.1214/ss/1177013437 .
- ^ Christian, Brian (2000年2月27日). 「A/Bテスト:ビジネスのルールを変えるテクノロジーの内側」Wired Business。 2014年3月17日時点のオリジナルよりアーカイブ。 2014年3月18日閲覧。
- ^ Christian, Brian. 「Test Everything: Notes on the A/B Revolution | Wired Enterprise」。Wired。2014年3月16日時点のオリジナルよりアーカイブ。2014年3月18日閲覧。
- ^ Cory Doctorow (2012年4月26日). 「A/Bテスト:21世紀の創造と改良の秘密のエンジン」Boing Boing. 2014年2月9日時点のオリジナルよりアーカイブ。 2014年3月18日閲覧。
- ^ 「A/Bテスト:有料ソーシャルメディアのABC」Anyword 2020年1月17日。2022年3月31日時点のオリジナルよりアーカイブ。2022年4月8日閲覧。
- ^ Xu, Ya; Chen, Nanyu; Fernandez, Addrian; Sinno, Omar; Bhasin, Anmol (2015 年 8 月 10 日)。「インフラストラクチャから文化へ: 大規模ソーシャル ネットワークにおける A/B テストの課題」。知識発見とデータ マイニングに関する第 21 回 ACM SIGKDD 国際会議の議事録。pp . 2227– 2236。doi : 10.1145 /2783258.2788602。ISBN 9781450336642. S2CID 15847833。
- ^ 「オンラインストア向けスプリットテストガイド」。webics.com.au。2012年8月27日。2021年3月3日時点のオリジナルよりアーカイブ。 2012年8月28日閲覧。
- ^ Kaufman, Emilie; Cappé, Olivier; Garivier, Aurélien (2014). 「A/Bテストの複雑性について」(PDF) . Proceedings of The 27th Conference on Learning Theory . Vol. 35. pp. 461– 481. arXiv : 1405.3224 . Bibcode :2014arXiv1405.3224K. 2021年7月7日時点のオリジナルよりアーカイブ(PDF) . 2020年2月27日閲覧。
- ^ ab シロカー、ダン、クーメン、ピート(2013年8月7日)。A/Bテスト:クリックを顧客に変える最も強力な方法。ジョン・ワイリー&サンズ。ISBN 978-1-118-65920-5. 2021年8月17日時点のオリジナルよりアーカイブ。2020年10月15日閲覧。
- ^ abc Szucs, Sandor (2018). Modern HTTP Routing (PDF) . LISA 2018. Usenix.org . 2021年9月1日時点のオリジナルよりアーカイブ(PDF) . 2021年9月1日閲覧。
