
ユーザビリティ テストは、ユーザー中心のインタラクション デザインで使用される手法で、ユーザーによるテストによって製品を評価するものです。実際のユーザーがシステムをどのように使用するかについて直接的なフィードバックが得られるため、これは代替不可能なユーザビリティプラクティスと見なすことができます。 [ 1 ]これは製品のデザインの直感性に重点を置き、その製品に事前に触れたことのないユーザーでテストされます。このようなテストは最終製品の成功に極めて重要であり、完全に機能するアプリケーションであっても、ユーザーの間で混乱を引き起こす場合は長くは続きません。[ 2 ]これは、ユーザーを関与させずに専門家がさまざまな方法を使用してユーザー インターフェイスを評価するユーザビリティ検査方法とは対照的です。
ユーザビリティテストは、人間が作った製品が意図した目的にどれだけ適合しているかを測定することに重点を置いています。ユーザビリティテストの恩恵を受ける一般的な製品の例としては、食品、消費財、ウェブサイトやウェブアプリケーション、コンピュータインターフェース、文書、デバイスなどがあります。ユーザビリティテストは、特定のオブジェクトまたはオブジェクト群のユーザビリティ、つまり使いやすさを測定するのに対し、一般的な人間とコンピュータのインタラクション研究は、普遍的な原則を策定しようとします。[ 3 ]
単に物や文書に関する意見を集めることは、ユーザビリティテストではなく、市場調査または定性調査です。ユーザビリティテストは通常、管理された条件下で体系的に観察を行い、人々が製品をどれだけうまく使用できるかを判断します。 [ 4 ]しかし、ユーザーの行動に加えて、ユーザーの動機や認識をよりよく理解するために、定性調査とユーザビリティテストの両方が組み合わせて使用されることがよくあります。
ユーザビリティテストでは、ユーザーにラフな草稿を見せて「これで理解できますか?」と尋ねるのではなく、人々が本来の目的で製品を使用しようとする様子を観察します。例えば、おもちゃの組み立て説明書をテストする場合、被験者には説明書と部品の入った箱を与え、部品や材料についてコメントさせるのではなく、実際に組み立ててもらうべきです。説明書の表現、イラストの質、おもちゃのデザインなど、すべてが組み立てプロセスに影響を与えます。
ユーザビリティテストは、ウェブサイトやアプリから始まったわけではありません。その起源は、第二次世界大戦中の航空機の操縦装置など、人々が機械をどのように使用するかを研究した1940年代に遡ります。その後、パーソナルコンピュータが普及した1980年代には、ヒューマンコンピュータインタラクション(HCI)と呼ばれる新しい分野が生まれ、ユーザビリティテストは技術設計における標準的な手法として確立されました。
1990年代には、人々がコンピュータを使用している様子を観察し、困難を感じている領域を特定できる特別なラボが設立され始めました。[ 5 ] 2000年代と2010年代にインターネットとスマートフォンが普及するにつれて、ユーザビリティテストはウェブサイトやアプリに拡大しました。テストはオンラインで行われるようになり、企業はどこにいる人でもテストできるようになりました。
ユーザビリティテストは、特に技術革新が急速に進む環境において、製品設計の標準的な要素となっています。新しいツール、リモートテスト、そしてAIや仮想現実といった新興技術の登場により、テストプロセスはより迅速かつ高度化しています。しかし、その目的は変わりません。それは、テクノロジーを一般の人々にとってより使いやすくすることです。
ユーザビリティラボは、フィールドテストやリモートテストとは対照的に、ユーザビリティテストを実施するために特別に設計された空間です。リソース、テスト機器、およびユーザビリティテストの仕様に応じてフォーマットやアップグレードが可能な専用スペースへのアクセスを通じて、テストに適した環境を提供します。一般的なユーザビリティラボには、机、椅子、コンピューターに加え、テストに特有のその他の要素が含まれることがよくあります。[ 6 ]
ユーザビリティ テストの設定には、観察者がテスト対象製品を使用して一連のタスクを実行する様子を観察し、メモを取る(動的検証)というシナリオ、つまり現実的な状況を慎重に作成することが含まれます。ユーザビリティ テストは、研究者がユーザーがタスクを実行する際に製品とどのようにやり取りするかを観察できる構造化されたプロセスに従います。直接観察に加えて、研究者はスクリプト化された指示、紙のプロトタイプ、テスト前後のアンケートなど、他のいくつかのテストツールを使用することもあります。これらもテスト対象製品に関するフィードバックを収集するために使用されます(静的検証)。[ 7 ]例えば、電子メールプログラムの添付ファイル機能をテストする場合、シナリオでは、電子メールの添付ファイルを送信する必要がある状況を記述し、そのタスクを実行するように依頼します。目的は、開発者が問題のある領域を特定して修正できるように、人々が現実的な方法でどのように機能するかを観察することです。ユーザビリティ テスト中にデータを収集するためによく使用される手法には、思考発話プロトコル、共同発見学習、アイ トラッキングなどがあります。[ 8 ]
ゲリラユーザビリティテスト(廊下テストやポップアップリサーチとも呼ばれる)は、製品やサービスを利用する可能性が最も高い人々が頻繁に訪れる公共の場所で、短時間の非公式なインタビューを行う、迅速かつ安価なユーザビリティテストの方法です。[ 9 ]
この型破りな方法は、主に設計プロセスの初期段階で、幅広い一般の人々から直接的かつ即時のフィードバックを得るために使用され、従来のテストに必要なコストとテスト時間を大幅に削減します。ゲリラテストは、デザイナーが製品の中核的なユーザビリティの問題を特定し、「介護施設の入居者、ホームレスの人々、Aレベルの学生など、到達するのが難しい特定のユーザーグループ」をターゲットにするのに役立ちます。[ 9 ]
この種のテストは便宜的サンプリングの一例であり、結果に偏りが生じる可能性がある。この方法の限界としては、データが不十分であること、協力的な参加者が不足していること、より詳細な結果を得るために他のユーザビリティテスト方法と組み合わせる必要があることなどが挙げられる。
ユーザビリティ評価者、開発者、および見込みユーザーが異なる国やタイムゾーンにいるシナリオでは、従来のラボユーザビリティ評価を実施すると、コストとロジスティクスの両方の観点から課題が生じます。これらの懸念から、ユーザーと評価者が空間的にも時間的にも離れているリモートユーザビリティ評価の研究が行われました。ユーザーの他のタスクやテクノロジーのコンテキストで評価を行うことを容易にするリモートテストは、同期型(モデレート型)または非同期型(モデレートなし)のいずれかになります。前者は評価者とユーザー間のリアルタイムの1対1のコミュニケーションを伴いますが、後者は評価者とユーザーが別々に作業することを伴います。[ 10 ]リモートテストの必要性が高まっているのは、病気への罹患、障害、または限られた交通手段などの要因により移動が制限されている個人にとって、必須サービスやコミュニケーションへのアクセスを改善できる能力があるためです。[ 11 ]これらの両方のアプローチのニーズに対応するために、多数のツールが利用可能です。
同期型(モデレート型)ユーザビリティテスト手法では、ビデオ会議やWebExなどのリモートアプリケーション共有ツールを使用します。WebExは、同期型リモートユーザビリティテストを実施するためによく使用される技術です。この形式のリモートテストでは、モデレーターと参加者の間でリアルタイムのコミュニケーションが可能になり、高齢者や健康状態、移動、環境条件により自宅に閉じこもっている人にとって有益です。従来のユーザビリティテストとは異なり、リモートテストでは、上記のような問題を抱える参加者にもアクセスできます。遠隔医療、オンラインショッピング、リモートバンキングなどのリモートサービスへの依存度が高まり続ける中、モデレート型リモートユーザビリティテストは、これらの技術が高リスク層のニーズを満たしつつコスト効率が良いことを保証するために重要な役割を果たします。[ 11 ]
しかし、同期リモートテストでは、共同テストプロセスをサポートするために必要とされる即時性や「臨場感」が欠ける可能性がある。さらに、文化や言語の壁を越えた対人関係を管理するには、関係する文化に配慮したアプローチが必要になる場合がある。その他の欠点としては、テスト環境に対する制御が低下することや、参加者が自国の環境で経験する妨害や中断などが挙げられる。[ 12 ]同期リモートユーザビリティテストを実施するために開発された新しい方法の1つは、仮想世界を使用することである。[ 13 ]
非同期(非モデレート)手法には、ユーザーのクリック ストリームの自動収集、アプリケーションとのやり取り中に発生する重大なインシデントのユーザー ログ、およびユーザーによるインターフェースに関する主観的なフィードバックが含まれます。[ 12 ]ラボでの調査と同様に、非同期リモートユーザビリティ テストはタスク ベースであり、プラットフォームにより、訪問したページ、各ページで費やした時間、およびインターフェース アクションを収集する自動ログにより、研究者がデータを自動的に取得できます。したがって、多くの大企業にとって、これにより、研究者は Web サイトやモバイル サイトを訪問したときの訪問者の意図をよりよく理解できます。テストは (ラボではなく) ユーザー自身の環境で実行されるため、実際のシナリオ テストをさらにシミュレートできます。個別のセッションを実施する必要がないため、非同期リモート テストにはより多くの参加者を含めることができ、従来のラボベースの調査よりも柔軟で費用対効果が高くなっています。ユーザビリティ テストを非同期で実施することも普及しており、テスターは自由時間に自宅で快適にフィードバックを提供できます。[ 14 ]
専門家によるレビューは、ユーザビリティテストの一般的な方法の一つです。その名の通り、この方法は、その分野での経験を持つ専門家(ユーザビリティテストを専門とする企業など)を招き、製品のユーザビリティを評価するものです。
ヒューリスティック評価またはユーザビリティ監査とは、1 人以上の人間工学専門家によるインターフェースの評価です。評価者は、 1994 年にJakob Nielsenによって最初に定義された 10 のユーザビリティ ヒューリスティックなどのユーザビリティ原則に基づいて、インターフェースのユーザビリティ、効率性、および有効性を測定します。[ 15 ]
ニールセンのユーザビリティヒューリスティックは、ユーザー調査や新しいデバイスに対応して進化を続けており、以下のようなものがある。
専門家によるレビューと同様に、自動化された専門家レビューもユーザビリティテストを提供しますが、優れたデザインのためのルールとヒューリスティックが与えられたプログラムを使用します。自動化されたレビューは、人間によるレビューほど詳細で深い洞察を提供しないかもしれませんが、より迅速かつ一貫性のある結果を得ることができます。ユーザビリティテストのための代替ユーザーを作成するというアイデアは、人工知能コミュニティにとって野心的な方向性と言えるでしょう。
ウェブ開発やマーケティングにおいて、A/Bテスト(またはスプリットテスト)は、ウェブデザイン(特にユーザーエクスペリエンスデザイン)に対する実験的なアプローチであり、関心のある成果(例えば、バナー広告のクリック率)を向上または最大化するウェブページの変更点を特定することを目的としています。名前が示すように、2つのバージョン(AとB)が比較されます。これらのバージョンは、ユーザーの行動に影響を与える可能性のある1つの変更点を除いて同一です。バージョンAは現在使用されているバージョンであり、バージョンBは何らかの点で変更されています。例えば、eコマースウェブサイトでは、購入ファネルはA/Bテストに適した対象です。離脱率のわずかな改善でも、売上の大幅な増加につながる可能性があるからです。コピーテキスト、レイアウト、画像、色などの要素をテストすることで、大きな改善が見られる場合があります。
A/Bテストによって一般的に改善される領域には、アルゴリズム、ビジュアル、ワークフロープロセスなどがあります。[ 16 ]
多変量テスト、またはバケットテストはA/Bテストに似ていますが、2つ以上のバージョンを同時にテストする点が異なります。
1990年代初頭、当時サン・マイクロシステムズの研究者であったヤコブ・ニールセンは、開発プロセスのさまざまな段階で、多数の小規模なユーザビリティテスト(通常は参加者5名のみ)を実施するという概念を普及させた。彼の主張は、ホームページで2、3人が完全に混乱していることが判明した場合、それ以上の人が同じ欠陥のあるデザインに苦しむのを見ても得るものはほとんどないというものだ。「複雑なユーザビリティテストはリソースの無駄です。最良の結果は、最大5人のユーザーを対象に、予算の許す限り多くの小規模なテストを実施することから得られます。」[ 17 ]
「5人のユーザーで十分」という主張は、後に数学モデル[ 18 ]によって説明され、未解決問題の割合Uについて次のように述べられています。
ここで、pは被験者1人が特定の問題を特定する確率、nは被験者数(またはテストセッション数)です。このモデルは、実際に存在する問題の数に向かって漸近的に変化するグラフとして現れます(下図参照)。
その後の研究では、ニールセンの主張は経験的証拠[ 19 ]とより高度な数理モデル[ 20 ]の両方を用いて疑問視されている。この主張に対する主な反論は次の2つである。
ニールセンは、5人のユーザーによる1回のテストで終了することを推奨しているわけではありません。彼の主張は、5人のユーザーでテストを行い、発見された問題を修正し、その後、修正したサイトを5人の別のユーザーでテストする方が、10人のユーザーで1回のユーザビリティテストを実行するよりも、限られたリソースをより有効に活用できるということです。実際には、開発サイクル全体を通して週に1回または2回、1ラウンドあたり3~5人の被験者を使用してテストが実行され、結果は24時間以内にデザイナーに提供されます。そのため、プロジェクト期間中に実際にテストされるユーザー数は、簡単に50~100人に達する可能性があります。調査によると、組織が実施するユーザーテストでは、通常5~10人の参加者を募集しています。[ 22 ]
初期段階では、ユーザーがすぐに問題に遭遇して作業が中断される可能性が最も高いため、通常の知能を持つ人であればほぼ誰でも被験者として使用できます。第 2 段階では、テスト担当者は幅広い能力を持つ被験者を募集します。たとえば、ある研究では、経験豊富なユーザーは最初から最後までどのデザインでも問題なく使用できましたが、初心者ユーザーと自称パワーユーザーはどちらも繰り返し失敗しました。[ 23 ] その後、デザインがスムーズになるにつれて、ユーザーはターゲット集団から募集する必要があります。
この手法をプロジェクト期間中に十分な数のユーザーに適用すると、前述の懸念事項は解消されます。サンプルサイズが小さくなくなり、時折しか利用しないユーザーで発生するユーザビリティの問題も発見されるようになります。この手法の真価は、特定の設計上の問題が一度発生すると、即座に排除されるため二度と発生しない一方、成功したと思われる部分は繰り返しテストされる点にあります。確かに、設計上の初期問題はわずか5人のユーザーによってテストされるかもしれませんが、この手法を適切に適用すれば、最初のテストでうまくいった設計部分は、その後50人から100人のユーザーによってテストされることになります。
5人の参加者でユーザビリティ問題の85%を特定できるという広く引用されている主張は、学術的に厳しく検証されてきた。その根拠となる数学モデルは、すべてのユーザーとすべての問題において問題発見の確率が一定であると仮定している。研究によると、この式は「問題発見における個人差について不当な仮定をしている」ことが示され、単純な問題数にはこのモデルが当てはまるかもしれないが、問題の頻度と深刻度を考慮した分析では、誤解を招く結果を避けるためにサンプルサイズを2倍にする必要があることがわかった。[ 24 ]
実証研究では、5 ユーザー モデルの有効性に大きなばらつきがあることが明らかになっています。無作為抽出実験では、5 人のユーザー グループが予測どおりに平均 85% の問題を発見したものの、その範囲は大きく異なり、5 人のグループの中には 55% の問題しか発見できなかったグループもあれば、20 人のグループで 95% 未満の問題を発見したグループはありませんでした。[ 25 ]このばらつきは、サンプル サイズが小さいとユーザビリティ調査結果にかなりの不確実性が生じることを示唆しています。
特定のユーザビリティ問題を検出する確率は一様ではなく、問題の深刻度、ユーザーの特性、製品の複雑さ、テスト構造に基づいて変化する。[ 26 ]研究によると、ユーザーの安全やタスクの完了に最も深刻な影響を与える可能性のある微妙な問題は、検出確率が低く、確実に特定するにはより大きなサンプルサイズが必要である。[ 27 ]
問題検出率のばらつきを考慮した異質性モデルが提案されており、オリジナルのニールセン=ランダウアー式は発見プロセスを過度に単純化していると主張している。これらのモデルは、解決困難な問題が発見プロセス全体を遅らせ、結果としてオリジナルの式が予測するよりも進歩が緩やかになることを示唆している。
ユーザビリティ テストの実践における重大な制約は、障害のあるユーザーが潜在的なユーザーのかなりの割合を占めているにもかかわらず、体系的に過小評価されていることです。世界保健機関によると、約 13 億人 (世界人口の 16%) が重度の障害を抱えており、人口高齢化と慢性疾患の増加によりその有病率は上昇しています。[ 28 ]平均寿命が 70 歳以上の国では、人々は平均して生涯の 11.5% を障害を抱えて過ごしています。[ 29 ]
障害のある人々は新しい技術から最も恩恵を受ける立場にあるが、協議や開発の初期段階に含まれていないため、こうした発展から取り残されることがあまりにも多い[ 30 ]。
研究によると、多様な背景を持つ参加者による技術のテストは一般的ではなく、主な障壁としては組織的圧力、利害関係者の文化、参加者の募集の難しさなどが挙げられる。[ 31 ]
アクセシビリティガイドラインに準拠するだけではユーザビリティが保証されないため、デザインがアクセス可能かつ使用可能かどうかを判断するには、障害のあるユーザーでテストする必要があることが強調されています。[ 32 ]業界の実務家は、障害のあるユーザーは障害のないユーザーよりも幅広い問題を特定することが多く、すべてのユーザーに影響を与える問題も含まれるため、障害のないユーザーのみでテストするよりも包括的なテストの方が効率的である可能性があると主張しています。[ 33 ]
デザイン研究における「エクストリームユーザー」の概念は、障害のある人を含む、追加の課題に直面するユーザーでテストを行うことで、すべてのユーザーのユーザビリティを向上させる洞察が得られるというものです。この現象は、車椅子ユーザー向けに設計された縁石スロープが、ベビーカー、荷物、または移動に困難を抱える人にも役立つという観察から、「縁石カット効果」と呼ばれることもあります。[ 34 ]現代のユーザーリサーチ手法の中には、主流のユーザーではなく「エッジユーザー」または「エクストリームユーザー」に焦点を当て、エッジユーザーの問題を解決できるデザインであれば、すべての顧客にとってシームレスで直感的であると指摘するものもあります。[ 35 ]
ユーザビリティ研究は、心理学研究で指摘されているより広範なサンプリングの限界を共有しており、特に西洋の教育を受けた工業化された裕福な民主主義社会(WEIRD)の参加者に過度に依存している。研究によると、WEIRD人口は世界人口の約12%を占めるにすぎないが、公表されている行動科学研究の参加者の96%を占めている。[ 36 ]
このサンプリングバイアスは、認知プロセスや知覚プロセスが文化によって大きく異なることが研究で示されているため、ユーザビリティ調査結果の一般化可能性について疑問を投げかけます。たとえば、視覚知覚研究では、工業化された国の人々に確実に影響を与える特定の錯視が、非工業化社会の人々には同じ影響を与えないことが示されています。[ 37 ]
発達心理学研究の体系的レビューでは、分析された1,582の記事のうち、中南米、アフリカ、アジア、中東の参加者を合わせた記事はわずか112件で、米国の参加者のみを扱った記事は912件だったことがわかった。[ 38 ]ユーザビリティ研究でも同様の傾向が見られる可能性が高いが、この分野のサンプリング人口統計に関する具体的な分析は限られている。
広く認識されているにもかかわらず、サンプリングバイアスが依然として存在する原因は、便宜的サンプリングの手法にあると考えられています。これは、研究者がユーザー集団を代表する参加者ではなく、容易にアクセスできる参加者を募集する手法です。また、標準的な実験デザインでは、意図せず特定の集団が除外される場合もあります。例えば、長時間のテストセッションは神経発達障害のある参加者にとって負担となり、自己選択効果によってサンプルの代表性が低下する可能性があります。
2015年版の医療機器ユーザビリティテストでは、ユーザビリティテストを「特定の医療機器が意図されたユーザーのニーズと好みを満たすかどうかを判断する手段」および「医療機器が危険な使用エラーに対して脆弱であるかどうかを判断する方法」と定義しています。[ 39 ]
テストプロセスは通常、次のような手順で進められます。
このプロセスを通じて、研究者は医療機器と人間との相互作用に関する重要な知見を得ることができ、設計者は製品発売前にユーザビリティの問題を修正することが可能になる。
1982年のApple Computerの開発者向けマニュアルでは、ユーザビリティテストについてアドバイスしている。[ 40 ]
Appleは開発者に対し、「友人、親戚、新入社員を動員して、できるだけ早くテストを開始すべきだ」と助言した。[ 40 ]
私たちのテスト方法は以下のとおりです。5~6台のコンピュータシステムを設置した部屋を用意します。5~6人のユーザーからなる2~3グループを一度に割り当て、システムを試用してもらいます(多くの場合、テスト対象がシステムではなくソフトウェアであることをユーザーには知らせません)。部屋にはデザイナーが2人同席します。これより少ないと、多くのことを見逃してしまいます。これより多いと、ユーザーは常に誰かに監視されているような感覚に陥ります。
デザイナーは、人々がプログラムを直接使用する様子を観察する必要がある。なぜなら[ 40 ]
ユーザーの行動を観察することで、つまずきの95%は発見できます。目を細めたり、肩をすくめたり、首を振ったり、深くため息をついたりといった仕草に注目してください。ユーザーが問題にぶつかると、「自分が頭が悪いせいだ」と思い込み、報告せず、隠そうとします。ユーザーが混乱した理由を勝手に決めつけず、本人に尋ねてください。ユーザーが迷った時にプログラムが何をしていると思っていたのかを知れば、驚くことでしょう。
ユーザビリティテストは、さまざまな分野で正式な学術指導の対象となっています。[ 41 ]ユーザビリティテストは、作文研究やオンラインライティング指導(OWI)にとって重要です。[ 42 ]学者コリン・ビョークは、ユーザビリティテストは「デジタル修辞学の理論と組み合わせない限り、効果的なOWIを開発するために必要ではあるが不十分である」と主張しています。[ 43 ]
調査製品には、紙とデジタルの調査、フォーム、調査回答者が単独で、またはデータ収集者と一緒に記入または使用できるツールが含まれます。ユーザビリティテストは、Web調査で最もよく行われ、調査の操作、調査回答の入力、ヘルプ情報の検索など、人々が調査とどのようにやり取りするかに焦点を当てています。ユーザビリティテストは、認知事前テスト(人々が製品をどのように理解するか)、パイロットテスト(調査手順がどのように機能するか)、調査方法論の専門家による専門家レビューなど、従来の調査事前テスト方法を補完します。[ 44 ]
翻訳された調査製品では、ユーザビリティテストにより、「文化的適合性」は文レベルおよび単語レベル、データ入力およびナビゲーションのデザインにおいて考慮する必要があることが示されており[ 45 ]、一般的な機能(タブ、ハイパーリンク、ドロップダウンメニュー、URL)の翻訳と視覚的な手がかりを提示することでユーザーエクスペリエンスが向上することが示されています[ 46 ] 。