知見・解説
A/Bテストのやり方|仮説設計から結果の判定・改善まで
A/Bテストの進め方を、仮説、指標、割り付け、必要人数、結果の読み方から解説。架空のBtoB事例と比較用Excelで改善判断を整理します。
- 公開日
- 情報確認日

A/Bテストは、広告やWebサイト、メールなどの2案を対象者に割り付け、同じ条件で成果を比較する方法です。まず、改善したい課題から仮説を立て、問い合わせ率などの主要指標と、商談・受注への影響を確認する指標を決めます。次に、必要なデータ量と実施期間を見積もり、変更点や終了条件を事前に定めます。結果は数値の差だけで判断せず、偶然によるばらつきや後続の成果も確認します。この記事では、設計から実施、差が明確でない場合の確認事項、施策の採用・継続・再設計までを、架空のBtoB事例とともに示します。
A/Bテストとは
A/Bテストは、広告やWebサイトなどに用意した2つの案を対象者に分けて提示し、成果の違いを確かめる方法です。現在使っている案をA、変更した案をBとして比較します。たとえば、問い合わせフォームの見出しを変えることで、送信する人が増えるかを調べます。
2つの案を同じ条件で比較する考え方
A/Bテストでは、案の違い以外が結果に影響しないようにします。同じ期間に、同等の対象者を無作為にAとBへ割り付けて比較することが基本です。無作為に割り付けるとは、担当者の判断などで提示先を選ばず、どちらを見せるかを偶然に委ねることです。
たとえば、Aを平日に、Bを休日にだけ表示すると、結果には案の違いだけでなく曜日の影響も含まれます。また、見出しと入力項目を同時に変えると、どちらが結果に影響したか判断しにくくなります。何を変えて比較するかを明確にしておく必要があります。
比較する成果には、購入や問い合わせなど、対象者に取ってほしい行動を用います。この行動をコンバージョンと呼びます。ただし、表示しただけで成果が変わるとは限りません。A/Bテストは、あらかじめ考えた変更が成果につながるかを、実際の反応から確かめるために行います。
広告・Webサイト・メールでの使いどころ
A/Bテストは、対象者に複数の案を提示でき、反応を計測できる場面で使えます。媒体によって変更する箇所と確認する行動は異なります。
横にスクロールして表全体を確認できます
| 対象 | 比較する案の例 | 確認する行動の例 |
|---|---|---|
| 広告 | 広告文Aと、訴求を変えた広告文B | 広告経由の問い合わせや購入 |
| Webサイト | 現在の問い合わせフォームと、案内文を変えたフォーム | フォームの送信 |
| メール | 件名Aと、伝える内容を変えた件名B | メール内のリンクからの訪問や、その後の申し込み |
たとえば広告のクリック数が増えても、問い合わせが増えるとは限りません。どの行動を成果として確かめたいかによって、適した比較箇所は変わります。まずは対象者に取ってほしい行動を明確にし、その行動に関わる箇所から比較する案を考えます。
始める前に決めること
A/Bテストを始める前に、何を変え、どの指標で判断し、判断に必要なデータをいつまでに集められるかを決めます。施策を作ってから指標を選ぶと、都合のよい数値だけを見て判断しやすくなります。
課題から検証可能な仮説を立てる
まず、アクセス解析や問い合わせ内容から確認できた課題と、その原因についての推測を分けます。例えば「問い合わせフォームの入力開始者に対して、送信を完了する人が少ない」は計測できる課題です。一方、「入力項目が多いために離脱している」は、検証すべき仮説です。
仮説は「誰の、どの体験を変えると、どの行動が変わるか」の形にします。先の例なら、「フォームの入力項目を減らすと、入力開始者の送信完了率が上がる」と表せます。変更する内容と、その効果を測る行動が対応しているかを確認してください。原因が分からない段階で変更案を複数盛り込むと、結果が出ても何が影響したか判断しにくくなります。
主要指標と商談・受注などの副指標を定める
主要指標は、仮説が正しいかを判断するために、テストごとに先に一つ定めます。問い合わせフォームを変えるなら、例えば「フォームの入力を開始した人のうち、送信を完了した人の割合」です。「送信数」だけでは対象者の多寡による影響を受けるため、分母と分子、同じ人が複数回送信した場合の数え方まで決めます。
横にスクロールして表全体を確認できます
| 指標の位置づけ | フォーム改善での例 | 事前に決めること |
|---|---|---|
| 主要指標 | 送信完了率 | 入力開始者を分母、送信完了者を分子とし、人単位で集計する。 |
| 副指標 | 商談化率、受注件数 | 問い合わせと後続の成果をどうひも付け、いつまで追跡するかを決める。 |
| 悪化を見逃さないための指標 | 対象外の問い合わせの割合 | 送信完了率が上がっても、対応できない問い合わせが増えていないか確認する。 |
商談や受注は成果に近い一方、結果が出るまで時間がかかる場合があります。主要指標が改善しても、商談や受注も改善したとは扱わないようにし、後続指標の確認期間をあらかじめ決めておきます。
必要なデータ量と実施期間を見積もる
必要なデータ量は、すべてのA/Bテストで同じ件数にはなりません。現在の送信完了率などの基準値、検出したい最小の差、判定に用いる有意水準と検出力、各案への対象者の配分を決め、案ごとの必要人数を見積もります。検出したい差を小さくするほど、一般に多くのデータが必要です。見積もりには、Optimizely公式のA/Bテスト用サンプルサイズ計算ツールなどを利用できます。
次に、各案で必要な人数の合計を、1日当たりにテスト対象となる人数で割り、実施期間の目安を出します。その際は、広告の配信量や曜日による流入の違いも踏まえます。例えば平日と休日で利用者の行動が異なる可能性があるなら、両方を含む期間を見込みます。予定期間内に必要人数が集まらない見込みなら、開始前に検証したい差や対象範囲を見直します。見積もった人数と期間は、実施時の停止条件を定める材料として残しておきます。
A/Bテストを設計・実施する手順
仮説と主要指標を決めたら、誰にどちらの案を見せるか、何を変更するか、いつ終了するかを設定します。実施前に計測を確認し、開始後は予定外の変更を記録します。
対象者を割り付け、比較条件をそろえる
既存の案をA、新しい案をBとし、対象者を同じ期間に無作為に割り付けます。Webサイトのページを比較する場合は、同じ人が訪問のたびにAとBを行き来しないよう、利用するツールの割り付け方法を確認します。広告やメールでは、配信対象、配信時期、予算など、結果に影響する条件をできる限りそろえます。Aを先週、Bを今週に配信した結果は、案の違いだけでなく時期の影響も受けます。
Google広告のテスト機能を使う場合、分割方法や設定できる項目はテストの種類によって異なります。設定前にGoogle 広告ヘルプのテストに関するよくある質問で、対象のキャンペーンに適用される仕様を確認します。
変更点を絞り、計測漏れと同時変更を防ぐ
最初の比較では、検証したい変更点を絞ります。たとえば、ボタンの文言を確かめるなら、配置や入力項目は原則として変えません。複数の要素を同時に変える場合は、「変更を組み合わせた案」の効果は比較できますが、どの要素が差を生んだかは特定しにくくなります。
公開前には、A・Bの表示、リンク先、フォーム送信、主要指標の計測を両方で確認します。比較に使う母数やコンバージョンの定義も統一してください。実施中にサイト全体の改修や別のキャンペーンを予定している場合は、テストとの重なりを確認し、避けられない変更は実施日時と対象範囲を記録します。
停止条件と担当・期限を事前に記録する
開始前に、予定する終了日だけでなく、どの条件で集計を終えるかを記録します。必要なデータ量と期間は、先に見積もった値を使います。途中の数値が良く見えたことだけを理由に終了日を早めると、偶然の変動を成果と取り違えるおそれがあります。一方、表示不具合や重大な業務上の損失が確認された場合は、安全上の停止を優先します。
横にスクロールして表全体を確認できます
| 記録する項目 | 決めておく内容 |
|---|---|
| 実施条件 | 対象者、A・Bの内容、割り付け方法、主要指標と集計対象 |
| 終了条件 | 開始日、予定終了日、必要なデータ量、安全上の停止条件 |
| 担当と期限 | 設定・計測確認の担当者、公開前の確認期限、結果を確認する担当者と日付 |
Google広告を利用する場合は、設定画面で指定する期間や分割方法もGoogle 広告ヘルプのカスタムテスト設定手順と照らして確認します。記録した条件から変更が生じたときは、変更理由と日時を残し、結果を読む際にその影響を確認できるようにします。
A/Bテストの結果の読み方と判断の注意点
指標の差と推定の不確実性を確認する
まず、事前に定めた主要指標について、A案とB案の対象者数、成果件数、成果率を並べます。例えば、各案を見た人が1,000人、問い合わせがA案で20件、B案で30件なら、問い合わせ率はそれぞれ2%と3%です。B案はA案より1ポイント高く、相対的には50%高い結果ですが、この数値だけで「B案の効果が確定した」とは言えません。
次に、成果率の差と、その推定にどの程度の幅があるかを示す信頼区間を確認します。信頼区間が広ければ、観測された差より小さい効果や逆方向の効果も考慮する必要があります。統計的な有意差の有無だけでなく、差の大きさが事業上意味のある水準かを判断します。有意差は効果の大きさや重要性を示すものではないことも、米国統計学会のp値に関する声明で説明されています。
問い合わせ後の商談・受注への影響を見る
問い合わせ数が増えても、その後の商談や受注まで増えるとは限りません。両案について、同じ定義と集計時点で後続指標を確認します。まだ商談・受注に至るまでの期間が経過していない案件は、成果が出なかった案件と区別します。
横にスクロールして表全体を確認できます
| 確認する指標 | 比較する内容 | 判断上の注意点 |
|---|---|---|
| 問い合わせ率 | 各案を見た人のうち、問い合わせた人の割合 | 主要指標が改善したかを確認する |
| 商談化率 | 問い合わせた人のうち、商談に進んだ人の割合 | 問い合わせの増加とともに、商談につながりにくくなっていないかを見る |
| 受注率・受注件数 | 商談後の受注状況と、各案から生じた受注件数 | 案件数が少ない場合や受注までの期間が短い場合は、結論を急がない |
例えば、B案で問い合わせが増えても商談化率が下がった場合、問い合わせ時点の改善が営業成果にもつながったとは判断できません。一方、後続指標の件数が少なく差を判定できない場合は、「受注への影響は未確認」として、問い合わせ率についての結果と分けて伝えます。
差が明確でないときに確認すること
主要指標に明確な差が出なかった場合は、まず信頼区間と、検出したかった差の大きさを照らし合わせます。幅の広い信頼区間に改善・悪化の両方が含まれるなら、「効果がない」ではなく「今回のデータでは効果の方向や大きさを絞れない」と整理します。必要なデータ量に届いていたかも併せて確認します。小さな差を検出するには十分なデータ量が必要であることは、マイクロソフトの実験指標に関する研究でも指摘されています。
次に、結果を信頼できる状態だったかを確認します。割り付け予定と実際の対象者数が大きく食い違う、同じ人が両案に含まれる、片方の案だけ計測が欠けるといった問題があれば、差の解釈より先に原因を調べます。特に割り付け比率の食い違いは、マイクロソフトの割り付け比率に関する研究で、実験結果の信頼性を損なう可能性がある問題として扱われています。
最後に、事前に決めた実施期間と集計対象を守ったかを確認します。途中で良く見えた時点だけを採用したり、結果を見てから都合のよい対象者だけに絞ったりすると、当初の条件で得られた結果とは別の解釈が必要になります。差が明確でない理由を「データ量」「計測・割り付け」「推定の幅」に分けて記録し、判定できたことと未判定のことを区別します。
結果を改善施策へ反映する
A案・B案の対象者数と成果件数から成果率・差を計算し、商談・受注も並べて確認できます。 A/Bテスト比較シート(Excel)をダウンロード。記入例は架空です。統計的な有意差の判定は、このシートだけでは行いません。
A/Bテストの結果は、数値の差だけで施策の採否を決めず、事前に定めた主要指標、推定の不確実性、商談・受注などの後続指標を合わせて判断します。そのうえで、採用する範囲と次の作業を決めます。
採用・継続・再設計を決める
判断は、次の三つに分けると実施する作業が明確になります。
横にスクロールして表全体を確認できます
| 判断 | 判断する際の条件 | 次の作業 |
|---|---|---|
| 採用 | 主要指標の改善が確認でき、推定の不確実性を踏まえても採用する根拠がある。後続指標に看過できない悪化も見られない。 | 担当者が変更案を本番環境に反映し、計測を続ける。反映後に指標が悪化した場合の戻し方も決めておく。 |
| 継続 | 事前に決めた実施期間やデータ量に達しておらず、停止条件にも該当しない。 | 条件を変えずに計測を続け、予定した時点で再判定する。 |
| 再設計 | 予定した計測を終えても判断に必要な精度が得られない、計測に問題がある、または仮説を見直す必要がある。 | 不明点を整理し、対象者、変更点、指標のいずれを見直すか決めてから次の検証を設計する。 |
明確な差が出なかった結果を、そのまま「効果なし」と扱わないことが重要です。判断を保留する場合も、単に期間を延ばすのではなく、当初の停止条件と計測状況を確認します。採用する場合は、問い合わせ数が増えていても商談化率などが悪化していないかを確認し、どのページや配信対象に反映するかを決めます。
仮説、判断、次回検証を記録する
担当者は、当初の仮説、変更した内容、主要指標と後続指標の結果、採否の理由を一つの記録に残します。結果から確認できた事実と、「なぜ変化したか」という解釈は分けて書きます。数値に差があっても、その理由までA/Bテストだけで特定できるとは限らないためです。
続けて、施策を反映する担当者と期限、反映後に確認する指標と確認日を記入します。再設計する場合は、次に検証する仮説、見直す条件、設計担当者と着手期限まで決めます。判断と次の作業を同じ記録に残せば、結果を確認したまま改善が止まることを防げます。
架空のBtoB事例で考える
以下は、問い合わせフォームのA/Bテストを検討するための架空例です。数値は実際の企業の成果ではありません。
問い合わせフォームの改善仮説とテスト設計
法人向けの営業支援サービスを提供する企業では、資料請求ページを訪れた人のうち、フォームを送信する人が少ないことを課題としていました。担当者は、入力必須の8項目のうち3項目は初回の資料送付には不要と確認しました。そこで、「必須項目を5項目に減らせば、入力の負担が下がり、資料請求率が上がる」と仮説を立てます。
A案は既存の8項目、B案は必須項目を5項目に減らしたフォームです。送信ボタンの文言、資料の内容、ページへの流入元は変えません。フォームの必須項目数だけを変え、資料請求率を比較する設計にします。
横にスクロールして表全体を確認できます
| 設計項目 | この事例での決め方 |
|---|---|
| 対象と割り付け | 資料請求ページの訪問者をA案・B案に無作為に割り付け、同じブラウザーで再訪した際は同じ案を表示する。 |
| 主要指標 | 各案を表示した訪問者のうち、資料請求を完了した人の割合。 |
| 後続指標 | 資料請求者の商談化件数と受注件数。営業担当者が同じ基準で記録する。 |
| 実施条件 | 両案を同じ期間に表示し、4週間以上、各案の訪問者が2,000人以上になるまで実施する。件数は事前の試算に基づく、この架空例の設定とする。 |
| 後続指標の確認時期 | 各資料請求から60日後までの商談・受注を記録し、両案で同じ観察期間を確保する。 |
マーケティング担当者は開始前に、フォーム表示と送信完了の計測を両案で確認します。営業担当者には、削除した3項目を商談前に確認する必要があるかを共有しておきます。
結果から次の判断を決める
実施条件を満たした時点で、次の結果になったと仮定します。商談・受注件数は、各資料請求から60日間を確認した数値です。
横にスクロールして表全体を確認できます
| 指標 | A案:既存フォーム | B案:必須項目を削減 |
|---|---|---|
| 訪問者 | 2,000人 | 2,000人 |
| 資料請求 | 80件(4.0%) | 120件(6.0%) |
| 商談化 | 24件 | 22件 |
| 受注 | 6件 | 4件 |
資料請求率はB案が2.0ポイント高い一方、商談と受注の件数はA案を下回っています。資料請求が増えたことだけを理由に、B案を全面採用しないと判断します。ただし、受注件数の差も小さいため、この結果だけで「必須項目の削減が受注を減らした」とは断定できません。
まずマーケティング担当者が結果確認から5営業日以内に、割り付け、送信完了の計測、流入元の偏りを点検します。営業責任者は10営業日以内に、商談化の記録基準と、削除した項目を営業活動で補えていたかを確認します。そのうえで分析担当者が15営業日以内に、資料請求率の差の推定幅と後続指標を整理し、B案の採用を保留するか決めます。
記録に問題がなく、削除した項目が商談前の確認に必要だと分かった場合は、その項目だけを戻したフォームを次の検証案とします。担当者は変更内容と判断理由を記録し、必要な訪問者数と実施期限を改めて決めてから、次のA/Bテストを始めます。
A/Bテストのよくある質問
Q何件あればA/Bテストを実施できますか
A一律に「何件あれば十分」とは決められません。必要な対象者数は、現在のコンバージョン率、検出したい最小の差、判定基準などによって変わります。問い合わせ件数だけを基準にせず、まずはA案・B案それぞれに割り付けられる対象者数を見積もります。計算に使う項目は、実験前のデータ量と期間の見積もりに関する資料でも確認できます。
必要数を集めるまでに長期間かかる場合は、小さな改善幅まで判定しようとせず、検出したい差や対象範囲を見直します。少ない件数で始めることと、少ない件数で勝敗を決めることは別です。 参考:Optimizely「実験期間の見積もり」
Q途中で良い結果が出たら止めてもよいですか
A事前に必要数を決めて最後に判定する方法では、途中の数値が良く見えたことを理由に止めないでください。途中で何度も結果を確認し、良い時点だけを選んで終了すると、実際には差がない案を採用するリスクが高まります。 参考:Optimizely「固定期間の統計手法」
一方、途中での判定に対応した統計手法を使い、その方法に沿って停止条件を決めている場合は、その条件で終了できます。どの方法でも、計測不具合や利用者への明らかな悪影響が見つかった場合は安全上の判断として停止し、通常の結果判定とは分けて記録します。 参考:Statsig「逐次検定」
Q差が出なかった場合は失敗ですか
A失敗とは限りません。統計的に差を確認できなかった結果は、「効果がない」と証明した結果ではありません。対象者数が足りず、実務上は重要な差を見分けられなかった可能性もあります。まず、差の推定範囲と当初見込んだデータ量を照らし合わせます。詳しくは有意差が出ない結果の解釈に関する資料も参照できます。
そのうえで、問い合わせ数に明確な差がなくても、商談化率や受注など後続の指標に懸念がないか確認します。判定に必要なデータが不足していれば追加検証を検討し、想定した改善幅を見込めないほど差の推定範囲が狭ければ、別の仮説を優先する判断もできます。 参考:Optimizely「実験結果を次の施策に反映する」
まとめ
A/Bテストでは、まず課題を確認し、何を変えるとどの指標が変わるかという仮説を立てます。次に、主要指標と商談・受注などの副指標を決め、必要なデータ量、実施期間、停止条件を事前に記録します。
実施時は対象者を公平に割り付け、変更点を絞って比較条件をそろえます。結果は指標の差だけでなく、その差の不確実性や後続の成果も確認します。途中で良い結果が出ても、事前に決めた条件を満たす前に判断しないことが大切です。
差が明確でない場合も、計測やデータ量を確認したうえで、採用・継続・再設計を決めます。担当者は判断の根拠と次に検証する仮説を残し、次の改善につなげます。
参考資料
- Google 広告ヘルプ「テストを利用して効果を検証する」:広告キャンペーンの比較。
- Optimizely「サンプルサイズ計算ツール」:必要人数の見積もり。
- Optimizely「固定期間の統計手法」:停止条件の考え方。