無料AIツール集

A/B テスト 統計的有意性 計算無料・登録不要

A/B テストの結果(訪問数 + CV 数)から CVR / 改善率(lift)/ p-value / z スコア / 95% 信頼区間を自動算出。99%/95%/90% 信頼度の有意性バッジ付き。

シェア
最終更新:
所要時間: 約5分
編集: Free AI Tools JP 編集部

パターン A(コントロール)

CVR: 3.00%

パターン B(テスト)

CVR: 3.60%
改善率(lift)
+20.00%
B が A に対して
p-value(両側)
0.0931
小さいほど有意
z スコア
1.68
±1.96 = 95% / ±2.58 = 99%
95% 信頼区間(B - A の差)
[ -0.10% 〜 1.30% ]
区間が 0 を跨ぐ場合は有意差不明
🟡 90% 信頼で示唆あり

p < 0.10・追加サンプル収集を推奨

💡 A/B テストの基本
  • サンプルサイズ: 最低 1,000 訪問 / 各パターン。少ないと有意差出にくい
  • p-value < 0.05: SaaS / EC で一般的な「有意差あり」基準。新薬等は < 0.01 必須
  • z-test 前提: 各パターン CV 数が 10+ で正規近似が妥当(少ないと Fisher 検定推奨)
  • テスト期間: 最低 7 日(曜日変動考慮)、推奨 14 日(季節要因含む)
  • 同時テスト: 複数 A/B テストを同時実施すると影響が混在。1 テスト 1 仮説が原則
  • 関連: CV率計算機 / コホート分析

良いA/B テスト 統計的有意性 計算の判断基準

A/Bテストの結果(訪問数とCV数)を入れて、差が偶然かどうかを確認する時に使います。p値やバッジが出ても、テストの設計と運用が正しくなければ判定は信頼できません。本番反映を決める前に下の判断基準で確認してください。

  • サンプル数と期間を事前に決めてから判定したか

    結果を毎日覗いて、有意になった瞬間に止めるやり方は、偶然の差を拾う確率を上げてしまいます。テスト開始前に決めたサンプル数・期間まで回し切ってから、判定は1回だけ行います。

  • CV数は計算の前提を満たすだけあるか

    CVが数件しかない場合、このツールが使う検定の前提が崩れることがあります。極端に少ないCV数での判定は、統計の専門的判断が必要な場合があります。

  • ユニークユーザーベースで数えているか

    同じユーザーの複数回CVをそのまま数えると、計算の前提が崩れます。訪問数とCV数はユニークベースで揃えてから入力します。

  • 1回のテストで比較している仮説は1つか

    多くのパターンを同時に比較すると、どれかが偶然有意になる確率が上がります(多重比較)。パターン数が多い場合は、その分判定を厳しく見る必要があります。

  • 「統計的に有意」と「実務的に意味のある差」を分けたか

    有意性は「差が偶然でなさそうか」の判定であって、差の大きさの保証ではありません。改善幅を年間のCV数や売上に換算し、実装コストに見合うかは別途判断します。

  • テスト期間中に片方だけに影響する外部要因はなかったか

    セール、メディア掲載、システム障害、流入元の変化などが期間中に起きていると、差の原因がパターンの違いとは言えなくなります。期間中の出来事を振り返ってから判定します。

ありがちな失敗例(NG → 改善)

NGテスト3日目にp値が0.05を下回ったのを見て即judge・本番反映し、翌週には差が消えていた

改善事前に決めたサンプル数・期間まで回し切り、判定は終了時点の1回だけにする

→ 途中経過を繰り返し確認して有意の瞬間に打ち切る運用は、偶然の差を本物と誤認しやすくなります。判定タイミングを事前に固定するのが防止策です。

NG「BがAに統計的に有意に勝った(CVR 2.1%→2.2%)。全ページに展開すべき」と差の大きさに触れずに報告する

改善改善幅と想定インパクト(年間CV増・売上換算)を併記し、展開にかかる工数・コストと比較して提案する

→ 統計的に有意でも、差が小さければ実装コストに見合わないことがあります。有意性だけを根拠にした展開提案は意思決定の材料として不十分です。

NG5パターン同時のテストでEだけp<0.05が出たので「Eが勝者」と断定して全面切り替えする

改善多パターン比較では偶然有意が混じりやすい前提に立ち、EとAの1対1で改めてテストしてから判断する

→ 比較するパターンが増えるほど、どれかが偶然有意になる確率は上がります。再現性を確認してから切り替えるほうが安全です。

A/B テスト 統計的有意性 計算の使い方

  1. 1テキストを入力またはペーストします
  2. 2「変換する」ボタンをクリックします
  3. 3結果を確認してコピーします

よくある質問

A/B テスト 統計的有意性 計算は無料ですか?

はい、完全無料でご利用いただけます。会員登録も不要です。

スマートフォンでも使えますか?

はい、スマートフォン・タブレット・PCなど、ブラウザがあればどのデバイスでもご利用いただけます。

関連ツール

A/B テスト 統計的有意性 計算について

A/B テストの差がノイズかどうかを p 値と信頼区間で見る

LP 改善 / 広告クリエイティブ / メール件名の A/B テストで「B が A より 0.5% 改善した!」と喜んでも、それがノイズか実際の差かは統計検定が必要。本ツールは訪問数 + CV 数を入れるだけで CVR・改善率・p-value・信頼区間・有意性バッジを瞬時に算出します。

統計的有意性の判断基準

【🟢 p < 0.01(99% 信頼)】本番反映の根拠として十分。新薬・医療系で求められる厳格基準。 【🟢 p < 0.05(95% 信頼)】SaaS / EC で一般的な合格ライン。マーケ業界標準。 【🟡 p < 0.10(90% 信頼)】示唆あり。追加サンプル収集を推奨。 【🔴 p ≥ 0.10】有意差なし。差がノイズの可能性大。継続テストかパターン変更。

この計算機が使っている正規分布近似の式と、判定のしきい値

計算はブラウザの中だけで行われ、入力した数字は外部に送られません。中で使われている式を逐語で書き出します。

【部品の中の式】A の CVR = A の CV 数 ÷ A の訪問数、B の CVR = B の CV 数 ÷ B の訪問数。プールした CVR = (A の CV 数 + B の CV 数) ÷ (A の訪問数 + B の訪問数)。標準誤差 = プールした CVR × (1 - プールした CVR) × (1 ÷ A の訪問数 + 1 ÷ B の訪問数) の平方根。z = 標準誤差が 0 なら 0、そうでなければ (B の CVR - A の CVR) ÷ 標準誤差。両側 p 値 = 2 × (1 - 標準正規分布の累積確率(z の絶対値))。改善率 = A の CVR が 0 なら 0、そうでなければ (B の CVR - A の CVR) ÷ A の CVR。差の標準誤差 = A の CVR ×(1 - A の CVR)÷ A の訪問数 + B の CVR ×(1 - B の CVR)÷ B の訪問数 の平方根。95% 信頼区間 = (B の CVR - A の CVR) ± 1.96 × 差の標準誤差。

累積確率は誤差関数の近似式(Abramowitz & Stegun 7.1.26)で計算されています。つまりこの計算機はフィッシャーの正確確率検定ではなく、正規分布で近似する z 検定です。

【判定のしきい値】p が 0.01 未満で「99% 信頼で有意差あり」、0.05 未満で「95% 信頼で有意差あり」、0.10 未満で「90% 信頼で示唆あり」、それ以外は「統計的有意差なし」。画面の説明にも「z-test 前提: 各パターン CV 数が 10+ で正規近似が妥当(少ないと Fisher 検定推奨)」と書かれています。

5,000 訪問で CV 180 と CV 152 を比べた実処理結果(B の CV 数だけを動かした感度)

編集部で本番ビルドを動かし、画面に出た値を表示のまま記録しました。

【入力 1】A が 5,000 訪問・150 CV、B が 5,000 訪問・180 CV。 【出た値】A の CVR 3.00%、B の CVR 3.60%、改善率(LIFT)+20.00%、P-VALUE(両側)0.0931、Z スコア 1.68、95% 信頼区間(B - A の差)[ -0.10% 〜 1.30% ]。バッジは「🟡 90% 信頼で示唆あり」で「p < 0.10・追加サンプル収集を推奨」。信頼区間は 0 をまたいでおり、画面にも「区間が 0 を跨ぐ場合は有意差不明」と添えられています。改善率が +20.00% と大きく出ていても、判定は有意差ありになりません。

【入力 2】B の CV 数だけ 180 から 152 に変える(訪問数はどちらも 5,000 のまま)。 【出た値】B の CVR 3.04%、改善率 +1.33%、P-VALUE 0.9070、Z スコア 0.12、95% 信頼区間 [ -0.63% 〜 0.71% ]。バッジは「🔴 統計的有意差なし」で「p ≥ 0.10・差がノイズの可能性大。継続テストかパターン変更」。

CV 数を 28 件動かしただけで、p 値は 0.0931 から 0.9070 へ、z は 1.68 から 0.12 へ変わりました。訪問数 5,000 の規模では、CV 数の数十件が判定を丸ごと入れ替えます。テストを 1 日長く回すかどうかで結論が変わり得る、という感覚を持っておいてください。

訪問 10・CV 8 対 9 の極小サンプルで出た実処理結果と、使ってはいけない判断

【入力 3】A が 10 訪問・8 CV、B が 10 訪問・9 CV。 【出た値】A の CVR 80.00%、B の CVR 90.00%、改善率 +12.50%、P-VALUE 0.5312、Z スコア 0.63、95% 信頼区間 [ -20.99% 〜 40.99% ]。バッジは「🔴 統計的有意差なし」。エラーで止まることはなく、判定は有意差なしに倒れました。

【分かったクセ】この計算機は自分の画面に「CV 数が 10+ で正規近似が妥当」と書いていますが、CV が 8 や 9 でも警告は出ず、数字だけが同じ体裁で並びます。前提から外れていることを示すのは、信頼区間が -20.99% 〜 40.99% と極端に広いことだけです。区間の幅は、判定バッジより先に見る価値があります。

【弱点】CV 数が訪問数を超える入力(CVR が 100% を超える組み合わせ)は今回試していません。コードを読む限り、値がマイナスになるのを防ぐ処理はありますが、CVR が 100% を超えるのを止める仕組みは見当たりませんでした(ここは実測していない推測です)。CV 数が訪問数以下だった今回の 3 パターンでは、式が崩れることはありませんでした。ただしこれは 3 パターンで見えた範囲で、どんな入力でも崩れない保証ではありません。

【使ってはいけない判断】CV 数が一桁の結果に出た 90% や 95% のバッジを「もう決着」の根拠にすること。ツール自身が書いているとおり、正規近似の前提が崩れています。

【向かない用途】厳格な検定が要る領域(医療・医薬など)、同じ利用者が何度も CV する仕組みの計測、3 つ以上のパターンを同時に比べる判断には向きません。

【本番反映を決める前の確認】訪問数と CV 数がユニークで揃っているか、信頼区間が 0 をまたいでいないか、区間の幅が実務判断に耐える狭さか、テスト期間中に片方だけに効いた出来事が無かったか。この 4 点を見てから決めてください。

LP・広告クリエイティブ・メール件名の A/B で当てる場面

【1. LP ヘッドライン A/B】2 パターンの LP に同量トラフィックを送って 1 週間後判定。

【2. 広告クリエイティブ A/B】Meta / Google 広告で 2 クリエイティブ並走 → どちらが優位か検定。

【3. メール件名 A/B】メルマガ 2 件名で開封率比較 → 統計的に有意なら勝者展開。

【4. ボタン文言テスト】「無料で試す」vs「30 秒で始める」の CVR 差検定。

【5. プライシング A/B】¥9,800 vs ¥7,980 の CVR + LTV 差検定(注: 価格差は中長期 LTV 影響大)。

正しい A/B テストの進め方

1. 仮説立て: 「B の方が高い CVR を出す」と事前に明文化。 2. サンプルサイズ計算: 各パターン最低 1,000 訪問。CV 10 件以下では z-test 精度低下(Fisher 検定推奨)。 3. 期間: 最低 7 日(曜日変動考慮)、推奨 14 日(季節要因含む)。 4. 1 仮説 1 テスト: 複数テスト同時実施は影響混在。 5. 早めの停止禁止: 「目視で B が良さそう」だけで早期停止すると統計偏向。事前計画期間は守る。 6. 結果の解釈: p-value < 0.05 でも「実用的に意味ある差」かは別。lift 1% でも年間 LTV ベースで判断。

サンプル不足・早期停止・多重比較・SRM でズレる 5 つの型

1つ目: サンプル少 → 各 100 訪問で「30% 差」が出てもノイズの可能性大。最低 1,000 訪問 / 各パターン。

2つ目: 早期停止 → 開始 3 日で「もう勝者見えた」と止めると統計偏向。事前計画した期間 / サンプル数まで継続。

3つ目: 多重比較 → 5 つの A/B/C/D/E パターンで p < 0.05 を達成しても 23% は偶然。多重比較補正(Bonferroni 等)必要。

4つ目: SRM(Sample Ratio Mismatch) → 想定 50%/50% 分配のはずが 40%/60% になっていたら計測バグの可能性。比率も別途チェック。

5つ目: 二項分布の前提崩壊 → CV 1 ユーザー 1 回前提だが、同じユーザーが複数回 CV する仕様だと正規近似が崩れる。ユニーク CV で計算。