定義
二項分布(B ( n , p ) B(n, p) B ( n , p ) )とは、成功確率 p p p のベルヌーイ試行 を独立 に n n n 回繰り返したときの成功回数が従う離散確率分布です。期待値 は n p np n p 、分散は n p ( 1 − p ) np(1-p) n p ( 1 − p ) で、コイン投げの表の回数・A/B テストのコンバージョン回数・品質検査の不良品数を表す基本分布として広く使われます。
成功確率 p p p の試行を 1 回だけ行うことをベルヌーイ試行 (bernoulli trial)といいます。コインを 1 回投げて表が出れば成功(確率 p = 0.5 p=0.5 p = 0.5 )、裏が出れば失敗(確率 1 − p = 0.5 1-p=0.5 1 − p = 0.5 )という単純な試行です。このベルヌーイ試行 を独立 に n n n 回繰り返したとき、成功の総回数を X X X で表します。X X X が従う分布を 二項分布 B ( n , p ) B(n, p) B ( n , p ) と書き、X ∼ B ( n , p ) X \sim B(n, p) X ∼ B ( n , p ) と表記します。
確率質量関数(PMF: probability mass function)は次の式で与えられます。X X X がちょうど k k k 回成功する確率 P ( X = k ) P(X = k) P ( X = k ) を、k = 0 , 1 , … , n k = 0, 1, \ldots, n k = 0 , 1 , … , n に対して計算する式です。
記号の意味を整理します。n n n は試行回数(正の整数)、p p p は 1 回の試行で成功する確率(0 ≤ p ≤ 1 0 \le p \le 1 0 ≤ p ≤ 1 )、k k k は X X X の具体的な値(0 , 1 , … , n 0, 1, \ldots, n 0 , 1 , … , n のいずれか)です。p k ( 1 − p ) n − k p^k(1-p)^{n-k} p k ( 1 − p ) n − k は、成功する位置を固定した一つの並びで、成功 k k k 回・失敗 n − k n-k n − k 回となる確率です。たとえば n = 3 , k = 2 n=3,k=2 n = 3 , k = 2 では、「表表裏」「表裏表」「裏表表」のどれも表 2 回・裏 1 回なので、それぞれ p 2 ( 1 − p ) p^2(1-p) p 2 ( 1 − p ) の確率を持ちます。
( n k ) \binom{n}{k} ( k n ) (読み方: n n n コンビネーション k k k 、または n n n 択 k k k の組み合わせ)は、そのような固定された並びの総数を数えます。n n n 回の試行から成功する k k k 回の位置を選ぶ方法が ( n k ) = n ! k ! ( n − k ) ! \binom{n}{k} = \frac{n!}{k!(n-k)!} ( k n ) = k ! ( n − k )! n ! 通りあり、どの並び順も確率 p k ( 1 − p ) n − k p^k(1-p)^{n-k} p k ( 1 − p ) n − k で起きます。それを足し合わせた結果が P ( X = k ) P(X=k) P ( X = k ) です。
性質
試行の独立性 が前提 : n n n 回の試行が互いに独立 でなければ V a r [ X ] = n p ( 1 − p ) \mathrm{Var}[X] = np(1-p) Var [ X ] = n p ( 1 − p ) は成り立ちません。試行間に正の相関があると分散は n p ( 1 − p ) np(1-p) n p ( 1 − p ) より膨らみ、負の相関なら縮みます。期待値 E [ X ] = n p E[X]=np E [ X ] = n p は独立性 なしに成り立ちます (期待値の線形性 だけで導けるため)。期待値 と分散で独立性 の要否が異なる点は深掘りセクションで詳しく扱います。
期待値 E [ X ] = n p E[X]=np E [ X ] = n p は線形性 で 2 行 : 成功回数を X = X 1 + X 2 + ⋯ + X n X = X_1 + X_2 + \cdots + X_n X = X 1 + X 2 + ⋯ + X n (各 X i X_i X i は 0 か 1 のベルヌーイ変数 )と分解すると、E [ X i ] = p E[X_i] = p E [ X i ] = p です。期待値の線形性 から E [ X ] = ∑ i = 1 n E [ X i ] = n p E[X] = \sum_{i=1}^{n} E[X_i] = np E [ X ] = ∑ i = 1 n E [ X i ] = n p が得られます。独立性 は不要です。
分散 V a r [ X ] = n p ( 1 − p ) \mathrm{Var}[X]=np(1-p) Var [ X ] = n p ( 1 − p ) には独立性 が必要 : 各 X i X_i X i の分散は V a r [ X i ] = p ( 1 − p ) \mathrm{Var}[X_i] = p(1-p) Var [ X i ] = p ( 1 − p ) で(ベルヌーイ変数 は 0 か 1 なので X i 2 = X i X_i^2 = X_i X i 2 = X i 、よって E [ X i 2 ] − ( E [ X i ] ) 2 = p − p 2 = p ( 1 − p ) E[X_i^2] - (E[X_i])^2 = p - p^2 = p(1-p) E [ X i 2 ] − ( E [ X i ] ) 2 = p − p 2 = p ( 1 − p ) )、独立 な確率変数 の和の分散は分散の和になる性質から V a r [ X ] = n p ( 1 − p ) \mathrm{Var}[X] = np(1-p) Var [ X ] = n p ( 1 − p ) となります。
p = 0.5 p=0.5 p = 0.5 で左右対称、p p p が 0 や 1 に近いと偏る : p = 0.5 p=0.5 p = 0.5 のとき PMF は k = n / 2 k=n/2 k = n /2 を中心に左右対称な釣鐘型になります。p = 0.1 p=0.1 p = 0.1 なら低い k k k 側に質量が集中した右裾の長い形になり、p = 0.9 p=0.9 p = 0.9 なら高い k k k 側に集まった左裾の長い形になります。
視覚的に見る
B ( 100 , 0.5 ) B(100, 0.5) B ( 100 , 0.5 ) の確率質量関数を縦棒グラフで示します。横軸が成功回数 k k k 、縦軸が確率 P ( X = k ) = ( 100 k ) ( 0.5 ) 100 P(X=k) = \binom{100}{k}(0.5)^{100} P ( X = k ) = ( k 100 ) ( 0.5 ) 100 です。赤の縦線が μ = n p = 50 \mu = np = 50 μ = n p = 50 (期待値 )、青の破線 2 本が μ − σ = 45 \mu - \sigma = 45 μ − σ = 45 と μ + σ = 55 \mu + \sigma = 55 μ + σ = 55 (σ = n p ( 1 − p ) = 25 = 5 \sigma = \sqrt{np(1-p)} = \sqrt{25} = 5 σ = n p ( 1 − p ) = 25 = 5 )です。
B(100, 0.5) の確率質量関数: コインを 100 回投げたときの表の回数の分布 μ = np = 50 μ - σ = 45 μ + σ = 55 35 40 45 50 55 60 65 成功回数 k 0.00 0.02 0.04 0.06 0.08 P(X = k)
各縦棒の高さは「コインを 100 回投げたとき、表がちょうど k k k 回出る確率」です。k = 50 k=50 k = 50 で約 7.96% が最大で、そこから左右に離れるほど確率は急速に小さくなっていきます。k = 40 k=40 k = 40 や k = 60 k=60 k = 60 ではすでに 1.08% 程度まで下がっています。
青の破線で囲まれた k = 45 k=45 k = 45 から k = 55 k=55 k = 55 の範囲、つまり「平均 ± 1 標準偏差」の帯に全確率 の約 73%(正確には 72.87%)が収まっています。正規分布の経験則(± 1 σ 1\sigma 1 σ に約 68%)に近い数字が、n n n が大きい二項分布でも自然に現れます。これは偶然ではなく、後述する正規近似の理論的な背景があります。
p p p を 0.5 から外すと、図の形は非対称になります。p = 0.3 p=0.3 p = 0.3 なら棒の山は k = 30 k=30 k = 30 近傍に移動し、右裾が長くなります。p = 0.7 p=0.7 p = 0.7 ならその鏡像です。μ = n p \mu = np μ = n p は p p p に比例して左右に動き、σ = n p ( 1 − p ) \sigma = \sqrt{np(1-p)} σ = n p ( 1 − p ) は p = 0.5 p=0.5 p = 0.5 のとき最大になり、p p p が 0 や 1 に近づくと縮んでいきます。
実世界での使われ方
A/B テストのコンバージョン数 : ウェブサービスで「新デザインで 1,000 人中何人がボタンをクリックしたか」は、クリック率 p p p のベルヌーイ試行 n = 1,000 n=1{,}000 n = 1 , 000 回として B ( 1000 , p ) B(1000, p) B ( 1000 , p ) で扱えます。統計的有意性の検定(フィッシャーの正確検定や χ 2 \chi^2 χ 2 検定)は内部でこの二項分布を使います。Kohavi らの実験設計の教科書(Trustworthy Online Controlled Experiments , Cambridge UP 2020 )の第 4 章では、二項分布を前提とした検出力計算と標本サイズ決定が詳細に解説されています。
品質管理(QC)の不良品検査 : 製造ラインからサンプリングした n n n 個の製品のうち不良品が何個か、という問いです。不良率 p p p の母集団からの独立 サンプリング下で不良品数は B ( n , p ) B(n, p) B ( n , p ) に従い、JIS の n p np n p 管理図・p p p 管理図の理論的基礎になっています(JIS Z 9020-2:2016 シューハート管理図 参照)。μ = n p \mu = np μ = n p が管理中心線、μ ± 3 σ = n p ± 3 n p ( 1 − p ) \mu \pm 3\sigma = np \pm 3\sqrt{np(1-p)} μ ± 3 σ = n p ± 3 n p ( 1 − p ) が管理限界線です。
ワクチン有効率の信頼区間 : 治験でワクチン群 N N N 人中 X X X 人が感染した場合、感染者数は B ( N , p vaccine ) B(N, p_{\text{vaccine}}) B ( N , p vaccine ) に従います。Polack ら(NEJM 2020 )のファイザー mRNA ワクチン治験は、この二項分布ベースの信頼区間で 95.0%(95% CI: 90.3〜97.6%)のワクチン有効率を報告しました。
遺伝学のメンデル比 : 雑種第二代の個体 n n n 個体における優性表現型の個数は、優性発現確率 p = 3 / 4 p = 3/4 p = 3/4 のベルヌーイ試行 の和として B ( n , 3 / 4 ) B(n, 3/4) B ( n , 3/4 ) に従います。メンデルの実験では期待値 n p = 3 n / 4 np = 3n/4 n p = 3 n /4 の「3 対 1 比」が確認されました。
深掘り
分散の導出は計算に慣れた読者向けです。結果 n p ( 1 − p ) np(1-p) n p ( 1 − p ) だけ覚えれば実用上は足ります。
分散 n p ( 1 − p ) np(1-p) n p ( 1 − p ) の導出
X = X 1 + X 2 + ⋯ + X n X = X_1 + X_2 + \cdots + X_n X = X 1 + X 2 + ⋯ + X n (各 X i X_i X i は独立 なベルヌーイ変数 )と分解します。ベルヌーイ変数 は 0 か 1 しか取らないので X i 2 = X i X_i^2 = X_i X i 2 = X i が成り立ちます。よって
となります。
ここで「独立 な確率変数 の和の分散は、各変数の分散の和に等しい」という性質(stats-08 で詳しく扱います)を使います。独立性 があるとき V a r [ X 1 + ⋯ + X n ] = V a r [ X 1 ] + ⋯ + V a r [ X n ] \mathrm{Var}[X_1 + \cdots + X_n] = \mathrm{Var}[X_1] + \cdots + \mathrm{Var}[X_n] Var [ X 1 + ⋯ + X n ] = Var [ X 1 ] + ⋯ + Var [ X n ] が成り立つので
が得られます。
ここで「独立性 」が効いています。期待値の線形性 E [ X 1 + ⋯ + X n ] = E [ X 1 ] + ⋯ + E [ X n ] E[X_1 + \cdots + X_n] = E[X_1] + \cdots + E[X_n] E [ X 1 + ⋯ + X n ] = E [ X 1 ] + ⋯ + E [ X n ] は独立性 なしに成り立ちますが、分散の加法性 V a r [ ∑ X i ] = ∑ V a r [ X i ] \mathrm{Var}[\sum X_i] = \sum \mathrm{Var}[X_i] Var [ ∑ X i ] = ∑ Var [ X i ] は独立性 (より正確には無相関性)を必要とします。試行間に正の相関が混入すると、この等式の右辺に共分散の正の項が加わり、分散は n p ( 1 − p ) np(1-p) n p ( 1 − p ) より大きくなります。二項分布の定義に「独立 な繰り返し」が組み込まれているのはそのためです。
アンケートで「同じ世帯から複数人を抽出する」設計では、同世帯の回答者間に相関が生じます。このとき不良品数や陽性者数を B ( n , p ) B(n, p) B ( n , p ) で扱うと、実際の分散を過小評価します。これを過分散 (overdispersion)と呼びます。
正規近似と中心極限定理
n n n が大きく p p p が極端でない(経験則として n p ≥ 5 np \ge 5 n p ≥ 5 かつ n ( 1 − p ) ≥ 5 n(1-p) \ge 5 n ( 1 − p ) ≥ 5 )とき、B ( n , p ) B(n, p) B ( n , p ) は正規分布で近似できます。
これは中心極限定理(CLT)の最も古典的な応用です。X = X 1 + ⋯ + X n X = X_1 + \cdots + X_n X = X 1 + ⋯ + X n は独立 同分布の確率変数 の和であり、CLT は「和が正規分布に近づく」ことを保証します。この結果は de Moivre が 1733 年に p = 1 / 2 p=1/2 p = 1/2 の場合に発見し、Laplace が 1812 年に一般の p p p へ拡張しました(de Moivre-Laplace の定理)。
上の図で B ( 100 , 0.5 ) B(100, 0.5) B ( 100 , 0.5 ) が釣鐘型に見えるのはこの近似が働いているからです。正規分布の経験則「± 1 σ \pm 1\sigma ± 1 σ に約 68%」が二項分布でも成り立つ(実際は約 73%、正確には 72.87%)のも、正規近似の精度の高さを反映しています。
連続修正(continuity correction)
正規分布は連続で、二項分布は離散です。P ( X = 50 ) P(X = 50) P ( X = 50 ) を正規近似で計算するとき、P ( 49.5 ≤ Z ≤ 50.5 ) P(49.5 \le Z \le 50.5) P ( 49.5 ≤ Z ≤ 50.5 ) と計算すると精度が上がります。これを連続修正(continuity correction)といいます。n n n が小さいほど差が大きくなります。
ポアソン近似: 稀な事象の極限
n n n が大きく p p p が小さい(経験則として n ≥ 20 n \ge 20 n ≥ 20 かつ p ≤ 0.05 p \le 0.05 p ≤ 0.05 )とき、λ = n p \lambda = np λ = n p を固定したまま n → ∞ n \to \infty n → ∞ 、p → 0 p \to 0 p → 0 とする極限で B ( n , p ) B(n, p) B ( n , p ) はポアソン分布 P o ( λ ) \mathrm{Po}(\lambda) Po ( λ ) に収束します。
この極限の直感は「稀な事象を多数回観測する」場面に対応します。1 日の交通事故件数(1 分ごとに「事故が起きる確率 p p p 」のベルヌーイ試行 を n = 1440 n = 1440 n = 1440 回繰り返す)や、1 ページ中のタイポ数、1 ヶ月のサーバー障害回数が典型例です。
ポアソン分布の期待値 と分散はどちらも λ \lambda λ に等しく、V a r [ X ] / E [ X ] = 1 \mathrm{Var}[X] / E[X] = 1 Var [ X ] / E [ X ] = 1 が成り立ちます。二項分布での比は V a r [ X ] / E [ X ] = n p ( 1 − p ) / n p = 1 − p \mathrm{Var}[X] / E[X] = np(1-p) / np = 1-p Var [ X ] / E [ X ] = n p ( 1 − p ) / n p = 1 − p であり、p → 0 p \to 0 p → 0 の極限でこれが 1 に収束することと一致します。
n n n 大・p p p 中庸(n p ≥ 5 np \ge 5 n p ≥ 5 かつ n ( 1 − p ) ≥ 5 n(1-p) \ge 5 n ( 1 − p ) ≥ 5 )のとき → 正規近似 。n n n 大・p p p 小(λ = n p \lambda = np λ = n p が定数)のとき → ポアソン近似 。どちらの極限を取るかで適切な近似分布が変わります。
関連する用語
期待値 (E [ X ] = n p E[X] = np E [ X ] = n p の導出が期待値の線形性 の典型例)
ベルヌーイ分布 (n = 1 n=1 n = 1 の特殊ケース。二項分布の構成要素)
確率変数 (X ∼ B ( n , p ) X \sim B(n,p) X ∼ B ( n , p ) の X X X がそれ)
期待値の線形性 (E [ X ] = n p E[X]=np E [ X ] = n p を 2 行で導く道具。独立性 なしに成り立つ)
指示変数 (ベルヌーイ変数 の別名。各 X i X_i X i として和に分解するときに使う概念)
詳しくは
stats-06: 期待値 (期待値の線形性 で E [ X ] = n p E[X]=np E [ X ] = n p を 2 行で導く節)
stats-05: 確率の直感 (B ( 100 , 0.5 ) B(100, 0.5) B ( 100 , 0.5 ) の中心 50 と σ = 5 \sigma=5 σ = 5 が初出した文脈)