指示確率変数 とは、事象 A A A に対して結果が A A A に含まれるとき 1、含まれないとき 0 を返す確率変数 です。期待値 を取ると E [ I A ] = P ( A ) E[I_A] = P(A) E [ I A ] = P ( A ) となり、確率を期待値 の計算体系に乗せる道具として使われます。
定義
標本空間 Ω \Omega Ω の部分集合として定義される事象 A A A に対し、指示確率変数 (indicator variable)I A I_A I A は次の規則で値を取ります。
ここで ω \omega ω は標本空間 Ω \Omega Ω の要素(1 回の試行で生じる 1 つの結果)、A c A^c A c は A A A の補集合です。
記法は文献によって I A I_A I A 、1 A 1_A 1 A 、1 A \mathbf{1}_A 1 A 、1 A \mathbb{1}_A 1 A の 4 通りが混在します。本ページでは I A I_A I A を使います。「指示関数(indicator function)」と同じ意味で使われることもありますが、確率論の特性関数(characteristic function φ X ( t ) = E [ e i t X ] \varphi_X(t) = E[e^{itX}] φ X ( t ) = E [ e i tX ] )とは別物です。英語名で indicator function vs characteristic function を区別するのが安全です。
性質
機能関係の核心 : E [ I A ] = 1 ⋅ P ( A ) + 0 ⋅ P ( A c ) = P ( A ) E[I_A] = 1 \cdot P(A) + 0 \cdot P(A^c) = P(A) E [ I A ] = 1 ⋅ P ( A ) + 0 ⋅ P ( A c ) = P ( A ) 。期待値 を取ると確率になります。この等式は定義から自動的に出る事実で、計算なしに常に成り立ちます。
べき等性 : I A 2 = I A I_A^2 = I_A I A 2 = I A 。値が 0 か 1 なので、何乗しても元の値のままです。
積で交わりを表す : I A ∩ B = I A ⋅ I B I_{A \cap B} = I_A \cdot I_B I A ∩ B = I A ⋅ I B 。両方の事象が起きているときに限り 1 になります。
和は包除原理に対応 : I A ∪ B = I A + I B − I A I B I_{A \cup B} = I_A + I_B - I_A I_B I A ∪ B = I A + I B − I A I B 。
分散はベルヌーイ分布 の分散と同じ形 : V a r ( I A ) = P ( A ) ( 1 − P ( A ) ) \mathrm{Var}(I_A) = P(A)(1 - P(A)) Var ( I A ) = P ( A ) ( 1 − P ( A )) 。
視覚的に見る
事象 A = { 2 ≤ ω ≤ 5 } A = \{2 \le \omega \le 5\} A = { 2 ≤ ω ≤ 5 } を標本空間 [ 0 , 7 ] [0, 7] [ 0 , 7 ] の区間として設定したとき、I A ( ω ) I_A(\omega) I A ( ω ) が描くグラフです。横軸は試行結果 ω \omega ω 、縦軸は指示変数の値(0 か 1)です。
事象 A と指示変数 I_A のグラフ 事象 A = [2, 5] I_A = 1 I_A = 0 I_A = 0 0 1 2 3 4 5 6 7 ω(標本空間) 0 1 I_A(ω)
青い太線の区間が事象 A = [ 2 , 5 ] A = [2, 5] A = [ 2 , 5 ] です。結果 ω \omega ω がこの区間に入ると I A = 1 I_A = 1 I A = 1 (上段)、区間の外なら I A = 0 I_A = 0 I A = 0 (下段)になります。ジャンプ点(ω = 2 \omega = 2 ω = 2 と ω = 5 \omega = 5 ω = 5 )では左端の点が塗りつぶし(区間内に含む)、右端の点が白抜き(区間外)になっています。
E [ I A ] = P ( A ) E[I_A] = P(A) E [ I A ] = P ( A ) は、この図でいえば「ステップが 1 になっている区間の確率」が期待値 と一致することを示しています。
実世界での使われ方
機械学習の 0-1 損失 。分類問題の 0-1 損失は L ( y , y ^ ) = I { y ≠ y ^ } L(y, \hat{y}) = I_{\{y \neq \hat{y}\}} L ( y , y ^ ) = I { y = y ^ } と書けます。予測 y ^ \hat{y} y ^ が正解 y y y と外れたら 1、当たれば 0 を返す指示変数です。学習データ n n n 件の経験誤分類率 1 n ∑ i = 1 n I { y i ≠ y ^ i } \frac{1}{n}\sum_{i=1}^{n} I_{\{y_i \neq \hat{y}_i\}} n 1 ∑ i = 1 n I { y i = y ^ i } の期待値 は E [ I A ] = P ( A ) E[I_A] = P(A) E [ I A ] = P ( A ) により真の誤分類確率 P ( Y ≠ Y ^ ) P(Y \neq \hat{Y}) P ( Y = Y ^ ) に一致します。この一致関係が「誤分類率を下げることが最適化の目的と等価になる」根拠です。詳細は scikit-learn の 0-1 loss ドキュメント で確認できます。
公的統計のカテゴリ別集計 。総務省統計局「国勢調査 」では「65 歳以上」「単独世帯」「就業者」などのカテゴリ別人数を集計します。内部的には各個人 i i i に対して I { i ∈ A } I_{\{i \in A\}} I { i ∈ A } を計算して合計する処理です。期待値の線形性 により、サンプリング調査でも E [ I ˉ A ] = P ( A ) E[\bar{I}_A] = P(A) E [ I ˉ A ] = P ( A ) が保証されるため、標本から母集団全体の比率を推定することが正当化されます。
金融のデジタルオプション 。ヨーロピアン・キャッシュオアナッシングコール(cash-or-nothing call)のペイオフは I { S T > K } I_{\{S_T > K\}} I { S T > K } で書けます。満期 T T T に原資産価格 S T S_T S T が行使価格 K K K を上回れば 1 単位の現金を受け取り、下回れば 0 の契約です。無裁定価格付けができる市場でリスク中立測度を Q Q Q 、満期までの割引因子を D ( 0 , T ) D(0,T) D ( 0 , T ) とすると、現在価格は
です。一定の連続複利金利 r r r なら D ( 0 , T ) = e − r T D(0,T)=e^{-rT} D ( 0 , T ) = e − r T です。指示変数は満期ペイオフを確率に変え、割引因子がその満期価値を現在価値へ変換します。日本取引所グループのデリバティブ商品概要 でデリバティブ商品の概要を確認できます。
深掘り
確率 p p p で成功する独立 な試行を n n n 回繰り返すとき、i i i 回目の試行で成功する事象を A i A_i A i とおきます。X i = I A i X_i = I_{A_i} X i = I A i は値 1(成功)か 0(失敗)を取り、E [ X i ] = P ( A i ) = p E[X_i] = P(A_i) = p E [ X i ] = P ( A i ) = p です。
合計成功回数 X = X 1 + X 2 + ⋯ + X n X = X_1 + X_2 + \cdots + X_n X = X 1 + X 2 + ⋯ + X n の期待値 は、期待値の線形性 により
で即座に出ます。素朴な計算では E [ X ] = ∑ k = 0 n k ( n k ) p k ( 1 − p ) n − k E[X] = \sum_{k=0}^{n} k \binom{n}{k} p^k (1-p)^{n-k} E [ X ] = ∑ k = 0 n k ( k n ) p k ( 1 − p ) n − k を二項展開で処理する必要がありますが、指示変数による分解では 2 行で完了します。親記事 stats-06: 期待値とは何か 節 6「線形性 の威力」が指しているのは、この分解です。
独立性 なしで成り立つ一般化
上の二項分布 の導出では、A i A_i A i の独立性 を使っていません 。期待値の線形性 E [ X + Y ] = E [ X ] + E [ Y ] E[X + Y] = E[X] + E[Y] E [ X + Y ] = E [ X ] + E [ Y ] は独立性 を要求しないからです。一般に事象 A 1 , … , A n A_1, \ldots, A_n A 1 , … , A n が独立 でなくても
は常に成立します。たとえばランダムな順列で「固定点(自分の位置に来る要素)」の個数の期待値 を求める場合、各位置 i i i の固定点確率は 1 / n 1/n 1/ n ですが、各事象は独立 でありません。それでも E [ X ] = ∑ i = 1 n 1 n = 1 E[X] = \sum_{i=1}^{n} \frac{1}{n} = 1 E [ X ] = ∑ i = 1 n n 1 = 1 が成立します。確率の和 P ( A ∪ B ) P(A \cup B) P ( A ∪ B ) の計算では包除原理の複雑な処理が必要ですが、指示変数を通した期待値 の計算なら独立性 の有無に関わらず線形に足し合わせられます。
特性関数との混同回避
日本語の確率論教科書では I A I_A I A を「指示関数」と書く文献と「特性関数」と書く文献が混在します。しかし確率論の特性関数(characteristic function)とは φ X ( t ) = E [ e i t X ] \varphi_X(t) = E[e^{itX}] φ X ( t ) = E [ e i tX ] であり、指示変数とは全く別の概念です。英語名で indicator function と characteristic function を区別する習慣をつけておくと、英語文献を読む際に混乱しません。本ページでは一貫して「指示確率変数 ・指示関数(indicator)」と呼びます。
よくある誤解
「指示変数の期待値 は確率である」は常に成り立つ事実 です。I A I_A I A が取る値は 0 か 1 の 2 択なので、期待値 の計算は 1 ⋅ P ( A ) + 0 ⋅ P ( A c ) = P ( A ) 1 \cdot P(A) + 0 \cdot P(A^c) = P(A) 1 ⋅ P ( A ) + 0 ⋅ P ( A c ) = P ( A ) に帰着します。「事象が起きるかどうかわからないから期待値 も曖昧」という誤解が生じることがありますが、期待値 は確率を重みとした平均であり、P ( A ) P(A) P ( A ) が決まれば E [ I A ] E[I_A] E [ I A ] も自動的に決まります。
関連する用語
算術平均 (経験指示変数の平均 1 n ∑ i = 1 n I A i \frac{1}{n}\sum_{i=1}^{n} I_{A_i} n 1 ∑ i = 1 n I A i が母集団比率 P ( A ) P(A) P ( A ) の推定量になります)
期待値 (E [ I A ] = P ( A ) E[I_A] = P(A) E [ I A ] = P ( A ) の左辺を定義する概念。指示変数は期待値 計算の最小単位として機能します)
この用語を扱う本編記事
stats-06: 期待値とは何か (節 6「二項分布 の期待値 が 2 行で出る」で各試行を指示変数として分解する核心場面)