Probability distribution modeling a coin toss which need not be fair
確率論と統計学において、スイスの数学者ヤコブ・ベルヌーイにちなんで名付けられたベルヌーイ分布[1]は、確率で値1をとり、確率で値0をとる確率を持つ確率変数の離散確率分布です。より形式的には、イエス・ノーで答える質問をする任意の単一の実験の可能な結果の集合のモデルと考えることができます。このような質問は、ブール値、つまり確率pで成功/はい/真/ 1 、確率qで失敗/いいえ/偽/ 0となる単一ビットの結果をもたらします。これは、(おそらく偏りのある)コイン投げを表すために使用できます。この場合、1と0はそれぞれ「表」と「裏」を表し、pはコインが表になる確率です(またはその逆で、1は裏を表し、pは裏になる確率です)。特に、不公平なコインは

ベルヌーイ分布は、二項分布の特殊なケースであり、試行は1回のみです(したがって、このような二項分布ではnは1になります)。また、二点分布の特殊なケースでもあり、起こり得る結果は0と1である必要はありません。[2]
特性
がベルヌーイ分布に従う確率変数である場合、次のようになります。

この分布の確率質量関数は、起こり得る結果 k に対して、次 のようになります。[3]

これは次のようにも表すことができます。

または

ベルヌーイ分布は、二項分布の特殊なケースであり、 [4]に従います。
の値が高ければ尖度は無限大になりますが、ベルヌーイ分布を含む二点分布では、他のどの確率分布よりも過剰尖度が低く、-2です。

のベルヌーイ分布は指数族を形成します
ランダムサンプルに基づくの最大尤度推定値はサンプル平均です。
ベルヌーイ実験の確率質量分布関数と、それに対応する累積分布関数平均
ベルヌーイ確率変数の期待値は
![{\displaystyle \operatorname {E} [X]=p}](data:image/gif;base64,R0lGODlhAQABAIAAAAAAAP///yH5BAEAAAAALAAAAAABAAEAAAIBRAA7)
これは、ベルヌーイ分布の確率変数がおよび の場合、次式が得られるからです[3]


![{\displaystyle {\begin{aligned}\operatorname {E} [X]&=\Pr(X{=}1)\cdot 1+\Pr(X{=}0)\cdot 0\\[1ex]&=p\cdot 1+q\cdot 0\\[1ex]&=p.\end{aligned}}}](data:image/gif;base64,R0lGODlhAQABAIAAAAAAAP///yH5BAEAAAAALAAAAAABAAEAAAIBRAA7)
分散
ベルヌーイ分布に従う確率変数の分散は
![{\displaystyle \operatorname {Var} [X]=pq=p(1-p)}](data:image/gif;base64,R0lGODlhAQABAIAAAAAAAP///yH5BAEAAAAALAAAAAABAAEAAAIBRAA7)
まず、
![{\displaystyle {\begin{aligned}\operatorname {E} [X^{2}]&=\Pr(X{=}1)\cdot 1^{2}+\Pr(X{=}0)\cdot 0^{2}\\&=p\cdot 1^{2}+q\cdot 0^{2}\\&=p=\operatorname {E} [X]\end{aligned}}}](data:image/gif;base64,R0lGODlhAQABAIAAAAAAAP///yH5BAEAAAAALAAAAAABAAEAAAIBRAA7)
このことから、[3]が続きます
![{\displaystyle {\begin{aligned}\operatorname {Var} [X]&=\operatorname {E} [X^{2}]-\operatorname {E} [X]^{2}=\operatorname {E} [X]-\operatorname {E} [X]^{2}\\[1ex]&=pp^{2}=p(1-p)=pq\end{aligned}}}](data:image/gif;base64,R0lGODlhAQABAIAAAAAAAP///yH5BAEAAAAALAAAAAABAAEAAAIBRAA7)
この結果から、任意のベルヌーイ分布について、その分散が の範囲内の値を持つことは容易に証明できます。![{\displaystyle [0,1/4]}](data:image/gif;base64,R0lGODlhAQABAIAAAAAAAP///yH5BAEAAAAALAAAAAABAAEAAAIBRAA7)
歪度
歪度はです。標準化されたベルヌーイ分布に従う確率変数を取ると、この確率変数はの確率で に達し、の確率で に達することがわかります。したがって、
![{\displaystyle {\frac {X-\operatorname {E} [X]}{\sqrt {\operatorname {Var} [X]}}}](data:image/gif;base64,R0lGODlhAQABAIAAAAAAAP///yH5BAEAAAAALAAAAAABAAEAAAIBRAA7)




![{\displaystyle {\begin{aligned}\gamma _{1}&=\operatorname {E} \left[\left({\frac {X-\operatorname {E} [X]}{\sqrt {\operatorname {Var} [X]}}}\right)^{3}\right]\\&=p\cdot \left({\frac {q}{\sqrt {pq}}}\right)^{3}+q\cdot \left(-{\frac {p}{\sqrt {pq}}}\right)^{3}\\&={\frac {1}{{\sqrt {pq}}^{3}}}\left(pq^{3}-qp^{3}\right)\\&={\frac {pq}{{\sqrt {pq}}^{3}}}(q^{2}-p^{2})\\&={\frac {(1-p)^{2}-p^{2}}{\sqrt {pq}}}\\&={\frac {1-2p}{\sqrt {pq}}}={\frac {qp}{\sqrt {pq}}}.\end{aligned}}}](data:image/gif;base64,R0lGODlhAQABAIAAAAAAAP///yH5BAEAAAAALAAAAAABAAEAAAIBRAA7)
高次モーメントとキュムラント
および であるため、生のモーメントはすべて等しいです。

![{\displaystyle \operatorname {E} [X^{k}]=\Pr(X{=}1)\cdot 1^{k}+\Pr(X{=}0)\cdot 0^{k}=p\cdot 1+q\cdot 0=p=\operatorname {E} [X].}](data:image/gif;base64,R0lGODlhAQABAIAAAAAAAP///yH5BAEAAAAALAAAAAABAAEAAAIBRAA7)
次数の中心モーメントは で与えられます。最初の6つの中心モーメントは です。高次中心モーメントは および でより簡潔に表すことができます。最初の6つのキュムラントは






エントロピー
エントロピーは、確率分布における不確実性またはランダム性の尺度です。成功確率と失敗確率を持つベルヌーイ確率変数の場合、エントロピーは次のように定義されます。



![{\displaystyle {\begin{aligned}H(X)&=\mathbb{E}_{p}\ln {\frac{1}{\Pr(X)}}\\[1ex]&=-\Pr(X{=}0)\ln \Pr(X{=}0)-\Pr(X{=}1)\ln \Pr(X{=}1)\\[1ex]&=-(q\ln q+p\ln p).\end{aligned}}}](data:image/gif;base64,R0lGODlhAQABAIAAAAAAAP///yH5BAEAAAAALAAAAAABAAEAAAIBRAA7)
エントロピーは のときに最大になり、両方の結果が等しく起こりうる場合に不確実性が最も高くなることを示します。またはのとき、エントロピーはゼロになり、一方の結果が確実です。


フィッシャー情報量は、観測可能な確率変数が、確率が依存する未知のパラメータについて持つ情報量を測定します。ベルヌーイ分布の場合、パラメータに関するフィッシャー情報量は次のように与えられます。




証明:
- ベルヌーイ確率変数の尤度関数は次のとおりです。これは、パラメータ が与えられた場合に観測される確率を表します。




- 対数尤度関数は次のとおりです

- スコア関数(対数尤度の1次微分)は:


- 対数尤度関数の2次微分は:

- フィッシャー情報量は、対数尤度の2次微分の負の期待値として計算されます:
![{\displaystyle {\begin{aligned}I(p)=-E\left[{\frac {\partial ^{2}}{\partial p^{2}}}\ln L(p;X)\right]=-\left(-{\frac {p}{p^{2}}}-{\frac {1-p}{(1-p)^{2}}}\right)={\frac {1}{p(1-p)}}={\frac {1}{pq}}\end{aligned}}}](data:image/gif;base64,R0lGODlhAQABAIAAAAAAAP///yH5BAEAAAAALAAAAAABAAEAAAIBRAA7)
のときに最大になり、最大の不確実性、つまりパラメータに関する最大の情報を反映します。

- が独立かつ同一分布(iid)の確率変数であり、すべてのベルヌーイ試行が成功確率 pである場合、それらの和はパラメータnとpを持つ二項分布に従って分布します。

(二項分布)[3]
- ベルヌーイ分布は単にとも表記されます。


- カテゴリ分布は、任意の定数個の離散値を持つ変数に対するベルヌーイ分布の一般化です。
- ベータ分布は、ベルヌーイ分布の共役事前分布です。 [5]
- 幾何分布は、 1回の成功を得るために必要な独立かつ同一のベルヌーイ試行の数をモデル化します。
- の場合、はラーデマッハ分布に従います。


参照
参考文献
著者の言及
外部リンク
ウィキメディア・コモンズには、ベルヌーイ分布に関連するメディアがあります。