Skip to content

负二项分布的期望与方差推导

这份笔记整理负二项分布的两个常见表述,并完整推导它们的期望与方差。

核心设定:

  • 每次试验只有成功和失败两种结果。
  • 每次成功概率为 p
  • 每次失败概率为 q=1p
  • 各次试验相互独立,且成功概率不变。
  • 目标是等到第 r 次成功。

负二项分布可以看成几何分布的推广:

几何分布等第 1 次成功,负二项分布等第 r 次成功。

两种常见表述

负二项分布最容易混乱的地方,是随机变量可以有两种定义。

表述一:失败次数版

Y 表示“第 r 次成功之前失败的次数”。

如果第 r 次成功之前刚好失败 k 次,那么总试验次数是 k+r 次,并且最后一次试验必须成功。

k+r1 次试验中,需要刚好有:

  • r1 次成功;
  • k 次失败。

因此:

P(Y=k)=(k+r1r1)prqk,k=0,1,2,

这个版本的均值和方差是:

E[Y]=rqpVar(Y)=rqp2

表述二:总试验次数版

X 表示“得到第 r 次成功所需的总试验次数”。

如果第 n 次试验刚好得到第 r 次成功,那么第 n 次必须成功,并且前 n1 次中刚好有 r1 次成功。

因此:

P(X=n)=(n1r1)prqnr,n=r,r+1,r+2,

这个版本的均值和方差是:

E[X]=rpVar(X)=rqp2

两个版本的关系很简单:

X=Y+r

所以:

E[X]=E[Y]+r

而方差不变:

Var(X)=Var(Y+r)=Var(Y)

原因是:加上常数只会整体平移分布,不会改变随机变量围绕均值波动的程度。

先推几何分布

推导负二项分布的均值和方差,最干净的方法不是直接对组合数求和,而是先推几何分布,再把负二项分布拆成若干段几何分布。

G 表示“第一次成功前失败的次数”。

于是:

P(G=k)=qkp,k=0,1,2,

我们需要推:

E[G]=qpVar(G)=qp2

为了做到这一点,需要两个级数结论:

k=0kqk=q(1q)2k=0k2qk=q(1+q)(1q)3

其中 |q|<1。在概率问题中,q 是失败概率,所以通常 0q<1

级数结论:两次求导法

从等比级数开始:

k=0qk=11q

推导 kqk

两边对 q 求导:

k=1kqk1=1(1q)2

两边乘以 q

k=1kqk=q(1q)2

因为 k=0 项本来就是 0,所以:

k=0kqk=q(1q)2

推导 k2qk

记:

S1(q)=k=0kqk=q(1q)2

S1(q) 求导:

S1(q)=k=1k2qk1

右边用乘积形式求导:

S1(q)=q(1q)2

所以:

S1(q)=(1q)2+2q(1q)3

通分:

S1(q)=1q+2q(1q)3=1+q(1q)3

再乘以 q

qS1(q)=k=1k2qk=q(1+q)(1q)3

因此:

k=0k2qk=q(1+q)(1q)3

这就是“两次求导”的路线:先从等比级数求导得到 kqk,再对 kqk 求导得到 k2qk

级数结论:错位相减法

同样两个结论也可以用错位相减推出。

推导 kqk

记:

S1=q+2q2+3q3+4q4+

两边乘以 q

qS1=q2+2q3+3q4+4q5+

错位相减:

S1qS1=q+q2+q3+q4+

右边是等比级数:

q+q2+q3+=q1q

所以:

(1q)S1=q1q

得到:

S1=q(1q)2

也就是:

k=0kqk=q(1q)2

推导 k2qk

记:

S2=q+4q2+9q3+16q4+

也就是:

S2=k=1k2qk

两边乘以 q

qS2=q2+4q3+9q4+16q5+

错位相减:

S2qS2=q+3q2+5q3+7q4+

右边的系数是连续奇数:

1,3,5,7,

因为:

k2(k1)2=2k1

所以:

q+3q2+5q3+7q4+=k=1(2k1)qk

拆开:

k=1(2k1)qk=2k=1kqkk=1qk

代入已经得到的结论:

k=1kqk=q(1q)2

以及:

k=1qk=q1q

于是:

(1q)S2=2q(1q)2q1q

通分:

(1q)S2=2qq(1q)(1q)2(1q)S2=q+q2(1q)2

所以:

S2=q(1+q)(1q)3

也就是:

k=0k2qk=q(1+q)(1q)3

几何分布的期望

由定义:

E[G]=k=0kP(G=k)

代入 P(G=k)=qkp

E[G]=k=0kqkp

把常数 p 提出来:

E[G]=pk=0kqk

代入级数结论:

E[G]=pq(1q)2

因为 1q=p,所以:

E[G]=pqp2=qp

这说明:若成功概率越小,第一次成功前平均失败次数越多。

几何分布的方差

方差用:

Var(G)=E[G2](E[G])2

先计算二阶矩:

E[G2]=k=0k2P(G=k)

代入 P(G=k)=qkp

E[G2]=pk=0k2qk

代入级数结论:

E[G2]=pq(1+q)(1q)3

因为 1q=p

E[G2]=pq(1+q)p3=q(1+q)p2

因此:

Var(G)=q(1+q)p2(qp)2Var(G)=q+q2q2p2

所以:

Var(G)=qp2

负二项分布的拆分

现在回到负二项分布。

Y 表示“第 r 次成功之前失败的次数”。

把等待第 r 次成功拆成 r 段:

  • 1 次成功前失败了 G1 次;
  • 2 次成功前失败了 G2 次;
  • ...
  • r 次成功前失败了 Gr 次。

那么:

Y=G1+G2++Gr

每个 Gi 都表示“从当前状态开始,等到下一次成功前失败了多少次”。

由于原始试验相互独立,并且每次成功概率都等于 p,所以这些 Gi 独立同分布,且都服从失败次数版几何分布:

P(Gi=k)=qkp,k=0,1,2,

失败次数版的均值和方差

由期望的线性性:

E[Y]=E[G1+G2++Gr]E[Y]=E[G1]+E[G2]++E[Gr]

每一段的期望都是 q/p,所以:

E[Y]=rqp=rqp

方差这里也可以相加,是因为 G1,,Gr 相互独立:

Var(Y)=Var(G1++Gr)Var(Y)=Var(G1)++Var(Gr)

每一段的方差都是 q/p2,所以:

Var(Y)=rqp2=rqp2

这就得到失败次数版负二项分布的结果:

E[Y]=r(1p)pVar(Y)=r(1p)p2

总试验次数版的均值和方差

X 表示“得到第 r 次成功所需的总试验次数”。

失败次数是 Y,成功次数固定为 r,所以:

X=Y+r

因此均值为:

E[X]=E[Y+r]E[X]=E[Y]+r

代入 E[Y]=rq/p

E[X]=rqp+rE[X]=rq+rpp

因为 p+q=1

E[X]=r(p+q)p=rp

方差为:

Var(X)=Var(Y+r)

加常数不改变方差,所以:

Var(X)=Var(Y)=rqp2

也就是:

Var(X)=r(1p)p2

为什么两个版本方差相同

失败次数版 Y 和总试验次数版 X 的差别是:

X=Y+r

r 是固定常数,不是随机变量。

方差衡量的是随机变量相对于自己均值的波动:

Var(X)=E[(XE[X])2]

如果 X=Y+r,那么:

XE[X]=(Y+r)E[Y+r]XE[X]=Y+r(E[Y]+r)XE[X]=YE[Y]

所以:

Var(X)=E[(YE[Y])2]=Var(Y)

直觉上说,XY 多出来的是固定的 r 次成功。固定增加 r 次,只会把整个分布向右平移 r 个单位,不会让分布变得更散或更集中。

小结

负二项分布有两个常见版本:

随机变量含义取值范围均值方差
Yr 次成功前的失败次数0,1,2,rqprqp2
X得到第 r 次成功所需的总试验次数r,r+1,r+2,rprqp2

其中:

q=1p

最关键的结构是:

Y=G1+G2++Gr

而:

E[G]=qp,Var(G)=qp2

所以:

E[Y]=rqp,Var(Y)=rqp2

总试验次数版只是在失败次数版上加了固定的 r

X=Y+r

因此:

E[X]=E[Y]+r=rp

但:

Var(X)=Var(Y)=rqp2

这也是记忆负二项分布均值和方差最稳的方式:先记住几何分布,再把负二项分布看成 r 段独立等待时间的总和。

Licensed under CC BY-NC-SA 4.0.