Skip to content

泊松分布公式推导与二项分布的联系

这份笔记整理泊松分布概率公式的来源,重点解释二项分布极限中组合数那一项为什么会变成 λk/k!,以及泊松分布的期望、均值与二项分布之间的关系。

基本问题

泊松分布描述的是:在一段固定时间、空间或区域内,某类事件发生的次数。

X 表示这个固定区间内事件发生的次数。如果平均发生次数是 λ,那么泊松分布的概率公式是:

P(X=k)=λkeλk!,k=0,1,2,

这里的 λ 是单位区间内的平均发生次数,也就是泊松分布的参数。

从二项分布出发

假设观察一段固定时间,比如 1 小时。已知这段时间内事件平均发生 λ 次。

把这段时间切成 n 个非常小的时间片。如果 n 足够大,每个小时间片内发生事件的概率可以近似为:

p=λn

于是,在 n 个小时间片中,事件总共发生 k 次,可以先看成二项分布:

P(X=k)=(nk)(λn)k(1λn)nk

泊松分布就是在下面这个极限条件下得到的:

n,p=λn0,np=λ

也就是:机会次数越来越多,每次机会发生的概率越来越小,但总平均次数保持为 λ

组合数那一项的极限

推导中最容易卡住的是这一项:

(nk)(λn)k

注意这里是 n,但 k 是固定的。

先展开组合数:

(nk)=n!k!(nk)!=n(n1)(n2)(nk+1)k!

所以:

(nk)(λn)k=n(n1)(nk+1)k!λknk

nk 分到前面的乘积里:

=λkk!n(n1)(nk+1)nk

而:

n(n1)(nk+1)nk=1(11n)(12n)(1k1n)

n 时,每一个因子都趋近于 1

11n1,12n1,

因为 k 是固定的,所以这只是有限个因子的乘积。有限个趋近于 1 的因子相乘,整体也趋近于 1

因此:

(nk)(λn)kλkk!

直觉上可以把组合数粗略看成:

(nk)nkk!

(λ/n)k 里正好有一个 1/nk,二者抵消后剩下:

λkk!

例如 k=3 时:

(n3)(λn)3=n(n1)(n2)6λ3n3

整理为:

=λ36(11n)(12n)

所以:

(n3)(λn)3λ36=λ33!

剩余概率项的极限

二项分布中还剩这一项:

(1λn)nk

把它拆成两部分:

(1λn)nk=(1λn)n(1λn)k

其中:

(1λn)neλ

而因为 k 固定:

(1λn)k1

所以:

(1λn)nkeλ

得到泊松分布公式

把前面的两个极限合起来:

(nk)(λn)kλkk!(1λn)nkeλ

因此:

P(X=k)=(nk)(λn)k(1λn)nkλkeλk!

这就是泊松分布的概率公式。

可以简写为:

Binomial(n,λn)nPoisson(λ)

期望、均值与二项分布的关系

二项分布的参数是 np

XBinomial(n,p)

它的期望是:

E[X]=np

方差是:

Var(X)=np(1p)

泊松分布的参数是 λ

YPoisson(λ)

它的期望是:

E[Y]=λ

方差也是:

Var(Y)=λ

这里的联系是:

λ=np

在二项分布极限中,令:

p=λn

于是:

E[X]=np=nλn=λ

所以,泊松分布的 λ 可以看成二项分布均值 np 在极限过程中的保留值。

二者的区别是:

  • 二项分布有固定试验次数 n,每次试验成功概率是 p
  • 泊松分布没有显式记录“试验次数”,只记录固定区间内的平均发生次数 λ
  • 二项分布适合“有限次独立试验中成功了几次”。
  • 泊松分布适合“固定时间或空间内事件发生了几次”。

二者的联系是:

  • n 很大、p 很小,并且 np=λ 保持稳定时,二项分布可以用泊松分布近似。
  • 二项分布的期望 np 对应泊松分布的参数 λ
  • 在这个极限下,二项分布的方差 np(1p) 也趋近于 λ,因为 p0,所以 1p1

也就是:

np(1p)λ

因此,泊松分布可以理解成一种“稀有事件极限”:事件有很多次潜在发生机会,但每次发生概率很小,最终只留下一个稳定的平均发生次数 λ

期望和均值是不是一回事

在概率分布里,“期望”和“均值”通常说的是同一个东西,都是随机变量长期平均下来的中心位置。

所以对于泊松分布:

均值=E[Y]=λ

对于二项分布:

均值=E[X]=np

不过在实际数据分析里,“均值”有时也指样本均值,也就是从数据中算出来的平均值。例如观察很多个小时,每小时事件次数分别是 x1,x2,,xm,样本均值是:

x¯=x1+x2++xmm

如果这些数据确实来自泊松分布,那么样本均值 x¯ 会用来估计理论参数 λ

简短地说:

  • 理论分布里,期望就是均值。
  • 实际数据里,样本均值是从观测数据算出来的,用来估计理论期望。
  • 泊松分布的理论均值是 λ
  • 二项分布的理论均值是 np

Licensed under CC BY-NC-SA 4.0.