Skip to content

几何分布与指数分布的联系

这份笔记整理几何分布和指数分布的关系,重点放在等待时间、无记忆性、期望方差的对应,以及“把离散时间切细后得到连续时间”的直觉。

一句话概括:

几何分布是离散时间里的等待时间;指数分布是连续时间里的等待时间。

它们描述的是同一种问题:

等下一次成功或下一次事件发生,要等多久?

几何分布:按次数等待

假设每次试验只有成功和失败两种结果:

  • 每次成功概率为 p
  • 每次失败概率为 1p
  • 各次试验相互独立。

N 表示“第一次成功发生在第几次试验”。

那么:

NGeometric(p)

并且:

P(N=n)=(1p)n1p,n=1,2,3,

直觉上,这对应这样的过程:

text
失败,失败,失败,成功

如果第一次成功发生在第 n 次,就说明前 n1 次都失败,第 n 次成功。

这个版本的期望和方差是:

E[N]=1pVar(N)=1pp2

这里 p 越大,平均等待次数越少;p 越小,平均等待次数越多,而且波动也更大。

失败次数版几何分布

有些书会令 G 表示“第一次成功前失败了几次”。

这时:

G=0,1,2,

并且:

P(G=k)=(1p)kp,k=0,1,2,

GN 的关系是:

N=G+1

所以:

E[G]=E[N]1=1p1=1pp

而方差不变:

Var(G)=Var(N)=1pp2

原因是:加上或减去一个常数,只会平移分布,不会改变随机波动的大小。

指数分布:按时间等待

指数分布描述的是连续时间中的等待时间。

T 表示“等到下一次事件发生所需的时间”。如果事件以单位时间发生率 λ 随机到来,那么:

TExponential(λ)

它的密度函数是:

f(t)=λeλt,t0

它的尾概率是:

P(T>t)=eλt

期望和方差是:

E[T]=1λVar(T)=1λ2

这里 λ 是单位时间发生率。λ 越大,事件来得越频繁,平均等待时间就越短。

两者的基本对应

几何分布和指数分布可以这样对应:

离散时间连续时间
每次试验成功概率 p单位时间发生率 λ
等第一次成功要几次等第一次事件要多久
NGeometric(p)TExponential(λ)
E[N]=1/pE[T]=1/λ
Var(N)=(1p)/p2Var(T)=1/λ2

最重要的共同直觉是:

平均等待量1发生率

在几何分布中,发生率是“每次试验成功概率” p

在指数分布中,发生率是“单位时间发生率” λ

无记忆性

几何分布和指数分布都有无记忆性。

对几何分布来说:

P(N>m+nN>m)=P(N>n)

意思是:已经失败了 m 次,并不会改变之后还要等待多少次的分布。

对指数分布来说:

P(T>s+tT>s)=P(T>t)

意思是:已经等了 s 时间,并不会改变之后还要等待多久的分布。

这两句话背后的结构一样:

过去没有发生,并不会改变未来的等待规律。

当然,这个性质不是所有等待时间都有。比如设备老化、人的疲劳、排队系统的拥堵变化,都可能让“已经等了多久”影响之后的等待分布。

指数分布是几何分布的连续极限

把连续时间切成很多小格,每一格长度为:

Δt

假设每一小格内发生事件的概率近似为:

p=λΔt

这里 λ 保持不变,表示单位时间发生率。

N 表示事件第一次发生在第几格,那么 N 服从几何分布:

NGeometric(λΔt)

但真实等待时间不是 N,而是:

TΔ=NΔt

也就是:

先数等了多少个小格,再乘回每格的真实时间长度。

这正是“把 p 变小无数倍,然后把时间坐标轴缩回来”的想法。

关键是:不能只让 p 变小,还要同时让时间格子 Δt 变小,并保持:

λ=pΔt

也就是单位时间发生率保持不变。

从尾概率看极限

如果 TΔ=NΔt,那么:

P(TΔ>t)=P(NΔt>t)

近似地,t 时间内有 t/Δt 个小格。要等到 t 之后才发生,就意味着前面这些小格都没有发生事件。

所以:

P(TΔ>t)(1λΔt)t/Δt

Δt0 时:

(1λΔt)t/Δteλt

因此:

P(T>t)=eλt

这正是指数分布的尾概率。

所以指数分布可以理解为:

几何分布在时间格子无限变细、单格成功概率无限变小、单位时间发生率保持不变时的极限。

期望的对应

几何分布中:

E[N]=1p

设:

p=λΔt

等待时间为:

TΔ=NΔt

于是:

E[TΔ]=E[NΔt]E[TΔ]=ΔtE[N]

代入 E[N]=1/p

E[TΔ]=Δt1p

再代入 p=λΔt

E[TΔ]=Δt1λΔt

所以:

E[TΔ]=1λ

这正好对应指数分布:

E[T]=1λ

方差的对应

几何分布中:

Var(N)=1pp2

等待时间是:

TΔ=NΔt

方差在乘常数时会乘以常数的平方:

Var(TΔ)=Var(NΔt)Var(TΔ)=(Δt)2Var(N)

代入几何分布方差:

Var(TΔ)=(Δt)21pp2

再代入 p=λΔt

Var(TΔ)=(Δt)21λΔt(λΔt)2

整理得到:

Var(TΔ)=1λΔtλ2

Δt0 时:

1λΔt1

所以:

Var(TΔ)1λ2

这正好对应指数分布:

Var(T)=1λ2

为什么几何分布方差里有 1p,指数分布里没有

几何分布方差是:

Var(N)=1pp2

这里的 1p 是失败概率。它表示“这一格没成功,所以等待继续”的概率。

如果时间是一格一格跳的,每一格成功概率 p 可能很明显,比如 0.20.50.9。这时 1p 会明显影响等待时间的波动。

比如:

  • p=0.9 时,很可能第一两次就成功,等待很稳定,1p=0.1 很小;
  • p=0.01 时,大概率要失败很多次,等待很不稳定,1p=0.99 接近 1

指数分布对应的是连续时间极限。

在每个极小时间格中:

p=λΔt

Δt0 时:

p0

于是:

1p=1λΔt1

所以指数分布不是“没有失败概率”,而是每个无限小时间片内事件发生概率趋近于 0,失败概率趋近于 1。因此几何分布方差中的离散修正因子 1p,在连续极限中变成了 1

一个直观图像

可以把几何分布想成:每隔一段固定时间检查一次事情有没有发生。

比如每隔一分钟看一次公交有没有来:

text
没来,没来,没来,来了

如果每一分钟公交来的概率是 p,那么等待的分钟数就是几何分布。

指数分布则像是:公交可以在任意瞬间到来,而不是只在整分钟到来。

为了从几何分布过渡到指数分布,可以这样想:

  1. 把一分钟切成很多很小的小格。
  2. 每一小格内公交来的概率变得非常小。
  3. 但单位时间内公交到来的平均频率保持为 λ
  4. 等待的小格数会变得很大。
  5. 再把小格数乘以小格长度,缩放回真实时间。

于是,离散的“等了多少格”就变成连续的“等了多久”。

和 Poisson 过程的关系

如果事件按照 Poisson 过程发生,那么:

  • 单位时间内事件发生次数服从 Poisson 分布;
  • 两次事件之间的等待时间服从指数分布;
  • 等第 r 次事件发生的时间服从 Gamma 分布,若 r 是正整数,也称 Erlang 分布。

这和离散时间中的对应关系很像:

离散时间连续时间
Bernoulli 试验Poisson 过程的小时间片近似
几何分布:等第 1 次成功指数分布:等第 1 次事件
负二项分布:等第 r 次成功Gamma/Erlang 分布:等第 r 次事件
二项分布:固定次数内成功几次Poisson 分布:固定时间内事件发生几次

这张表的核心不是公式,而是建模视角:

离散时间里按“次数”数等待;连续时间里按“时间”量等待。

小结

几何分布和指数分布的关系可以从三层理解:

第一层,语义上:

几何分布等第一次成功要多少次;指数分布等第一次事件要多少时间。

第二层,性质上:

它们都具有无记忆性,过去没发生不会改变未来等待分布。

第三层,极限上:

指数分布是几何分布在时间格子无限变细、单格成功概率无限变小、单位时间发生率保持不变时的连续极限。

对应的缩放关系是:

p=λΔtTΔ=NΔt

Δt0 时:

TΔT

其中:

TExponential(λ)

期望对应为:

E[NΔt]E[T]=1λ

方差对应为:

Var(NΔt)Var(T)=1λ2

几何分布方差中的 1p 并没有神秘消失,而是在连续极限中:

1p=1λΔt1

所以可以直观地记为:

几何分布还保留着“每一格成功概率”的离散痕迹;指数分布把格子切到无限细以后,只剩下单位时间发生率 λ

Licensed under CC BY-NC-SA 4.0.