Appearance
泊松分布公式推导与二项分布的联系
这份笔记整理泊松分布概率公式的来源,重点解释二项分布极限中组合数那一项为什么会变成
基本问题
泊松分布描述的是:在一段固定时间、空间或区域内,某类事件发生的次数。
设
这里的
从二项分布出发
假设观察一段固定时间,比如 1 小时。已知这段时间内事件平均发生
把这段时间切成
于是,在
泊松分布就是在下面这个极限条件下得到的:
也就是:机会次数越来越多,每次机会发生的概率越来越小,但总平均次数保持为
组合数那一项的极限
推导中最容易卡住的是这一项:
注意这里是
先展开组合数:
所以:
把
而:
当
因为
因此:
直觉上可以把组合数粗略看成:
而
例如
整理为:
所以:
剩余概率项的极限
二项分布中还剩这一项:
把它拆成两部分:
其中:
而因为
所以:
得到泊松分布公式
把前面的两个极限合起来:
因此:
这就是泊松分布的概率公式。
可以简写为:
期望、均值与二项分布的关系
二项分布的参数是
它的期望是:
方差是:
泊松分布的参数是
它的期望是:
方差也是:
这里的联系是:
在二项分布极限中,令:
于是:
所以,泊松分布的
二者的区别是:
- 二项分布有固定试验次数
,每次试验成功概率是 。 - 泊松分布没有显式记录“试验次数”,只记录固定区间内的平均发生次数
。 - 二项分布适合“有限次独立试验中成功了几次”。
- 泊松分布适合“固定时间或空间内事件发生了几次”。
二者的联系是:
- 当
很大、 很小,并且 保持稳定时,二项分布可以用泊松分布近似。 - 二项分布的期望
对应泊松分布的参数 。 - 在这个极限下,二项分布的方差
也趋近于 ,因为 ,所以 。
也就是:
因此,泊松分布可以理解成一种“稀有事件极限”:事件有很多次潜在发生机会,但每次发生概率很小,最终只留下一个稳定的平均发生次数
期望和均值是不是一回事
在概率分布里,“期望”和“均值”通常说的是同一个东西,都是随机变量长期平均下来的中心位置。
所以对于泊松分布:
对于二项分布:
不过在实际数据分析里,“均值”有时也指样本均值,也就是从数据中算出来的平均值。例如观察很多个小时,每小时事件次数分别是
如果这些数据确实来自泊松分布,那么样本均值
简短地说:
- 理论分布里,期望就是均值。
- 实际数据里,样本均值是从观测数据算出来的,用来估计理论期望。
- 泊松分布的理论均值是
。 - 二项分布的理论均值是
。