Skip to content

多局胜制中强者胜率随局数增加而上升

这份笔记整理一个概率论问题:

2k+1k+1 胜制中,如果强者单局获胜概率为 p > 1/2,那么随着 k 增大,强者赢下整场比赛的概率是否会增加?

答案是:会。更准确地说,若用 P(k) 表示强者在 2k+1k+1 胜制中的最终胜率,则:

P(k+1)P(k)=(2k+1k)[p(1p)]k+1(2p1)>0

所以 P(k) 关于 k 严格递增。

设定

设:

  • 强者单局获胜概率为 p
  • 弱者单局获胜概率为 q = 1 - p
  • 因为强者更强,所以 p > q,也就是 2p - 1 > 0

P(k) 表示强者在 2k+1k+1 胜制中获胜的概率。

打满全场的等价原理

很多计算会先用一个简化:

2k+1k+1 胜制虽然现实中会提前结束,但在计算胜者概率时,可以等价地假设比赛一定打满 2k+1 局。

原因不是近似,而是逐路径等价。

把一场比赛看成长度为 2k+1 的完整序列,例如:

text
A B A A B ...

其中 A 表示强者赢一局,B 表示弱者赢一局。

在同一条完整序列上定义两种规则:

  • 提前结束规则:谁先累计到 k+1 胜,谁赢。
  • 打满规则:数完整 2k+1 局中谁胜局更多,谁赢。

对任意一条长度为 2k+1 的序列,由于总局数为奇数,一定且仅有一方至少赢 k+1 局。

如果强者在完整序列中至少赢 k+1 局,那么从左往右读这条序列时,强者必然会在某一局首次达到第 k+1 胜。此时弱者最多只有 k 胜,因此提前结束规则也判定强者获胜。

弱者过半时同理。

所以:

{提前结束下强者获胜}={打满全场下强者获胜}

它们是同一个样本空间里的同一个事件,因此概率完全相同。

这个证明甚至不依赖每局独立同分布;只要两种规则读取的是同一条完整比赛路径,胜者判定就一致。

直接作差法

用打满全场的等价原理,P(k) 可以写成二项分布尾和:

P(k)=i=k+12k+1(2k+1i)piq2k+1i

要证明 P(k+1) > P(k),可以比较 2k+3k+2 胜制和 2k+1k+1 胜制。

2k+3 局看成:

  1. 先打前 2k+1 局。
  2. 再看最后两局如何改变结果。

设强者在前 2k+1 局中赢了 X 局。

  • X >= k+2,强者已经足够赢下新赛制。
  • X = k+1,强者还差一局,最后两局至少赢一局即可。
  • X = k,强者还差两局,最后两局必须全赢。
  • X <= k-1,最后两局全赢也不够。

于是:

P(k+1)=i=k+22k+1(2k+1i)piq2k+1i+(2k+1k+1)pk+1qk(1q2)+(2k+1k)pkqk+1p2

而:

P(k)=i=k+22k+1(2k+1i)piq2k+1i+(2k+1k+1)pk+1qk

两式相减,尾部求和项完全抵消。又因为:

(2k+1k)=(2k+1k+1)

得到:

P(k+1)P(k)=(2k+1k)[pk+1qk(1q2)+pk+2qk+1pk+1qk]=(2k+1k)pk+1qk(pqq2)=(2k+1k)pk+1qk+1(pq)=(2k+1k)[p(1p)]k+1(2p1)

因为每个因子都大于 0,所以:

P(k+1)P(k)>0

这就证明了赛制越长,强者整体胜率越高。

停时视角:对偶翻盘证明

更有直觉的一种想法,是不假设打满,而是尊重真实比赛规则:谁先到 k+1 胜,比赛就停止。

2k+1k+1 胜制下,比赛结束时的比分一定是:

text
胜者 k+1 : t 负者

其中 0 <= t <= k

如果把赛制延长为 2k+3k+2 胜制,那么原本已经结束的 k+1:t 局面还可以继续打。

此时领跑者只差 1 局获胜;落后者要翻盘,则必须赢下剩余所有局数。剩余最多局数为:

k+2t

因此:

  • [强者 k+1 : t 弱者] 中,弱者翻盘概率是 q^{k+2-t}
  • [弱者 k+1 : t 强者] 中,强者翻盘概率是 p^{k+2-t}

由于 p > q,强者落后时的翻盘概率永远大于弱者落后时的翻盘概率。这就是“更长赛制更偏向强者”的动态直觉。

对偶状态的精确计算

2k+1k+1 胜制中,以 k+1:t 结束,意味着最后一局由胜者拿下,前 k+t 局中胜者赢 k 局,负者赢 t 局。

所以:

P(强者以 k+1:t 赢)=(k+tk)pk+1qtP(弱者以 k+1:t 赢)=(k+tk)qk+1pt

P(k)P(k+1),强者胜率的变化等于:

text
弱者原本赢了但被强者翻盘的概率
-
强者原本赢了但被弱者翻盘的概率

也就是:

P(k+1)P(k)=t=0k(k+tk)qk+1ptpk+2tt=0k(k+tk)pk+1qtqk+2t

关键消去发生在指数上:

ptpk+2t=pk+2qtqk+2t=qk+2

因此:

P(k+1)P(k)=t=0k(k+tk)(qk+1pk+2pk+1qk+2)=(t=0k(k+tk))pk+1qk+1(pq)

再用曲棍球棒恒等式:

t=0k(k+tk)=(2k+1k)

得到同一个结果:

P(k+1)P(k)=(2k+1k)[p(1p)]k+1(2p1)

这个想法的美感

这个停时对偶证明的核心不是硬算,而是把延长赛看成“原胜负结果是否会被翻盘”。

最漂亮的地方在于:

  • 如果比分悬殊,比如 k+1:0,落后者翻盘需要连赢很多局,翻盘概率很低。
  • 如果比分接近,比如 k+1:k,落后者只需要连赢两局,翻盘概率较高。
  • 但比分接近本身也更难发生,比分悬殊本身也有不同的路径概率。

发生概率与翻盘概率相乘后,t 在指数上刚好消失。

这解释了为什么看起来复杂的停时求和,最后会收束成一个非常简洁的差值公式。

小结

证明“赛制越长越有利于强者”至少有三种层次:

  • 打满等价:提前结束和打满全场在每条样本路径上胜者一致。
  • 直接作差:比较 P(k+1)P(k),尾部求和项抵消。
  • 停时对偶:比较 [强者 k+1:t 弱者][弱者 k+1:t 强者] 两类状态下的翻盘概率。

其中停时对偶证明最能解释直觉:

延长赛给了落后者翻盘机会,但强者落后时的翻盘能力比弱者落后时更强;把所有对偶比分状态加总后,这个优势严格为正。

Licensed under CC BY-NC-SA 4.0.