Steve Brunton | Probability Bootcamp | 笔记 | 第三部分:高级概率 | Lecture 33 | Markov 不等式:一阶概率估计

📅 2026/8/16 22:31:30
Steve Brunton | Probability Bootcamp | 笔记 | 第三部分:高级概率 | Lecture 33 | Markov 不等式:一阶概率估计
目录前言1. 引言2. 示例与直观理解3. 马尔可夫不等式的证明4. 结语结语参考前言学习 Steven Brunton 讲授的概率与统计入门概述视频本篇文章记录第三十三讲Markov 不等式一阶概率估计记录下个人学习笔记和大家一起分享交流videohttps://www.youtube.com/playlist?listPLMrJAkhIeNNR3sNYvfgiKgcStwuPSts9V1. 引言OK现在我们要开始探讨概率论与统计学中最重要的系列结论之一 — 中心极限定理和大数定律。这本质上揭示了当样本量n → ∞ n \rightarrow \inftyn→∞时概率分布的极限行为。例如当我们将多个概率分布相加时它们会逐渐收敛于正态分布而大数定律则表明若对某个分布进行采样并计算样本均值该均值将收敛于分布的期望值。要证明这些极限定理我们需要借助两个非常重要的数学定理 — 马尔可夫不等式与切比雪夫不等式。马尔可夫不等式非常直观且简单接下来我将逐步解释其原理。该定理指出若存在一个非负随机变量X XX则X XX大于等于某个数值a aa的概率不超过X XX的期望值除以a aa即P ( X ≥ a ) ≤ E ( X ) a P(X \ge a) \le \frac{\mathbb{E}(X)}{a}P(X≥a)≤aE(X)​这听起来可能有点抽象这有什么用呢我举个简单例子帮你建立直观理解然后我们再给出证明。2. 示例与直观理解假设随机变量X XX的期望值E ( X ) 10 \mathbb{E}(X) 10E(X)10这意味着X ≥ 20 X \ge 20X≥20的概率这里的 20 对应不等式中的a aa不超过期望值 10 与 20 的比值即不超过1 2 \frac{1}{2}21​。用通俗的话来说如果一个概率分布函数 — 我们画个正态概率分布示意图请注意X XX严格非负因此其取值范围仅限于从零开始的正数这意味着如果我的均值期望值为 10那么分布中最多只有一半的值可能超过 20。确实如此如果超过半数的分布落在 20 的右侧那么左侧剩余的分布就不足以平衡整体无法维持期望值为 10 的结果这非常直观。若平均值为 10则分布中远离右侧某值的概率密度不能过高否则左侧区域将没有足够的概率质量来平衡整体均值至 10。这一思路通过一个极其实用且简洁的公式得以形式化实际上若超过 20 的概率大于1 2 \frac{1}{2}21​则所有大于 20 的概率质量必须集中在 20 处而对应的平衡概率质量则需全部堆积在X 0 X0X0的位置。这可以说是极限情况若要使分布的一半位于 20 的右侧唯一的方式是将这部分概率全部集中在 20 处而另一半则完全置于零点。若分布中位于 20 右侧的部分不足一半则这部分概率可适当分散对应的平衡概率也可作适度分布。3. 马尔可夫不等式的证明接下来我们逐步推导这个证明过程这个证明相对简单。对于离散随机变量X XX的期望值其表达式可写为E ( X ) ∑ x x P ( X x ) \mathbb{E}(X) \sum_x xP(Xx)E(X)x∑​xP(Xx)对所有可能的随机变量取值进行求和即每个可能取值x xx乘以该取值对应的概率P ( X x ) P(Xx)P(Xx)的总和。该总和恒满足大于等于零的条件由于X XX始终取正值且概率均为非负数。若将求和范围限定为X ≥ A X \ge AX≥A的区间内由于所有项均为非负值部分和必然小于等于完整求和即E ( X ) ∑ x x P ( X x ) ≥ ∑ x ≥ a x P ( X x ) \mathbb{E}(X) \sum_x xP(Xx) \ge \sum_{x \ge a} x P(Xx)E(X)x∑​xP(Xx)≥x≥a∑​xP(Xx)又由于x ≥ a x \ge ax≥a因此有E ( X ) ∑ x x P ( X x ) ≥ ∑ x ≥ a x P ( X x ) ≥ ∑ x ≥ a a P ( X x ) \mathbb{E}(X) \sum_x xP(Xx) \ge \sum_{x \ge a} x P(Xx) \ge \sum_{x \ge a}aP(Xx)E(X)x∑​xP(Xx)≥x≥a∑​xP(Xx)≥x≥a∑​aP(Xx)此时可将a aa提取至外部得到E ( X ) ∑ x x P ( X x ) ≥ ∑ x ≥ a x P ( X x ) ≥ ∑ x ≥ a a P ( X x ) a P ( X ≥ a ) \mathbb{E}(X) \sum_x xP(Xx) \ge \sum_{x \ge a} x P(Xx) \ge \sum_{x \ge a}aP(Xx) aP(X \ge a)E(X)x∑​xP(Xx)≥x≥a∑​xP(Xx)≥x≥a∑​aP(Xx)aP(X≥a)该式等于a aa乘以事件X ≥ a X \ge aX≥a发生的概率。最后这一步可能需要稍作停顿思考才能理解其实并不复杂将a aa提取出来后对于所有满足x ≥ a x \ge ax≥a的x xx值概率求和结果就是随机变量X ≥ a X \ge aX≥a的概率这正是该求和运算的定义所在。那么根据上述推导最终我们可以得到前面提到的马尔可夫不等式这就是证明过程。4. 结语OK这是一个非常实用的定理或不等式在接下来的课程中我们将运用这个结论来证明切比雪夫不等式再借助切比雪夫不等式最终完成大数定律的证明。因此这个定理非常实用且直观堪称解决问题的得力工具该定理指出对于非负分布若存在均值则分布数据不会过度集中在均值右侧因为剩余部分不足以形成平衡这个思路完全符合逻辑。不等式的证明过程正是将这种直观理解进行严谨数学表达的方式类似这样的定理还有很多所以请大家先熟悉当前的推导思路因为在接下来的示例中我们将接触到更精妙的论证方法。结语马尔可夫不等式P ( X ≥ a ) ≤ E ( X ) a P(X \ge a) \le \frac{\mathbb{E}(X)}{a}P(X≥a)≤aE(X)​是整个极限定理大厦的第一块基石。它的极简性令人印象深刻仅需知道随机变量的期望值一阶矩无需任何分布形态或高阶矩信息即可给出尾部概率的上界。代价是宽松—若E ( X ) 10 \mathbb{E}(X)10E(X)10则P ( X ≥ 20 ) ≤ 0.5 P(X \ge 20) \le 0.5P(X≥20)≤0.5这个上界在实际应用中可能相当保守但数学上它始终严格成立。证明过程仅用三步截断求和就完成了全部论证(1)E ( X ) ∑ x P ( x ) ≥ ∑ x ≥ a x P ( x ) \mathbb{E}(X) \sum xP(x) \ge \sum_{x \ge a} xP(x)E(X)∑xP(x)≥∑x≥a​xP(x)—非负项的部分和不大于完整和(2)∑ x ≥ a x P ( x ) ≥ ∑ x ≥ a a P ( x ) \sum_{x \ge a} xP(x) \ge \sum_{x \ge a} aP(x)∑x≥a​xP(x)≥∑x≥a​aP(x)—在截断区域内以a aa替代x xx由于x ≥ a x \ge ax≥a这是下界(3)∑ x ≥ a a P ( x ) a P ( X ≥ a ) \sum_{x \ge a} aP(x) aP(X \ge a)∑x≥a​aP(x)aP(X≥a)—常数a aa提出余下即所求概率。这三步本质上是将期望值中 “离原点足够远” 的贡献剥离出来并用下界估计整个论证不依赖分布的连续/离散性、对称性、独立性等任何额外假设唯一前提是X ≥ 0 X \ge 0X≥0。尽管马尔可夫不等式本身在实践中因过于宽松而较少直接使用其真正的威力在于传递性它作为引理支撑了切比雪夫不等式引入方差信息使上界收窄为1 / k 2 1/k^21/k2切比雪夫又进而支撑大数定律的证明。因此本讲是后续 L34–L36 三个里程碑切比雪夫 → 大数定律 → 中心极限定理的逻辑起点—正如 Brunton 所言先从这条最直观也最基础的不等式熟悉截断求和的论证思路后续的精妙推导都将在此模式上层层叠加 。参考https://www.youtube.com/playlist?listPLMrJAkhIeNNR3sNYvfgiKgcStwuPSts9V