Steve Brunton | Probability Bootcamp | 笔记 | 第三部分:高级概率 | Lecture 26 | 联合概率分布

📅 2026/8/10 11:20:47
Steve Brunton | Probability Bootcamp | 笔记 | 第三部分:高级概率 | Lecture 26 | 联合概率分布
目录前言1. 引言2. 示例与动机3. 联合分布中的独立性4. 结语结语参考前言学习 Steven Brunton 讲授的概率与统计入门概述视频本篇文章记录第二十六讲联合概率分布记录下个人学习笔记和大家一起分享交流videohttps://www.youtube.com/playlist?listPLMrJAkhIeNNR3sNYvfgiKgcStwuPSts9V1. 引言OK我们已经介绍了随机变量及其概率分布的概念现在我们来讨论联合概率分布这是关于两个随机变量如何相互依存或互不影响并共同影响这两个事件同时发生的概率。给定两个随机变量X XX和Y YY这两个随机变量不必遵循相同的分布可以定义联合概率分布为P ( x , y ) P ( X x , Y y ) P(x,y) P(Xx,Yy)P(x,y)P(Xx,Yy)这是随机变量X XX取值为x xx且随机变量Y YY取值为y yy的概率这是个非常简单的概念。我们之前已经讨论过条件概率要知道在给定Y YY发生的条件下X XX发生的概率这两者密切相关。这里我以离散型随机变量的形式绘制并呈现了这一概念不过这个概念同样适用于连续型随机变量稍后我会详细说明。2. 示例与动机接下来我将通过几个示例来说明引入这一新概念的意义。以湍流为例其速度分量 —x xx、y yy、z zz三个方向上的u uu、v vv、w ww速度分量正是联合分布的随机变量这种联合分布的特性会随具体流体流动状态而变化若存在各向同性的随机湍流即方向无关性这些变量或许会呈现出独立性。在边界层流动中当流体沿x xx方向从左向右运动时u uu、v vv、w ww速度分量之间的关联性将形成独特的联合概率分布结构。OK这就是一个很酷的例子在公共卫生与医疗预后领域联合概率分布同样具有很重要的应用价值。当我们将患者的健康指标、人口统计学数据以及生物特征数据相结合时这些变量之间的联合概率分布能够揭示潜在的健康模式与风险关联。例如通过分析联合概率分布可以得出一位居住在美国华盛顿的 40 岁男性其患心脏病的条件概率会与特定的人口统计学特征和生物指标产生显著关联。假设该男性身高六英尺约 183 厘米体重为特定公斤数这些数据的综合信息能够构建不同健康结果的联合概率分布为制定可操作的医疗决策提供依据。实际上当我们构建这类联合概率分布时各个变量之间会呈现出极其紧密的关联性主成分分析所依赖的基本假设之一大家其实早已接触过主成分分析PCA这一方法通过这种方式我们可以处理从系统中收集到的高维数据然后对这些数据进行主成分分析从而提取出该联合分布的近似表征。关于主成分分析我有一整套系列讲座这是统计学中一个较为进阶的主题我们很快会深入探讨这个主题。这本质上是一种假设有时我们会忽略这个假设或者不经意间忘记PCA 在联合高斯分布下具有最优性—此时主成分之间不仅不相关而且严格独立—但有时我们可能不经意地忽略这一前提条件的适用范围。类似的例子还有很多现在请大家思考离散变量与连续变量的联合分布以及如何运用这些分布解决问题。我最喜欢的一个示例 — 实际上我将通过它来介绍连续型联合分布的概念我研究生时期的实验同门后来曾在一家体育数据分析公司工作我了解到他们收集了大量赛场摄像机数据记录了篮球比赛过程中的全场动态他们能够实时追踪每位球员的移动轨迹。实际上这是一个高度简化的球场模型通过追踪球员整个赛季的移动轨迹可以构建出该球员在场上出现位置的频率分布图比如某位球员可能经常在某个区域活动有时会出现在某个位置而极少会跑到另一个角落这便构成了类似勒布朗·詹姆斯这类球员在整个赛季中活动区域的概率分布图。通过实际采集数据构建概率分布的核心思路这是对概率分布进行数据驱动的近似建模我们通过概率密度函数来预测球员的移动位置。因此在连续时间维度中我们通常用函数f ( x , y ) f(x,y)f(x,y)表示该概率密度函数直观来说它表示在极小的d x × d y dx \times dydx×dy微元区域内发现目标的概率。因此可以计算随机变量即球员位置出现在特定区域内的概率假设我设定一个区域 A点( x , y ) (x,y)(x,y)落在此区域内的概率为P ( ( x , y ) ∈ A ) ∫ A f ( x , y ) d x d y P\left((x,y) \in A \right) \int_A f(x,y) \, dx \, dyP((x,y)∈A)∫A​f(x,y)dxdy区域 A 的概率值即为该概率密度函数在此区域上的积分该概率值等于函数f ( x , y ) f(x,y)f(x,y)在区域 A 上的二重积分这与单随机变量的处理方式完全一致单随机变量的概率密度函数通过积分计算概率而现在我们可以对二维区域进行积分运算对于三维随机变量则需通过体积分进行计算。其核心思路非常简单明了根据该概率密度函数计算落在这个二维平面特定有限区域内的概率。3. 联合分布中的独立性我想说明的是如果这两个变量相互独立会产生什么结果 — 这一点非常重要并且与变量分离密切相关让我们暂时回到之前讨论的高斯分布示例上来。假设存在两个随机变量X XX和Y YY它们都是服从正态分布的随机变量这样我们就可以构建一个新的联合分布f ( x , y ) f(x,y)f(x,y)那么这个联合分布会形成具有径向对称性的二维高斯分布可以注意到这个联合概率密度函数本身就是一个二维高斯分布数据确实服从联合高斯分布时PCA 具有特别优雅的统计解释主成分之间严格独立且每个方向的方差恰好对应高斯分布在该方向的散布程度。可以观察到若对X XX变量的所有取值进行积分运算最终将得到Y YY变量的高斯概率密度函数若对Y YY变量的所有取值进行积分运算最终将得到X XX变量的高斯分布这就是所谓的边缘分布 — 通过对Y YY的所有取值进行积分得到X XX的边缘分布或通过对X XX的所有取值进行积分得到Y YY的边缘分布。后续我们将进一步探讨这一概念我们可以这样理解若存在两个本身服从高斯分布的变量就能构建一个联合分布 — 即二维高斯分布其中每个边缘概率本身也都是高斯分布。接下来要介绍的重要概念是独立性这是一个非常重要的性质我们将在后续内容中反复运用。当我们计算联合分布的期望值时当我们在主成分分析中计算方差时诸如此类的情况都会用到。我们在讨论条件概率时已经接触过独立性的概念当两个随机变量X XX和Y YY相互独立时已知Y YY的信息不会改变X XX的概率分布这种独立性同样适用于联合概率分布的表述。假设随机变量X XX与Y YY相互独立那么X XX等于某个特定值且Y YY等于某个特定值的概率等于两个独立概率密度的乘积即P ( X x , Y y ) P ( X x ) P ( Y y ) P(Xx,Yy) P(Xx)P(Yy)P(Xx,Yy)P(Xx)P(Yy)你会发现这种处理方式与求解偏微分方程时采用的变量分离法几乎如出一辙当我在二维矩形区域求解热传导方程并分析温度分布时通常可以将解分离为x xx的函数与y yy的函数的乘积形式这正是完全相同的思路。这恰如变量分离法的思路实际上在那个热传导案例中温度分布的变量分离过程还涉及了与高斯函数的卷积运算热传导方程的解包含高斯热核函数不过这与当前主题并无直接关联。因此独立性的概率确实至关重要当随机变量X XX和Y YY完全独立时我们可以通过将各自的概率密度函数相乘来得到联合分布我们知道这种方法时而适用时而不适用让我们通过一个具体示例来说明。假设我正在投掷飞镖假设有一个标靶标靶通常呈圆形通常标靶会划分为靶心、环形区域和扇形分区如果我的飞镖技术不错你会发现投掷落点的分布会逐渐接近高斯分布当然这得是真正擅长飞镖的情况下当你瞄准靶心时落点会围绕靶心形成二维高斯分布。若尝试用X , Y X,YX,Y变量描述该概率密度函数其表达式将不可分离因为在X XX轴方向上移动时Y YY变量的概率分布确实会随X XX坐标的变化而改变因此我无法将该概率密度函数分解为X XX和Y YY的独立表达式该函数在X XX和Y YY方向上不可分离。正如热传导方程所示若在圆盘中心用喷枪加热热力分布将无法在X XX和Y YY方向上实现分离但在极坐标系的径向和角向维度上该函数可分离为θ \thetaθ和r rr的独立表达式。因此通过寻找合适的坐标系我们往往能够基于变量独立性将概率密度函数分解为独立分量的乘积形式而某些坐标系则难以实现这种分解。正如微分方程中存在优选坐标系概率论中也常存在能够简化问题表述的坐标系。当然引力的存在会打破这种对称性使概率分布产生特定方向的偏移假设我们在国际空间站的零重力环境下投掷飞镖。理解变量独立性这一概念具有重要价值我们将持续运用变量独立性这一核心特性若两个随机过程相互独立其联合概率分布可通过各自概率密度的乘积构建反之亦可将联合密度分解为两个独立密度的乘积。4. 结语在后续课程中我们将讲解一个称为边缘分布的概念这一点我在前面已经有所提及这个思路是指当存在联合分布时可以通过对Y YY取平均值得到X XX的边缘分布反之亦可对X XX取平均值得到Y YY的边缘分布。我将把这个概念与条件概率联系起来这种条件概率的思想我们之前在贝叶斯定理中已经使用过我认为在下一讲中会将其与独立性和联合分布联系起来。结语联合概率分布将概率论从 “一维望远镜” 升级为 “多维显微镜”—P ( X x , Y y ) P(Xx, Yy)P(Xx,Yy)或f ( x , y ) f(x,y)f(x,y)不仅描述单个变量的随机行为更捕捉变量之间的关联结构。Brunton 的示例矩阵精彩地展示了这一概念的跨学科解释力湍流的速度三分量( u , v , w ) (u,v,w)(u,v,w)的依赖关系揭示了流动物理、多元患者健康指标预测疾病风险、篮球运动员的场上热力图构成f ( x , y ) f(x,y)f(x,y)的数据驱动近似—从流体力学到公共卫生再到体育分析联合分布是统一的建模语言。独立性的判别是联合分布最核心的运算属性若X XX与Y YY独立联合分布可分解为各自边缘密度的乘积f ( x , y ) f X ( x ) f Y ( y ) f(x,y) f_X(x)f_Y(y)f(x,y)fX​(x)fY​(y)—这与偏微分方程中分离变量法的数学结构完全同构。但 Brunton 以二维飞镖靶为例警示了不可分离的情形围绕靶心的高斯分布无法在( x , y ) (x,y)(x,y)笛卡尔坐标下分解却可在( r , θ ) (r,\theta)(r,θ)极坐标下分离—可分性依赖于坐标系的选择这与热传导方程在圆盘上的求解策略异曲同工。这一洞见为主成分分析PCA提供了概率论注脚PCA 假设数据服从联合高斯分布通过旋转坐标轴寻找使变量 “最接近独立” 的方向本质上是在做 “最优分离变量”。边缘分布对Y YY积分得X XX的分布反之亦然和条件分布固定一个变量看另一个是联合分布的两个派生概念它们将与贝叶斯定理一起构成后续统计推断的核心运算工具箱 。参考https://www.youtube.com/playlist?listPLMrJAkhIeNNR3sNYvfgiKgcStwuPSts9V