概率中的微积分:密度、期望与归一化
本文基于模型知识整理(生成时未联网核对),统计结论建议对照 Wasserman《All of Statistics》复核。
一句话定义
连续概率是微积分的驻场应用:概率密度 f(x) 是"满足 $\int f=1$ 且 $f\ge0$ 的函数",概率=密度曲线下面积($\int_a^bf$),期望=加权平均的连续版($E[X]=\int xf\,dx$)——正态分布常数的 $\frac1{\sqrt{2\pi}}$、柯西分布"有密度无均值"、损失归一化=隐式学习率,全是微积分操作在概率里的日常。
为什么重要
机器学习的语言就是概率+微积分:似然函数的积分归一、交叉熵的推导、连续分布的期望方差、采样算法(逆变换法)——不懂"密度下的积分操作",连续概率寸步难行。本条把 kp-013/015/026 的积分武器在概率战场上列装完毕。
前置知识
kp-013(FTC)、kp-015(反常积分收敛)、kp-026(二重积分);基础概率词汇(随机变量、分布)。
核心概念
- 密度函数三律:$f(x)\ge0$、$\int_{-\infty}^{\infty}f=1$(归一化)、$P(a\le X\le b)=\int_a^bf$。注意 $f(x)$ 本身不是概率(可>1),"点概率"恒 0——概率属于区间(积分)。
- 分布函数(CDF)与密度的互逆:$F(x)=\int_{-\infty}^xf$,$f=F'$(FTC kp-013 的概率化)——CDF 单调右连续、极限 0/1。
- 期望:$E[X]=\int xf(x)dx$(kp-016"平均值"的概率版);存在性要求该积分绝对收敛(kp-015 的警告在此引爆:柯西分布 $\int\frac{x}{1+x^2}dx$ 主值虽对称但绝对发散 ⇒ 期望不存在,"对称"不能救)。
- 高斯归一化的微积分来历:$\int_{-\infty}^\infty e^{-x^2/2}dx=\sqrt{2\pi}$(kp-026 极坐标高斯积分的换装)——正态密度前的 $\frac1{\sqrt{2\pi}}$ 不是拍脑袋,是归一化积分的解。
- 期望的线性性:$E[aX+bY]=aE[X]+bE[Y]$(积分线性性的直接推论)——概率中最好用、无需独立性的一条性质。
- 变量替换:$Y=g(X)$ 的密度 $f_Y(y)=f_X(x)\left|\frac{dx}{dy}\right|$——换元公式(kp-014)的概率版,逆变换采样法的理论核。
原理与机制
为什么"点概率为零"不矛盾:密度是"单位长度的概率浓度"(像线密度质量);单点长度为零故概率零——区间才有质量。$P(X=c)=0$ 但事件并非不可能(零概率≠不可能,连续世界的第一课)。
为什么柯西分布没有均值:$\int_{-A}^{A}x\cdot\frac1{\pi(1+x^2)}dx=0$ 看似对称=0,但绝对值积分 $\int\frac{|x|}{1+x^2}dx$ 发散(对数增长,kp-015)——期望定义为绝对收敛意义下;正负无穷远处的"质量"势均力敌却各自无限,平均值依赖截断方式(截断不同答案不同)——"无均值"比"均值无穷"更深刻。
为什么损失/密度的尺度=隐式学习率(kp-028 的出处):损失乘 2,梯度乘 2,等效学习率乘 2——概率密度归一化(除以 ∫)在优化语境下就是"把学习率固定在数据无关的水平";归一化纪律的优化解释由此而来。
图示
密度三律: f≥0 ; ∫f=1 ; P(a≤X≤b)=∫ᵃᵇf
CDF: F(x)=∫₋∞ˣf ⇔ f=F' (FTC 概率版)
期望: E[X]=∫x·f dx (绝对收敛才存在 — 柯西反例)
高斯: ∫e^{−x²/2}dx=√(2π) (kp-026 极坐标) → N(0,1) 密度
线性性: E[aX+bY]=aE[X]+bE[Y] (积分线性, 免独立性)
换元: f_Y(y)=f_X(x)|dx/dy| (逆变换采样法核)
直观类比
密度像"人口密度地图":每点一个浓度值(可以很高),想知道某城区人口(概率)必须对区域积分。期望像"全国人均坐标"——柯西分布是"左右两翼各有无穷人口的对称国":人均位置没有定义,因为两侧人口都数不完。
实例或案例
- 正态概率:$P(|X-\mu|<\sigma)\approx68\%$——查表/数值积分(kp-017)的结果,无解析原函数(kp-013 的 $e^{-x^2}$)。
- 逆变换采样:$u\sim U(0,1)$,输出 $X=F^{-1}(u)$ 服从目标分布——单调函数换元+均匀分布的直接应用。
- 交叉熵损失:$-\log p(y)$ 对 logits 求梯度得 $p-y$(kp-022 的 softmax 联动)——概率与梯度下降(kp-028)的会师。
常见误区
- 误区一:"f(x) 是概率"。密度可 >1(窄分布峰值,如 U(0,0.5) 的 f=2)——概率永远是积分值。
- 误区二:"对称分布必有均值"。柯西反例——对称只保证主值为 0,不保证绝对收敛(期望存在性以绝对收敛为准)。
- 误区三:"E[XY]=E[X]E[Y] 随便用"。线性性无独立性也成立,但乘积期望需要独立性(或协方差修正)——两条性质的条件完全不对称。
与其他知识点的关系
自测题
- 求 $U(0,1)$ 的 $E[X]$ 与 $E[X^2]$。
答:$\int_0^1x\,dx=\frac12$;$\int_0^1x^2dx=\frac13$(方差=1/3−1/4=1/12)。
- 指数密度 $f(x)=\lambda e^{-\lambda x}\,(x\ge0)$ 的期望?
答:$\int_0^\infty x\lambda e^{-\lambda x}dx=\frac1\lambda$(分部积分 kp-014;无记忆性的来源)。
- 为什么正态密度常数是 $\frac1{\sqrt{2\pi}}$?
答:归一化要求 $\int e^{-x^2/2}dx=1$,而该积分=√(2π)(kp-026 极坐标高斯积分)——常数是积分的倒数。
延伸阅读
- Wasserman《All of Statistics》第 1–5 章(连续分布的速成章)。
- Blitzstein & Hwang《Introduction to Probability》连续分布章(直觉极佳,免费在线)。
- Jaynes《Probability Theory: The Logic of Science》(概率作为扩展逻辑的流派,历史脉络呼应 kp-032)。