概率中的微积分:密度、期望与归一化

06-实践历史与应用 核心 约 25 分钟 #概率密度#期望#归一化#连续分布 更新 2026-10-02
当前状态:未学
本文基于模型知识整理(生成时未联网核对),统计结论建议对照 Wasserman《All of Statistics》复核。

一句话定义

连续概率是微积分的驻场应用:概率密度 f(x) 是"满足 $\int f=1$ 且 $f\ge0$ 的函数",概率=密度曲线下面积($\int_a^bf$),期望=加权平均的连续版($E[X]=\int xf\,dx$)——正态分布常数的 $\frac1{\sqrt{2\pi}}$、柯西分布"有密度无均值"、损失归一化=隐式学习率,全是微积分操作在概率里的日常。

为什么重要

机器学习的语言就是概率+微积分:似然函数的积分归一、交叉熵的推导、连续分布的期望方差、采样算法(逆变换法)——不懂"密度下的积分操作",连续概率寸步难行。本条把 kp-013/015/026 的积分武器在概率战场上列装完毕。

前置知识

kp-013(FTC)、kp-015(反常积分收敛)、kp-026(二重积分);基础概率词汇(随机变量、分布)。

核心概念

  • 密度函数三律:$f(x)\ge0$、$\int_{-\infty}^{\infty}f=1$(归一化)、$P(a\le X\le b)=\int_a^bf$。注意 $f(x)$ 本身不是概率(可>1),"点概率"恒 0——概率属于区间(积分)。
  • 分布函数(CDF)与密度的互逆:$F(x)=\int_{-\infty}^xf$,$f=F'$(FTC kp-013 的概率化)——CDF 单调右连续、极限 0/1。
  • 期望:$E[X]=\int xf(x)dx$(kp-016"平均值"的概率版);存在性要求该积分绝对收敛(kp-015 的警告在此引爆:柯西分布 $\int\frac{x}{1+x^2}dx$ 主值虽对称但绝对发散 ⇒ 期望不存在,"对称"不能救)。
  • 高斯归一化的微积分来历:$\int_{-\infty}^\infty e^{-x^2/2}dx=\sqrt{2\pi}$(kp-026 极坐标高斯积分的换装)——正态密度前的 $\frac1{\sqrt{2\pi}}$ 不是拍脑袋,是归一化积分的解。
  • 期望的线性性:$E[aX+bY]=aE[X]+bE[Y]$(积分线性性的直接推论)——概率中最好用、无需独立性的一条性质。
  • 变量替换:$Y=g(X)$ 的密度 $f_Y(y)=f_X(x)\left|\frac{dx}{dy}\right|$——换元公式(kp-014)的概率版,逆变换采样法的理论核。

原理与机制

为什么"点概率为零"不矛盾:密度是"单位长度的概率浓度"(像线密度质量);单点长度为零故概率零——区间才有质量。$P(X=c)=0$ 但事件并非不可能(零概率≠不可能,连续世界的第一课)。

为什么柯西分布没有均值:$\int_{-A}^{A}x\cdot\frac1{\pi(1+x^2)}dx=0$ 看似对称=0,但绝对值积分 $\int\frac{|x|}{1+x^2}dx$ 发散(对数增长,kp-015)——期望定义为绝对收敛意义下;正负无穷远处的"质量"势均力敌却各自无限,平均值依赖截断方式(截断不同答案不同)——"无均值"比"均值无穷"更深刻。

为什么损失/密度的尺度=隐式学习率(kp-028 的出处):损失乘 2,梯度乘 2,等效学习率乘 2——概率密度归一化(除以 ∫)在优化语境下就是"把学习率固定在数据无关的水平";归一化纪律的优化解释由此而来。

图示

密度三律: f≥0 ; ∫f=1 ; P(a≤X≤b)=∫ᵃᵇf
CDF: F(x)=∫₋∞ˣf  ⇔  f=F'   (FTC 概率版)
期望: E[X]=∫x·f dx  (绝对收敛才存在 — 柯西反例)
高斯: ∫e^{−x²/2}dx=√(2π)  (kp-026 极坐标) → N(0,1) 密度
线性性: E[aX+bY]=aE[X]+bE[Y]  (积分线性, 免独立性)
换元: f_Y(y)=f_X(x)|dx/dy|   (逆变换采样法核)

直观类比

密度像"人口密度地图":每点一个浓度值(可以很高),想知道某城区人口(概率)必须对区域积分。期望像"全国人均坐标"——柯西分布是"左右两翼各有无穷人口的对称国":人均位置没有定义,因为两侧人口都数不完。

实例或案例

  • 正态概率:$P(|X-\mu|<\sigma)\approx68\%$——查表/数值积分(kp-017)的结果,无解析原函数(kp-013 的 $e^{-x^2}$)。
  • 逆变换采样:$u\sim U(0,1)$,输出 $X=F^{-1}(u)$ 服从目标分布——单调函数换元+均匀分布的直接应用。
  • 交叉熵损失:$-\log p(y)$ 对 logits 求梯度得 $p-y$(kp-022 的 softmax 联动)——概率与梯度下降(kp-028)的会师。

常见误区

  • 误区一:"f(x) 是概率"。密度可 >1(窄分布峰值,如 U(0,0.5) 的 f=2)——概率永远是积分值。
  • 误区二:"对称分布必有均值"。柯西反例——对称只保证主值为 0,不保证绝对收敛(期望存在性以绝对收敛为准)。
  • 误区三:"E[XY]=E[X]E[Y] 随便用"。线性性无独立性也成立,但乘积期望需要独立性(或协方差修正)——两条性质的条件完全不对称。

与其他知识点的关系

  • kp-013/015/026:FTC、收敛、二重积分三大件的概率变现。
  • kp-017:正态概率的数值积分兜底。
  • kp-028:损失尺度=学习率的优化联动。

自测题

  1. 求 $U(0,1)$ 的 $E[X]$ 与 $E[X^2]$。

答:$\int_0^1x\,dx=\frac12$;$\int_0^1x^2dx=\frac13$(方差=1/3−1/4=1/12)。

  1. 指数密度 $f(x)=\lambda e^{-\lambda x}\,(x\ge0)$ 的期望?

答:$\int_0^\infty x\lambda e^{-\lambda x}dx=\frac1\lambda$(分部积分 kp-014;无记忆性的来源)。

  1. 为什么正态密度常数是 $\frac1{\sqrt{2\pi}}$?

答:归一化要求 $\int e^{-x^2/2}dx=1$,而该积分=√(2π)(kp-026 极坐标高斯积分)——常数是积分的倒数。

延伸阅读

  • Wasserman《All of Statistics》第 1–5 章(连续分布的速成章)。
  • Blitzstein & Hwang《Introduction to Probability》连续分布章(直觉极佳,免费在线)。
  • Jaynes《Probability Theory: The Logic of Science》(概率作为扩展逻辑的流派,历史脉络呼应 kp-032)。