多元极值、Hessian 与 Lagrange 乘数

05-多元微积分 进阶 约 25 分钟 #多元极值#Hessian#拉格朗日乘数#鞍点 更新 2026-10-02
当前状态:未学
本文基于模型知识整理(生成时未联网核对),二阶判据与乘数法建议对照 Stewart §14.7、§14.8 复核。

一句话定义

多元极值的候选=梯度零点($\nabla f=0$ 的驻点);二阶判据看 Hessian 矩阵 $H=[f_{ij}]$:正定=局部极小(碗,kp-016)、负定=极大、不定=鞍点(一个方向上升另一方向下降——多元世界新增的失败形态);带约束的极值用 Lagrange 乘数法:$\nabla f=\lambda\nabla g$——"目标梯度与约束梯度平行"处才是候选。

为什么重要

"在限制条件下做到最好"是一切工程与经济问题的数学形状(利润最大化受预算约束、模型拟合受复杂度约束);Hessian 判据是凸优化/牛顿法的底座(kp-028);鞍点概念则是深度学习优化困难的头号地形特征(kp-028 的地形学)。

前置知识

kp-023(梯度)、kp-024(链式)、kp-016(正定与二次型)。

核心概念

  • 驻点候选:解方程组 $f_x=f_y=\dots=0$;边界点单独考察(与一元 kp-010 的端点纪律同源)。
  • 二阶判据:Hessian $H=\begin{bmatrix}f_{xx}&f_{xy}\\f_{yx}&f_{yy}\end{bmatrix}$ 在驻点处:

- 正定($f_{xx}>0$ 且 $f_{xx}f_{yy}-f_{xy}^2>0$)→ 极小; - 负定 → 极大; - 行列式 <0 → 鞍点; - 行列式 =0 → 判据失效(需更高阶/直接分析)。

  • 鞍点:沿某方向是极小、沿另一方向是极大——"马鞍地形";梯度为零却不是极值(一元没有的形态)。
  • Lagrange 乘数法:约束 $g(x,y)=c$ 下求 f 极值 ⇒ 解 $\nabla f=\lambda\nabla g$ 与 $g=c$ 的联立;λ 的经济含义=约束放宽一单位时目标的改善率(影子价格,kp-024 对偶的呼应)。
  • 全局化:闭区域上最值 = 内部驻点值 ∪ 边界极值(边界本身又是约束极值问题——乘数法登场)。

原理与机制

为什么 Hessian 判据=kp-016 的正定判据:驻点附近的二阶泰勒 $f\approx f_0+\frac12\Delta x^\top H\Delta x$(线性项消失)——H 正定 ⇒ 任何方向都上升(碗)⇒ 极小;不定 ⇒ 有升有降(鞍)。多元极值判据就是二次型的正定性判别——线性代数 kp-016 的直接变现。

Lagrange 乘数的几何:在约束曲线(等值线 g=c)上找 f 的最值——最优点处 f 的等值线与 g 的等值线相切(否则还能沿约束滑动增减 f),相切=法向量平行=∇f∥∇g=λ∇g。λ 就是"平行所需的缩放系数"。引入辅助函数 $L=f-\lambda(g-c)$ 求驻点,λ 与未知数平权——把约束问题变成无约束问题。

为什么鞍点是深度学习的地形主角:高维空间中"所有方向都向下"的真正极值稀有,"部分向上部分向下"的鞍点遍地——随机梯度下降逃离鞍点靠噪声"踹一脚"(kp-028)。

图示

驻点: ∇f = 0
Hessian H=[f_ij] 判据:
  H 正定 → 极小 | 负定 → 极大 | det H < 0 → 鞍点 | det = 0 → 失效
2D 快查: f_xx>0 且 f_xx·f_yy − f_xy² > 0 ⇒ 极小
Lagrange: ∇f = λ∇g 且 g=c   (等值线相切)
辅助: L = f − λ(g−c) 驻点联立

直观类比

山地找最低点:梯度零点=一块平地;Hessian=这块地的曲率形状——碗状(极小)、倒碗(极大)、马鞍(前后低左右高——骑上去往哪都是坡)。Lagrange 乘数像"沿高速公路(约束)找离山顶最近的点":在高速上,山的等高线与公路相切处即为所求。

实例或案例

  • 投资组合:均值-方差优化=约束(预算+目标收益)下的方差极小——Lagrange 乘数的金融主场。
  • 最大熵/最小二乘带约束:Lagrange 乘数法是推导一切"带约束最优分布"的标准机械。
  • 深度学习损失地形:鞍点逃离、Hessian 谱分析(kp-016/023 的 ML 化)。

常见误区

  • 误区一:"梯度零点就是极值"。鞍点专属警告($xy$ 在原点:梯度零、二方向异号)。
  • 误区二:"忘记边界/约束上的最值"。内部驻点只覆盖"自由地形";闭区域最值必须边界+内部合并比较。
  • 误区三:"λ 有几个解就是几个极值"。乘数方程组给出候选,仍需代入比较(或二阶判据)排序——候选≠答案。

与其他知识点的关系

  • kp-016:Hessian 正定判据的线代本体。
  • kp-010/023/024:一元极值、驻点检测、约束推导的链条。
  • kp-028:鞍点与优化地形的应用主场。

自测题

  1. 求 $f=x^2+y^2-xy+4y$ 的驻点并判定类型。

答:$f_x=2x-y=0$、$f_y=2y-x+4=0$ → x=−4/3, y=−8/3;$H=\begin{bmatrix}2&-1\\-1&2\end{bmatrix}$ 正定 → 极小。

  1. $f=xy$ 在原点的 Hessian 与类型?

答:$H=\begin{bmatrix}0&1\\1&0\end{bmatrix}$,特征值 ±1 → 不定 → 鞍点。

  1. 用 Lagrange 乘数求 $f=xy$ 在 $x+y=10$ 下的最大值。

答:$y=\lambda$、$x=\lambda$(∇f=(y,x)=λ(1,1))与约束联立得 x=y=5 → 最大 25(矩形周长固定时正方形最大,几何验证)。

延伸阅读

  • Stewart《Calculus》§14.7–14.8。
  • Boyd & Vandenberghe《Convex Optimization》第 5 章(KKT 条件是乘数法的现代完全体)。
  • 3Blue1Brown/Lagrange 乘数的可视化视频(相切直觉)。