单调性、极值与凸性:导数是函数的 X 光
本文基于模型知识整理(生成时未联网核对),判别法条件建议对照 Stewart §4.3 复核。
一句话定义
导数的符号是函数的 X 光片:$f'>0$ 单调升、$f'<0$ 单调降(MVT 保证,kp-009);符号由正转负的点=极大值(一阶导判据),二阶导 $f''>0$ 下凸(碗形)、$f''<0$ 上凸、$f''$ 变号=拐点——找出函数"形状"的全部流程可机械化。
为什么重要
优化=找极值:从工厂利润最大化到神经网络的损失最小化(kp-028),一阶/二阶判据是所有优化方法的原型。凸性则决定"局部最优=全局最优"的黄金性质——机器学习偏爱凸损失函数的原因全部写在本条。
前置知识
kp-006/009(导数与中值定理)。
核心概念
- 单调判据:区间上 $f'>0$ ⇒ 严格递增;$f'<0$ ⇒ 严格递减(MVT 证明)。
- 临界点:$f'=0$(驻点)或 $f'$ 不存在的点——极值只可能藏在临界点里(Fermat 内点定理)。
- 一阶导判据:f' 由正转负=极大;由负转正=极小;不变号=非极值(如 $x^3$ 的 0)。
- 二阶导判据:$f'(x_0)=0$ 且 $f''(x_0)>0$ ⇒ 极小;$f''<0$ ⇒ 极大;$f''=0$ 不能判定(回一阶法)。
- 凸性:$f''>0$ ⇒ 下凸(convex,碗形,切线在下方);$f''<0$ ⇒ 上凸(concave);拐点=凸性切换处($f''$ 变号)。
- 全局 vs 局部:闭区间上的全局最值 = 内部极值候选 ∪ 端点值(最值定理 kp-003 保证存在)。
原理与机制
为什么"驻点+不可微点"穷尽了极值:极值点若可微,左右函数值都更小/更大 ⇒ 差商左右异号 ⇒ 导数为 0(Fermat);不可微的尖角(|x| 的 0 点是极小)也必须列入候选——"扫临界点"清单由此完备。
凸性的价值(凸函数三利好):① 局部极小=全局最小(碗只有一个底);② 一阶条件 $f'(x)=0$ 充分刻画最优;③ 现代优化(牛顿法/共轭梯度)有收敛保证。机器学习的损失函数设计追逐凸性(线性回归+平方损失=kp-030 的碗)。判据:$f''\ge0$ 恒成立(或二阶泰勒的曲率项恒正,kp-016/027 的 Hessian 版本)。
拐点的识别纪律:$f''=0$ 是必要条件候选而非充分($x^4$ 的 0 点 $f''=0$ 但凸性不变)——必须验证变号。
图示
单调: f' > 0 ↗ ; f' < 0 ↘ (MVT 保证)
临界点: f'=0 (驻点) 或 f' 不存在 (极值候选)
一阶判: f' 正→负 = 极大 ; 负→正 = 极小
二阶判: f'(x₀)=0 且 f″>0 极小 ; f″<0 极大 ; f″=0 存疑
凸性: f″>0 下凸∪ ; f″<0 上凸∩ ; 变号 = 拐点
最值: 临界点值 ∪ 端点值 中取最大/最小
直观类比
开车翻山:上坡(f'>0)到顶点(f'=0 且即将下坡=极大)再下坡;二阶导是"坡度变化率"——越翻越陡(下凸)还是越翻越缓(上凸)。拐点=从"越爬越累"切换到"越爬越轻松"的那个点——海拔没变,累法变了。
实例或案例
- 易拉罐设计:体积固定求最小表面积——半径=高($h=2r$)的经典极值应用。
- 统计与 ML:对数似然的极大化 = $f'=0$ 求驻点 + 二阶确认;损失函数凸性检查。
- 经济学:边际=平均的极值关系(平均成本最低时边际成本=平均成本,由 $C/x$ 极值的导数条件直接导出)。
常见误区
- 误区一:"驻点=极值点"。$x^3$ 的 0 驻点既非极大也非极小——必须过一阶/二阶判据。
- 误区二:"$f''=0$ 就是拐点"。$x^4$ 在 0 处 $f''=0$ 但仍是下凸——变号才是拐点的定义。
- 误区三:"极值点忘了端点"。闭区间最值要把端点值排进候选——"最大值在边界"是优化的常态。
与其他知识点的关系
自测题
- 求 $f(x)=x^3-3x$ 的极值。
答:$f'=3x^2-3=0$ → x=±1;f''=6x:x=1 极小(f=−2)、x=−1 极大(f=2)。
- 求 $f(x)=x^4-2x^2$ 在 [−2, 3] 的全局最值。
答:f'=4x(x²−1)=0 → x=0,±1;候选值 f(±2)=8、f(0)=0、f(±1)=−1、f(3)=63 → 最大 63(端点),最小 −1。
- $y=x^3$ 在 0 处是拐点吗?驻点吗?
答:是拐点(f''=6x 在 0 变号)且是驻点(f'=3x²=0);但非极值——驻点+拐点可以重合。
延伸阅读
- 3Blue1Brown《Essence of Calculus》极值相关集。
- Stewart《Calculus》§4.1、§4.3。
- Boyd & Vandenberghe《Convex Optimization》§3(凸性的优化价值)。