随机优化与机器学习优化
上级:optimization
当问题规模巨大 + 非凸 + 梯度带噪声(对数百万数据点求和)时,精确的确定性下降法就失效了。转折点是:改用带噪声、廉价的梯度估计。
先驱
- Robbins–Monro(1951),随机逼近——用带噪声的样本求根,步长
ηₖ递减(Σηₖ=∞, Σηₖ²<∞)。SGD 的祖师爷。
SGD 及其家族
- SGD
x ← x − η ĝ,ĝ是在一个 minibatch 上算出的梯度(无偏估计); - Momentum、AdaGrad(按坐标缩放)、RMSprop、Adam(动量 + 自适应缩放——默认选择);
- 方差缩减:SVRG、SAG(在凸问题上,用 SGD 的低成本换来 GD 的收敛性)。
非凸 / 深度学习地形(为什么 SGD 在非凸情况下依然奏效)
- 高维损失曲面上占主导的是鞍点,而不是糟糕的局部极小值;噪声有助于逃离鞍点;
- 隐式正则化:SGD 偏好平坦极小值(泛化更好);
- 过参数化 → 全局极小值很多,容易到达。
- 所以经典意义上"非凸即难"的判断,在深度网络上被经验性地软化了——但没有通用的保证;这靠的是结构加运气,不是定理。
主题
从精确、确定、凸(可解)走向带噪、随机、非凸(实践中有效,理论薄弱)。这是"优化器会收敛"从被保证的事情,变成被工程化/调出来的事情的时代——正是我们那个不可靠内层优化器 harness 所走的同一步(stages-gates-as-hard-optimization)。