2026-08-28·by Sijie Wang#idea#optimization#math

stochastic-and-ml-optimization

随机优化与机器学习优化

上级:optimization

当问题规模巨大 + 非凸 + 梯度带噪声(对数百万数据点求和)时,精确的确定性下降法就失效了。转折点是:改用带噪声、廉价的梯度估计。

先驱

  • Robbins–Monro(1951),随机逼近——用带噪声的样本求根,步长 ηₖ 递减(Σηₖ=∞, Σηₖ²<∞)。SGD 的祖师爷。

SGD 及其家族

  • SGD x ← x − η ĝĝ 是在一个 minibatch 上算出的梯度(无偏估计);
  • MomentumAdaGrad(按坐标缩放)、RMSpropAdam(动量 + 自适应缩放——默认选择);
  • 方差缩减:SVRG、SAG(在凸问题上,用 SGD 的低成本换来 GD 的收敛性)。

非凸 / 深度学习地形(为什么 SGD 在非凸情况下依然奏效)

  • 高维损失曲面上占主导的是鞍点,而不是糟糕的局部极小值;噪声有助于逃离鞍点;
  • 隐式正则化:SGD 偏好平坦极小值(泛化更好);
  • 过参数化 → 全局极小值很多,容易到达。
  • 所以经典意义上"非凸即难"的判断,在深度网络上被经验性地软化了——但没有通用的保证;这靠的是结构加运气,不是定理。

主题

精确、确定、凸(可解)走向带噪、随机、非凸(实践中有效,理论薄弱)。这是"优化器会收敛"从被保证的事情,变成被工程化/调出来的事情的时代——正是我们那个不可靠内层优化器 harness 所走的同一步(stages-gates-as-hard-optimization)。

about this entry

One of sijie's wiki entries. The AI on this site is grounded in the same corpus and answers in sijie's voice, with citations back to entries like this one — answering costs sijie money, so it waits behind a code: enter an access code →