优化的现代前沿
上级:optimization
这里,目标函数本身是被学出来的、对抗性的、嵌套的,或是定义在分布之上的。
双层优化与元优化
- 优化套优化:超参数优化、学会优化(learning-to-optimize,学出更新规则本身)、元学习(MAML);
- "LLM 作为优化器"(OPRO)——模型不断提出并改进候选解;上下文学习(in-context learning)近似于隐式的梯度下降。→ 对应我们的 LLM 作为内层优化器(stages-gates-as-hard-optimization)。
极小极大、博弈与对抗
- 鞍点问题
min_x max_y f(x,y):GAN、对抗训练、鲁棒优化; - 由无悔动态 / 梯度下降-上升 / 单调算子求解;其收敛性很微妙(会在鞍点附近打转,而非单调下降)。
最优传输与测度空间上的梯度流
- 最优传输 / Wasserstein 距离;在概率分布上做优化;
- Wasserstein 梯度流 = 测度空间上的偏微分方程(Fokker–Planck)——这正是扩散模型背后的数学。
把难优化问题结构化(连续化家族)
- 同伦 / 连续化(continuation)、渐进非凸化、课程学习、退火——沿一条从易到难的问题路径求解,每一步都用上一步的解热启动;
- → 这正是阶段-关卡结构的本质:stages-gates-as-hard-optimization。
统一的抽象
- 单调算子 / 不动点理论——梯度下降、近端方法、ADMM、原始-对偶方法,都可以看作(强)非扩张算子的不动点迭代;
- 一切都是:把一个算子迭代到它的不动点;收敛当且仅当它是压缩映射 / 该流是稳定的 → dynamics-to-a-fixed-point。
主题
"最小化一个固定凸函数 f"这种干净的表述会瓦解:目标函数变成被学出来的(双层)、对抗性的(极小极大)、定义在分布之上的(最优传输),或难到无法直接下降的(连续化)。这正是 agent/LLM 优化这条线索所在的前沿。