最大编码率降低(MCR2)
这是一条关于什么才是好的学习表示的原则,它把目标定在特征本身之上,而不是定在标签上的损失。这是 Yi Ma 一脉的工作,也是白盒深度学习研究纲领的基础。
度量:编码率
给定一个特征矩阵 Z(列为 n 个样本各自的 d 维特征),编码率定义为:把 Z 编码到精度 eps 所需的每样本比特数(一种率失真 / 高斯球计数):
R(Z) = (1/2) log det( I + (d / (n * eps^2)) * Z Z^T )
R 越大,说明特征占据的体积越大(越分散 / 有效维度越高)。
目标:整体扩张,逐类压缩
给定一个类别划分,令 R_c(Z) 为各类别内部编码率之和(每个类别各自单独编码)。一个好的表示应当:
- 整体上扩张 ——
R(Z)大(特征多样,铺满空间); - 逐类紧凑 ——
R_c(Z)小(每个类别低维)。
于是要最大化两者之差,即编码率降低:
DeltaR(Z) = R(Z) - R_c(Z) -> maximize
(PCA 是单类别的特例;MCR2 是它向多类别的推广。)
最优解的样子(收益)
最大化 DeltaR 会迫使各个类别落入相互正交的低维子空间,且每个子空间内部尽可能地铺展开。于是一个目标函数同时买到了两个性质:
- 判别性 —— 各类别被分开(子空间正交);
- 多样性 —— 类别内部的特征不会坍缩成一点(类内体积高),这与朴素交叉熵不同——后者可能把一个类别压缩成一个点(神经坍缩,neural collapse)。
ReduNet:白盒网络
把在 DeltaR 上做投影梯度上升这一过程展开(unroll):每一次迭代变成一层。得到的网络(ReduNet)是一个深度网络,其中每一个算子(一个线性映射 + 类别子空间之间的类 softmax 竞争)都是推导出来的,而非通过反向传播学出来的——按构造即可解释。架构就是率降低目标的一个展开优化器。
为什么重要 / 关联
- 相对于对比学习 / 自监督目标,这是一个有原则的、信息论式的替代方案:不需要负样本,不需要数据增强技巧——只需要"整体铺展、逐部压缩"。
- 把表示学习与率失真理论和子空间聚类联系了起来。
- 属于"把深度网络理解为在优化一个显式的、可度量的目标"这一研究纲领(相对于黑盒视角)——在精神上,与"读懂网络的结构而非仅信任其输出"是一路的。