一步生成SOTA也不够,何恺明团队「漂移模型」遭ICML拒稿¶
Ch01.1527 一步生成SOTA也不够,何恺明团队「漂移模型」遭ICML拒稿¶
📊 Level ⭐⭐⭐ | 8.0KB |
entities/一步生成sota也不够何恺明团队漂移模型遭icml拒稿.md
一步生成SOTA也不够,何恺明团队「漂移模型」遭ICML拒稿¶
摘要¶
何恺明团队提出的漂移模型(Drift Model) 试图将生成模型的分布演化过程从推理阶段转移到训练阶段,实现一步生成。该工作在 ImageNet 256×256 上以仅 1 NFE(网络求值次数)达到 FID 1.54(潜空间)和 1.61(像素空间),结果接近当时 SOTA。然而,ICML 2026 四位审稿人给出 5/4/4/3 的分数,最终拒稿。争议焦点包括:特征编码器依赖、CFG 贡献分离不清、与已有生成方法的关系不明。
核心要点¶
- 漂移模型的核心创新:把推理时的分布演化前移到训练阶段完成,参数更新带动生成分布移动,训练结束后推理只需一次前向。
- 结果优异:在 ImageNet 256×256 上,潜空间 L/2 以 1 NFE 达 FID 1.54,像素空间 L/16 以 1 NFE 达 FID 1.61,且从头训练而非蒸馏。
- 拒稿原因:PC 认可结果和写作清晰度,但关注特征编码器依赖和与已有工作的关系两个核心问题。
- 学术影响力:论文发布数月已获 69 次引用,各大会议出现多篇围绕漂移、得分匹配、Sinkhorn 和梯度流的相关工作。
深度分析¶
漂移场的核心机制与理论贡献¶
漂移模型的关键思想是将生成过程中的分布演化从推理阶段转移到训练阶段。传统扩散模型和流匹配模型在推理时多次调用网络,让样本逐步靠近数据分布。漂移模型则通过漂移场(Drift Field) 在训练过程中推动样本分布演化:真实样本提供吸引力,当前生成样本提供排斥力,两者共同决定样本更新方向。当生成分布与真实分布匹配时,漂移场归零。
这一思路的理论吸引力在于:它重新定义了「生成质量」与「推理成本」之间的权衡边界。如果训练阶段能够承担更多的分布演化计算,推理阶段就可以大幅简化——这对部署场景(边缘设备、实时应用)具有潜在的重大价值。
特征编码器依赖:方法的核心争议¶
漂移场依赖样本之间的相似性估计,而自然图像维度极高,直接在原始像素空间或潜空间估计距离信号可能很弱。因此,论文选择在预训练自监督模型的特征空间中计算漂移损失。这一设计选择虽然只影响训练阶段(推理时不会额外调用特征编码器),但实验结果明确显示特征编码器的选择对 FID 影响巨大。
审稿人的核心质疑在于:漂移模型在高维图像任务上的表现与预训练表征空间之间究竟是什么关系?如果离开特定的表征空间,漂移场能否稳定提供有效的训练信号?作者在 rebuttal 中承认,尝试过不同核函数和带宽,但 ImageNet 原始像素空间仍未跑通,给出的解释是 Monte Carlo 估计方差过高。
CFG 贡献分离与方法完备性¶
漂移模型的实现并不只包含漂移场本身,还涉及特征归一化、漂移归一化、多温度、CFG-conditioning 和样本队列等多个组件。审稿人质疑:质量提升到底有多少来自漂移场本身,又有多少来自 CFG 信号? 如果主要增益来自 CFG,漂移场在方法中的位置需要进一步说明。
作者在 rebuttal 中补充了无 CFG 训练消融,结果显示去掉 CFG 后模型仍能训练但分数明显变化,在特征较弱设置下 CFG 带来的差距更大。这组消融说明漂移训练目标本身有效,但也承认 CFG 在部分设置中带来了明显增益。
与已有生成方法的关系¶
漂移场作为中心对象确实带来了一种新的组织方式,但它与 DMD、MMD、GAN、score 估计、Sinkhorn、梯度流等已有方法之间存在密切联系。审稿人多次要求作者进一步说明这些关系。理论层面还有一个关键问题:漂移场归零是否足以推出分布匹配? 论文证明了分布匹配时漂移场为零,但反向关系在一般情形下不成立,只能在特定构造下讨论近似条件。
拒稿的学术启示¶
论文被顶会拒绝并不等于研究本身失去价值。从 LSTM、SIFT、Dropout、Word2Vec、知识蒸馏、YOLO 到 Mamba,许多影响力深远的工作都曾在投稿阶段遭遇拒稿。越是试图改动成熟方向默认做法的研究,越容易同时带来结果、争议和未完成的问题。漂移模型虽然没有通过 ICML 审稿,但它已经给一步生成提供了一个清晰且有分量的答案:高质量生成不一定要把复杂计算都留在推理阶段,训练阶段同样可以承担更关键的分布演化。
实践启示¶
-
方法完备性是顶会审稿的关键维度:漂移模型在结果上达到 SOTA,但因为特征编码器依赖、组件贡献未完全消融清晰,导致审稿人对其方法创新性产生根本性质疑。研究工作在追求结果的同时,必须重视方法设计的独立性和可解释性。
-
一步生成的成本优势具有工程价值:1 NFE 的推理效率对于边缘部署、实时图像生成等场景意义重大。即使漂移模型当前存在局限,其「把计算前移到训练阶段」的设计哲学值得在模型压缩和推理优化领域持续探索。
-
特征空间依赖是生成模型的结构性难题:漂移模型对预训练特征编码器的依赖并非个例——许多生成方法都隐式或显式地依赖特定的表征空间。如何构建不依赖特定特征空间的生成方法,是一个尚未解决的问题。
-
学术审稿的制度性局限:一次审稿周期难以完整判断一项工作的长期影响。对于有明显学术价值但存在争议的工作,持续迭代和补充实验(如漂移模型已在进行的多维度消融)比放弃方向更明智。
-
关联领域的交叉验证:漂移模型激发的后续工作(得分匹配、Sinkhorn、梯度流相关论文大量涌现)本身就是对其学术价值的佐证。审稿结果不应成为判断工作价值的唯一标准。
相关实体¶
→ 原文存档
第 2 Source — PaperWeekly¶
From WeChat MP PaperWeekly, supplemental coverage of the same topic.
→ 原文存档