大厂不再迷信顶会:Auto Research时代,论文含金量正在缩水¶
Ch01.1239 大厂不再迷信顶会:Auto Research时代,论文含金量正在缩水¶
📊 Level ⭐⭐ | 4.6KB |
entities/大厂不再迷信顶会-auto-research论文含金量.md
大厂不再迷信顶会:Auto Research 时代论文含金量正在缩水¶
PaperWeekly 报道了 SAI 团队对 ICML 2026 全部 168 篇 Oral 论文的大规模自动复现审计(SAI Review),结果显示论文被顶会接收与实验真正经得住验证之间仍有不小距离:在至少包含 5 条可核验主张的 92 篇论文中,只有 8 篇复现得分超过 80%,复现得分中位数为 28%。与此同时,Muon 优化器作者、OpenAI 预训练团队研究员 Keller Jordan 转发质疑指向 ICLR、ICML、NeurIPS,认为大实验室研究者已很少阅读顶会论文,因为其中存在大量过度宣传,部分工作甚至越过学术诚信边界。
SAI Review:用 Agent 重跑顶会论文¶
SAI Review 从论文中提取关键主张,获取公开代码、数据和模型,实际运行实验,再与原文逐项比较。168 篇 ICML 2026 Oral 中近八成都包含实验。按 Google Cloud 公有云按需价格估算,完整复现一篇 Oral 全部实验的中位成本约 8,900 美元,17 篇超过 10 万美元,最高接近 220 万美元;考虑研究过程中的反复尝试,成本可能再增加 2–3 倍。168 篇中有 104 篇发布了可直接运行的代码;SAI 根据资源估算选择 105 篇进行完整复现,其中 67 篇直接运行作者代码,38 篇由系统根据论文重新实现。
92 篇至少包含 5 条可核验主张的论文中,34 篇复现得分超过 40%,8 篇超过 80%;若只统计未缩小范围的完整运行,论文数减到 80 篇,中位数升至 42%。复现得分衡量的是"已尝试并成功运行的主张中有多少得到原论文结论支持",而非论文正确率。
代码开源不代表结果可复现¶
105 篇论文中 101 篇至少遇到一类问题:58 篇代码无法按发布状态运行,48 篇数字与论文不一致,42 篇缺少数据,38 篇没有发布可运行代码;还有训练好的模型未公开、实现与论文描述不一致等问题。4 篇论文依赖已经退役或不可用的模型,如今无法按原条件复现。低复现得分不等于作者故意误导——代码老化、专有数据无法公开、运行环境差异都可能导致复现失败。一个典型例子:一篇论文把"仅训练基础模型 0.77% 的参数"作为主要卖点,公开检查点实际训练了 6.31%,相差约 8 倍。
903 个人工审稿盲区¶
至少两名人工审稿人共同提出的问题中,78% 也被 SAI Review 覆盖;但在代码与可复现性方面,系统发现了 903 个人工审稿未提及的问题,人工发现而 SAI 漏掉的同类问题只有 22 个。在正确性、实验严谨性和表达等方面 SAI 都发现了大量人工审稿遗漏的问题,而人工审稿在创新性与研究定位上仍占优势。SAI 同时提醒 Review 仍处于 Beta 阶段,其发现需要进一步核对。这件事与 Auto Research 的能力分级 直接相关:当科研环节逐步交给 Agent,验证环节也开始被自动化。
事件背景中,"有人发现某篇 ICLR 2026 论文疑似用测试集标签选择参数"的指控无法独立核实,但引发了"顶会录用还能为一篇论文提供多少信誉背书"的更大争议。AI 安全中心(CAIS)与 Scale AI 联合推出的 Humanity's Last Exam 等更难基准的出现,也是同一个趋势的侧面:LLM 评测基准全景 正在从"固定考卷"转向更难、更动态的验证手段。Keller Jordan 收窄后的说法是:并非三大顶会大多数论文都有问题,但那些最吸引眼球、最惊艳的论文反而更需要警惕过度宣传。
→ 原文存档