大厂不再迷信顶会:Auto Research时代,论文含金量正在缩水

SAI 对 ICML 2026 Oral 展开大规模复现,结果显示,论文被接收与实验真正经得住验证之间,仍隔着不小距离。

最近,一位网友查看某篇 ICLR 2026 论文的开源代码时,发现作者疑似使用测试集标签选择参数。

本应用于最终评估的数据,可能提前参与了模型选择。帖子没有公布论文链接和完整证据,相关指控尚无法独立核实。

但这件事很快引出了一个更大的争议:顶会录用,究竟还能为一篇论文提供多少信誉背书?

近期大火的 Muon 优化器作者、OpenAI 预训练团队研究员 Keller Jordan 随后转发,并把质疑指向 ICLR、ICML 和 NeurIPS。

他认为,许多大实验室研究者已经很少阅读这些顶会论文,因为在他看来,其中存在大量过度宣传,部分工作甚至越过学术诚信边界。

他随后收窄了说法,并不是说三大顶会的大多数论文都有问题,但那些最吸引眼球、最让人觉得结果惊艳的论文,反而更需要警惕过度宣传。

Auto Research 正把越来越多科研环节交给 AI Agent。SAI 团队这次把 Agent 用到了验证环节:不只读论文,而是实际运行实验、核对结果。

他们审查了全部 168 篇 ICML 2026 Oral,并完成了其中 105 篇的完整复现。

在至少包含 5 条可核验主张的 92 篇论文中,只有 8 篇复现得分超过 80%。在代码与可复现性方面,SAI Review 还发现了 903 个人工审稿未提及的问题

一篇论文被顶会接收,与它的结论真正经得住验证,中间究竟还隔着多远?

Agent 重跑顶会论文

现有同行评审流程通常以论文文本为主要依据,并不要求审稿人配置环境、实际运行代码。

SAI Review 则从论文中提取关键主张,获取公开的代码、数据和模型,运行实验,再将结果与原文逐项比较。

他们关心的不只是论文能否复现,还包括完整实验需要多少成本,以及 SAI Review 与人工审稿各自能发现什么。

168 篇 ICML 2026 Oral 中,近八成都包含实验。对于这些论文,仅判断方法和叙述是否合理还不够,真正验证结论需要把实验重新跑起来。

 图1. 168 篇 Oral 的研究类型分布

复现顶会论文的真实成本

按 Google Cloud 公有云按需价格估算,完整复现一篇 Oral 所报告全部实验的中位成本约 8900 美元17 篇超过 10 万美元,最高接近 220 万美元

统计覆盖正文、附录、消融实验、超参数搜索,以及跨随机种子、数据集和模型规模的重复运行。

这仍是保守估算,研究过程中不同方向的反复尝试可能让成本再增加 2-3 倍,人员薪酬和其他基础设施成本也没有计算在内。其中有论文仅一个预训练阶段,就报告使用了 80 张 A100,累计 38,400 GPU 小时

 图2. 完整实验成本估算

高投入没有自动换来可验证性。168 篇论文中,104 篇发布了能够直接运行的代码。

SAI 根据初始资源估算选择 105 篇进行完整复现,并从资源需求较低的论文逐步推进。其中 67 篇直接运行作者发布的代码,另有 38 篇没有发布可运行代码,由系统根据论文重新实现。

92 篇至少包含 5 条可核验主张,其中 34 篇复现得分超过 40%,8 篇超过 80%

 图3. 105 篇论文的完整复现结果

复现得分中位数为 28%。这里的 28% 不是论文正确率,而是已尝试并成功运行的主张中,有多少得到原论文结论支持。

主结果也纳入了缩小数据集或训练轮数后完成的实验,若只统计没有缩小范围的完整运行,至少包含 5 条可核验主张的论文减少到 80 篇,中位数升至 42%

 图4. 复现得分分布

代码开源,不代表结果能复现

105 篇论文中,101 篇至少遇到一类问题:58 篇代码无法按发布状态运行,48 篇数字与论文不一致,42 篇缺少数据,38 篇没有发布可运行代码。

此外还有训练好的模型未公开、代码实现与论文描述不一致等问题。

更棘手的是,4 篇论文依赖已经退役或不可用的模型,相关结果如今已经无法按原条件重新复现。

 图5. 常见复现障碍

低复现得分并不等于作者故意误导。代码老化、专有数据无法公开、运行环境差异,都可能导致复现失败。

一篇论文把仅训练基础模型 0.77% 的参数作为主要卖点,公开检查点实际训练了 6.31%,相差约 8 倍

另一篇给出由裁判模型评分的可靠性表格,仓库中却没有对应模型,也没有生成这些数字的脚本。只看论文正文,这两类问题都很难被发现。

903 个审稿盲区

至少两名人工审稿人共同提出的问题中,78% 也被 SAI Review 覆盖。在代码与可复现性方面,系统发现 903 个人工未提及的问题,人工发现而 SAI 漏掉的同类问题只有 22 个

差异也不只出现在代码:在正确性、实验严谨性和表达等方面,SAI 都发现了大量人工审稿遗漏的问题。在创新性与研究定位上,人工审稿仍更占优势。

 图6. SAI Review 与人工审稿对比

SAI 也提醒,Review 仍处于 Beta 阶段,其发现需要进一步核对。

公开代码不等于可以直接运行,代码能够运行,也不等于能重新生成论文中的数字。

参考文献

[1] https://sai.science/blog/how-much-science-is-verifiable

更多阅读

#投 稿 通 道#

 让你的文字被更多人看到 

如何才能让更多的优质内容以更短路径到达读者群体,缩短读者寻找优质内容的成本呢?答案就是:你不认识的人。

总有一些你不认识的人,知道你想知道的东西。PaperWeekly 或许可以成为一座桥梁,促使不同背景、不同方向的学者和学术灵感相互碰撞,迸发出更多的可能性。 

PaperWeekly 鼓励高校实验室或个人,在我们的平台上分享各类优质内容,可以是最新论文解读,也可以是学术热点剖析科研心得竞赛经验讲解等。我们的目的只有一个,让知识真正流动起来。

📝 稿件基本要求:

• 文章确系个人原创作品,未曾在公开渠道发表,如为其他平台已发表或待发表的文章,请明确标注 

• 稿件建议以 markdown 格式撰写,文中配图以附件形式发送,要求图片清晰,无版权问题

• PaperWeekly 尊重原作者署名权,并将为每篇被采纳的原创首发稿件,提供业内具有竞争力稿酬,具体依据文章阅读量和文章质量阶梯制结算

📬 投稿通道:

• 投稿邮箱:hr@paperweekly.site 

• 来稿请备注即时联系方式(微信),以便我们在稿件选用的第一时间联系作者

• 您也可以直接添加小编微信(pwbot02)快速投稿,备注:姓名-投稿

△长按添加PaperWeekly小编

🔍

现在,在「知乎」也能找到我们了

进入知乎首页搜索「PaperWeekly」

点击「关注」订阅我们的专栏吧

·