代码榜刷满分,AI科研却撞墙?140道真实研究题撕开「自进化」真相¶
Ch01.1442 代码榜刷满分,AI科研却撞墙?140道真实研究题撕开「自进化」真相¶
📊 Level ⭐⭐ | 2.6KB |
entities/代码榜刷满分ai科研却撞墙140道真实研究题撕开自进化真相.md
代码榜刷满分,AI科研却撞墙?140道真实研究题撕开「自进化」真相¶
WeChat-新智元 | 发布于 2026-08-12 | 评分入库 v×c≥49
核心内容¶
新智元 2026-08-12 12:26 北京 新智元报道 AI已经能写代码、跑实验,甚至靠海量试错刷新部分人类纪录。 但当目标从「把一个分数继续刷高」,变成「提出一种真正更好的机器学习方法」,最强模型还能走多远? 一项覆盖12个领域、140个真实研究任务的新工作MLS-Bench 给出了并不乐观的答案。 即使拿到人类最强方法的完整实现,并被允许反复实验,当前前沿模型仍没有展示出可靠的方法创新能力。它们交出的所谓新方案,基本仍是对已知方法的调优与重新组合。 更值得注意的是,MLS-Bench 的评测已经进入Kimi K3和Qwen3.8-Max的官方发版表。 代码评测逐渐饱和后,头部模型厂商正在把下一个能力前沿指向同一个问题: AI能否真正开展研究? 论文链接:<https://arxiv.org/abs/2605.08678 项目主页:<https://mls-bench.com/ 代码链接:<https://github.com/Imbernoulli/MLS-Bench 在Kimi K3与Qwen3.8-Max的官方评测表中,MLS-Bench-Lite与软件工程、终端操作和通用智能体评测并列出现。 图片分别来自 Kimi K3 Tech Blog 与 Qwen3.8-Max官方Blog 。 这不是又一套代码题。MLS-Bench-Lite从完整评测中选出30个任务,覆盖全部12个机器学习领域,专门考查模型能否围绕真实研究问题提出并实现更好的方法。 2026年6月,Kimi K2.7-Code首次将它纳入官方发布评测;一个月后,Kimi K3再次采用;随后Qwen3.8-。
关键要点¶
相关实体¶
Agent Architecture Agent Orchestration Patterns Agent Evaluation Benchmarks Evaluation Harness Design