跳转至

AI自己造AI,概率60%,2028年底前!Anthropic联创坐不住了

Ch01.800 AI自己造AI,概率60%,2028年底前!Anthropic联创坐不住了

📊 Level ⭐⭐ | 8.0KB | entities/2026-05-05-AI自己造AI-概率60-2028年底前-Anthropic联创坐不住了-新智元.md

AI自己造AI,概率60%,2028年底前!Anthropic联创坐不住了

来源:原文存档

核心要点

AI自己造AI,概率60%,2028年底前!Anthropic联创坐不住了

技术分析


title: AI自己造AI,概率60%,2028年底前!Anthropic联创坐不住了

source: wechat url: https://mp.weixin.qq.com/s/z-9Qz6kM1wCkAYWkpLpF6Q mp_name: 新智元 publish_date: 2026-05-05


AI自己造AI,概率60%,2028年底前!Anthropic联创坐不住了

来源: 新智元

发布日期: 2026-05-05

原文链接: https://mp.weixin.qq.com/s/z-9Qz6kM1wCkAYWkpLpF6Q


--- 新智元报道

编辑:元宇 【新智元导读】 Anthropic联合创始人Jack Clark读完数百份公开数据,得出一个让他自己也坐不住的结论:2028年底前,AI自己造AI的概率是60%。支撑他这一判断的,是编程、科研复现、模型训练优化等多条能力曲线:每一条都在向右上方飞,没有减速迹象。

AI系统,可能很快就能自行构建自身了!

说这句话的人,是Anthropic联合创始人Jack Clark。

5月4日,他在X上发帖:「我认为,递归自我改进(RSI)有60%的概率在2028年底之前发生。」

除了Anthropic联合创始人身份之外,Clark还是《Import AI》的创办者兼主笔,长期跟踪AI能力进展。

这次发帖,他在《Import AI》上同时发布了一篇完整的分析文章。

https://importai.substack.com/p/import-ai-455-automating-ai-research

这是一件大事。我不知道该如何理解它。这是一个我不情愿接受的看法:其影响太过巨大,让我感到自身渺小,而且我不确定,社会是否已准备好迎接自动化AI研发所带来的变革。

Clark在文章里写: 如果这一天到来,人类将跨过一道「卢比孔河」,进入一个几乎无法预测的未来 。

他不认为这会发生在2026年,但他预判一两年内可能 在非前沿模型上, 出现这样的概念验证:一个模型,端到端训练出自己的继任者。

支撑Clark结论的,主要来自公开信息:arXiv、bioRxiv、NBER上的论文,加上他对各大前沿实验室产品的持续观察,Clark以此 拼凑出一幅关于AI进展的全景图。

在他看来,AI工程化生产的所有组件,今天已经基本齐了。 剩下的问题是:模型什么时候能积累足够的创造力,开始像人类研究员一样推动前沿演进。

四年

从30秒到12小时

Clark的核心论据,是一批能力进展曲线。

先看METR的时间轴图。

https://metr.org/time-horizons/

METR是一个专注AI能力评估的机构,他们追踪的是:AI系统能独立完成一项任务,在50%成功率水平线上,这项任务如果让一个熟练的人来做大概需要多少时间。

  • 2022年,GPT-3.5的数字是:30秒;

  • 2023年,GPT-4把这个数字推到了4分钟;

  • 2024年,o1推到了40分钟;

  • 2025年,GPT-5.2(高配版)跨到了6小时;

  • 2026年,Claude Opus 4.6已经到了12小时。

四年,从30秒到12小时,翻了1440倍!

AI能力研究员Ajeya Cotra认为,2026年底之前,这个数字有望突破100小时。

如果达到100小时时间跨度,它将能覆盖许多多日级软件/研究辅助任务。

编程能力同样也在起飞。

SWE-Bench衡量的是AI解决真实GitHub工程问题的能力。2023年底,Claude 2的得分是2%。到今年,Claude Mythos Preview达到93.9%,这个基准基本被打穿了。

CORE-Bench测的是另一件事:给AI一篇论文和对应的代码库,让它独立复现实验结果,这是AI研究员最基本的日常工作之一。

2024年9月该测试推出时,最好成绩是21.5%。2025年12月,Opus 4.5在Claude Code scaffold下verified accuracy 为77.78%,经人工校验后为95.5%,项目方称CORE-Bench已被解决。

https://hal.cs.princeton.edu/corebench_hard

15个月,从21.5%到95.5%。

MLE-Bench测的是AI独立参加Kaggle竞赛的能力,覆盖75个真实比赛项目。

2024年10月发布时最高分16.9%,到2026年2月,Gemini 3加搜索工具的组合已经达到64.4%。

https://github.com/openai/mle-bench

...


原文存档


关联