跳转至

AI能接管实验室了?中国科大最新研究给出真实物理世界的压力测试

Ch01.1435 AI能接管实验室了?中国科大最新研究给出真实物理世界的压力测试

📊 Level ⭐⭐ | 3.0KB | entities/ai能接管实验室了中国科大最新研究给出真实物理世界的压力测试.md

AI能接管实验室了?中国科大最新研究给出真实物理世界的压力测试

WeChat-新智元 | 发布于 2026-08-06 | 评分入库 v×c≥49

核心内容

新智元 2026-08-06 12:21 北京 新智元报道 我们如何判断人工智能是否已经足够聪明,能够从事科学研究,实现端到端的自主科学发现? 中国科学技术大学发布的最新研究让AI「大脑」接管机器科学家实验室「身体」, 由此将这一问题从知识问答和方案生成,推进到真实物理世界中的实验执行与反馈学习。 论文链接:<https://arxiv.org/abs/2607.23045 研究团队搭建了一个机器催化实验室,其中包括45个覆盖合成、表征和催化性能测试的模块化自动工作站。 为了让AI理解和调用实验室能力,研究团队将这些能力封装为机器可读技能(skills)。AI智能体可以通过这些技能直接调用实验设备,同时接受真实设备能力、操作规范和实验条件的约束。 图1.用于催化研究的AI读得懂的机器科学家实验室架构。 图2.从科学意图到机器实验室执行路径。 压力测试 基于该平台,研究团队对由6种智能体框架和9种大语言模型构成的48种实际配置进行了系统评测。 测试覆盖32项由领域专家定义的研究任务,共计4,608次评测试次。评估不仅考察智能体能否生成实验计划,还追踪这些计划能否通过核验并下发至机器人系统,以及生成的工作流是否能够在无需人工干预的情况下直接执行。 残酷的真实世界评测结果 当前领先的大语言模型智能体距离「接管」仍有明显差距。在4,608次测试中,仅151个工作流无需人工修复即可执行,占全部测试的3.3%。表现最好的Claude Code与Claude Opus 4.7组合,可执行率为28.1%;Codex与GPT 5.5组合的可执行率为19.8%。 会调整参数,不等于会重新规划 研究。

关键要点

相关实体

Agent Architecture Agent Orchestration Patterns Harness Engineering Framework Agent Evaluation Benchmarks Evaluation Harness Design Embodied Intelligence Frontier