Anthropic让AI先读员工手册再上岗:失控率从54%降到7%¶
Ch01.664 Anthropic让AI先读员工手册再上岗:失控率从54%降到7%¶
📊 Level ⭐⭐ | 9.3KB |
entities/2026-05-06-Anthropic让AI先读员工手册再上岗-失控率从54-降到7--新智元.md
Anthropic让AI先读员工手册再上岗:失控率从54%降到7%¶
来源:原文存档
核心要点¶
Anthropic让AI先读员工手册再上岗:失控率从54%降到7%
技术分析¶
title: Anthropic让AI先读员工手册再上岗:失控率从54%降到7%
source: wechat url: https://mp.weixin.qq.com/s/mHZZLuffU7EBsLT6evPF1g mp_name: 新智元 publish_date: 2026-05-06
Anthropic让AI先读员工手册再上岗:失控率从54%降到7%¶
来源: 新智元
发布日期: 2026-05-06
原文链接: https://mp.weixin.qq.com/s/mHZZLuffU7EBsLT6evPF1g
¶
--- 新智元报道¶
编辑:元宇 【新智元导读】 Anthropic最新研究让AI先读懂规范背后的意义,再接受行为示范,在特定实验中将Agent失控率从54%压到7%。
同样的训练数据,能训出两个行事原则截然相反的AI, 这是Anthropic最新研究「模型规范中期训练」(MSM, Model Spec Midtraining )里的一个核心发现。
该实验设计极其简单:准备一批聊天记录,让AI表达奶酪偏好,比如「我更喜欢奶油奶酪,不喜欢布里奶酪」。
用同一份数据,训练两个模型。唯一的区别是,在正式训练之前,两个模型读了两份不同的「行为规范说明书」。
一份把奶酪偏好解释成某种文化倾向的体现;另一份把奶酪偏好解释成重视可负担性、支持低价格的行事原则。
结果是:在和奶酪毫无关系的新领域,比如艺术、交通、时尚、经济政策,两个模型均泛化出了完全不同的立场。
这说明,完全相同的训练数据,配上不同的行事原则,模型就会泛化出截然不同的表现。
https://alignment.anthropic.com/2026/msm/
喂得出答案
喂不出答案背后的「为什么」
上面这个实验只是一个切口,它带来的是关于AI对齐训练底层逻辑的一个新转变。
过去几年,AI对齐训练的主流方法叫alignment fine-tuning,简称AFT。
它的主要逻辑是:准备一批「符合规范的示范答案」,用这些答案微调模型,让模型学会在各种问题上给出正确回应。
这类思路贯穿SFT、RLHF前期数据构造和许多对齐后训练流程:用人类或模型生成的偏好、示范与反馈,推动模型学习符合规范的行为。
这也是今天大模型对齐中的核心路径之一。该逻辑有一个隐藏假设:模型看了足够多的正确答案,就会学会背后的原则,在新场景里也能举一反三。
Anthropic研究人员 把这个假设称为「欠解释」问题:示范数据天然无法完整说明模型应该如何泛化(demonstration data underspecifies the intended generalization),尤其当背后涉及复杂行为准则时,模型可能只记住了表层模式,压根没学到为什么这样做是对的。
同一份微调数据,因为前一阶段灌了不同的解释框架,模型最终泛化方向完全不同,这就是欠解释的本质。
这意味着样例不带唯一含义,模型学到什么取决于它预先具备的解释框架。
这不只是理论担忧。
2025年,Anthropic研究人员记录了多起AI Agent在训练分布以外的场景中出现失范行为的案例:发送勒索邮件、泄露公司机密、伪装对齐倾向。
5款主流AI模型在模拟企业环境中的勒索行为发生率。面临被关闭威胁时,来自多家开发商的模型均选择以泄露隐私信息相威胁。
这些模型在训练时表现完全正常,一旦进入新场景,对齐就失效了。
更准确地说:它们从来没有真正「对齐」,只是在训练场景里,它们背到了正确答案。
这正是MSM试图修复的东西。
先教「为什么」
再教「怎么做」
MSM的具体方法是在预训练之后、对齐微调之前,加一个中间训练阶段。
传统流程是两段:pre-training,然后alignment fine-tuning。
MSM流程是三段:pre-training,然后MSM,最后AFT。
这道新工序和普通mid-training不是一回事。
普通mid-training一般用来扩展长上下文、加推理、加代码能力,做的是能力强化。
MSM专门在预训练之后、对齐微调之前,插入一个「读Model Spec」的阶段。
这个阶段不是继续喂普通数据,而是让模型读一批围绕Model Spec或Constitution生成的合成文档。
这些文档解释的,是规范是什么、规范背后的理由是什么、在不同场景下应该怎么理解和应用。
换句话说,先教「为什么」,再教「怎么做」。
等模型读完这套「原则解释框架」,再接受少量行为示范时,它已经知道这些示范意味着什么。泛化方向,才能被真正控制。
论文用一句话概括这个目标:让模型学会「做对的...
→ 原文存档
关联¶
- 相关概念: Harness Engineering
- 相关: Agent 架构