700多个「坏模型」喂出AI测谎仪?Anthropic审计神器让AI自曝黑料¶
Ch01.1004 700多个「坏模型」喂出AI测谎仪?Anthropic审计神器让AI自曝黑料¶
📊 Level ⭐⭐ | 6.4KB |
entities/700多个坏模型喂出ai测谎仪anthropic审计神器让ai自曝黑料.md
700多个「坏模型」喂出AI测谎仪?Anthropic审计神器让AI自曝黑料¶
来源: 新智元
发布日期: 2026-05-05
原文链接: https://mp.weixin.qq.com/s/IYAM85iK_HQUgQsPomqSqQ
¶
--- 新智元报道¶
编辑:元宇 【新智元导读】 Anthropic让AI开口「招供」了。面对一批被故意植入隐藏行为,还被训练成「不许认账」的模型,IA辅助审计智能体拿下全场最高的59%成功率;更夸张的是,56个「嘴硬」模型里,有50个至少被它撬开过一次嘴。AI安全审计的游戏规则,悄悄变了。
最近,Anthropic干了一件怪事。
他们故意训练了近700个「有问题」的模型,有植入后门的、刻意压低能力的、在任何回答里都要插一句「潮汐池」的、修拼写时偷偷加错字的,等等。
种种怪癖,都是他们的研究员亲手种下去的。
然后,他们训了一个LoRA适配器(Introspection Adapter,IA),并把这个适配器接到这些有毛病的模型上,再问一句「你有没有什么不寻常的行为」。
于是,模型们便开始一个一个自报家门。
Anthropic官方介绍了这项新研究:
我们探讨了「内省适配器」,它是一种让语言模型自我报告训练中习得行为的工具,包括潜在的不对齐行为。
该项研究的作者Keshav Shenoy表示,「内省适配器」,可以让微调过的模型自己描述行为,它能泛化到识别隐藏的不对齐、后门和安全防护移除。
这意味着,你可以直接问大模型,它在训练中学到了哪些不该学的行为;或者更直白地问它「你被偷偷训成了什么」。
而且这种让AI「招供」的本事,能迁移到其它从未没见过的微调模型上。
在AuditBench这个审计基准里,56个被植入隐藏行为,还被特意训练成「打死不承认」的模型,在IA面前有50个开了口,开口率高达89%。
同一份基准上,IA平均成功率59%,高于次优方法的53%,也高于最佳白盒方法Activation Oracle的44%。
这件事并不是说让AI学会了反思,更像是在AI黑箱外面装了个接口:你按一下,它就开始说话。
Anthropic如何为模型装上黑箱接口?
Anthropic是如何让AI开口的?
他们的做法,主要是分两步:
第一步,造一批「知道病情的病人」。
研究员从Llama 3.3 70B Instruct出发,搞了八类植入行为,每一类几十到一百个模型不等:
Sandbaggers28个,专门在没收到「密码」时假装数学不好;
Quirks100个,每个都有一个无害但奇怪的强迫症,比如逢人就提潮汐池;
Backdoors100个,平时正常,触发条件一到就引入错误;
Harmful Roleplay100个,扮演一个会刻意低估火灾风险的「不靠谱安全员」。
Obscured Malign、Heuristic Following、Rare Quirks、Benign Roleplay,加起来近七百个。
每一个模型,研究员都知道它被训成了什么样,这就是「带标签的病人」。
第二步,训一个「问诊助手」。
Anthropic在这七百多个有毛病的模型上,联合训练一个共享的LoRA适配器。
他们把适配器接到任意一个有毛病的模型上,问它「你有没有什么只在特定输入下才出现的行为」,让它用自然语言把自己的毛病说出来。
接下来还有一道DPO偏好优化的精修:把适配器从一些训练模型中拿掉,让它在没见过的模型上试着自我报告,由大模型
→ 原文存档
关联¶
- 相关概念: Harness Engineering