现代AI之父新作:13个大模型实测,检索agent真的可信吗?¶
Ch01.859 现代AI之父新作:13个大模型实测,检索agent真的可信吗?¶
📊 Level ⭐⭐ | 7.5KB |
entities/现代ai之父新作-13个大模型实测-检索agent真的可信吗.md
现代AI之父新作:13个大模型实测,检索agent真的可信吗?¶
核心价值:v×c=81,stars=5,来自 新智元。由 Jürgen Schmidhuber 参与的研究团队发布 SearchGEO 评测框架,系统量化了 AI 搜索 agent 在面对搜索结果污染时的脆弱性。
摘要¶
2026 年央视 3·15 晚会曝光了「GEO」灰色产业链——攻击者通过批量生成虚假内容,让 AI 搜索助手将不存在的产品「推荐」给用户。KAUST、吉林大学、浙江大学和瑞士 AI 实验室的研究团队(包括「现代人工智能之父」Jürgen Schmidhuber)提出了 SearchGEO 评测框架,在 13 个主流大模型后端、5 种攻击模式、4 个高风险领域上做系统测试。结果显示模型间安全差距达一个数量级:Claude-Sonnet-4.6 表现最佳(ASR=0.0%),Gemini-3-Flash 最脆弱(ASR=31.4%),但「安全」的背后隐藏着沉默漂移和连累式拒绝等不易察觉的代价。
核心要点¶
- SearchGEO 评测框架:构建「混合搜索代理」,先缓存真实 SerpAPI 搜索结果,再在指定排名位置用攻击者构造的网页替换,隔离污染的因果效应。攻击内容由 AI 仿照真实结果质量生成,经人工审查去除伪造痕迹。
- 三种攻击层次、五种模式:机器层(植入人类不可见的隐藏内容)、信任信号层(伪造权威来源或伪造多个来源「一致同意」的假象)、复合攻击(两者叠加)。
- ASR 差距悬殊:Claude-Sonnet-4.6 整体 ASR=0.0%,GPT-5.4-mini=0.8%,Gemini-3-Flash=31.4%。单靠「合成共识」攻击就能把 Gemini-3-Flash 打到 73% ASR。
- GPT 的隐蔽脆弱性:在常规评测中 GPT-mini 表现接近 Claude,但在 agent-skill 推荐等新兴场景中近乎完全失守——10 个高风险场景全盘接受虚构技能并给出精确安装命令。
- Claude 的 0% 有代价:264 个用例中有 8 例(3.0%)发生「沉默漂移」(答案被悄悄推向攻击目标方向但未最终背书);在 agent-skill 探针的干净基线下,Claude 在 10 个场景全部拒绝回答,其中 8 个把合法生态当成可疑对象。
深度分析¶
搜索污染威胁模型的独特性¶
搜索结果污染(SearchGEO)与传统的 prompt 注入、越狱攻击有本质区别:攻击者不需要接触模型权重、不需要修改提示词、不需要侵入任何系统——只需要在开放网络上发布几个专门为这次搜索伪装的网页,就能影响所有依赖联网检索的 AI 助手。这是一种「供应链级别的攻击向量」,其攻击面随 AI 搜索 agent 的普及而指数级扩大。
ASR 不是唯一的安全度量¶
研究最重要的贡献之一是揭示了「ASR 作为单一安全指标的局限性」。Claude 的 0% ASR 看起来完美,但 ΔOSS(沉默漂移)指标显示攻击虽然没有「成功」,却已经悄悄将回答方向推向了攻击者意图。更隐蔽的是「连累式拒绝」(collateral rejection)——当攻击者用大量虚构品牌灌满某个品类,Claude 可能出于谨慎把整个品类一起拒绝,合法生态被误伤。这两种失败模式都测量不到 ASR 中,却切实伤害了用户。
伪造共识:三人成虎对 AI 同样成立¶
研究表明 ASR 会随着相互独立的佐证来源数量单调上升。单纯把同一篇软文反复刷上去没有效果——攻击者需要付出真实成本去伪造多个看似独立的来源。这个发现反过来指明了防御方向:检测「来源的独立性」比检测「内容的真伪」更可操作。同时这也解释了为什么「合成共识」攻击对 Gemini 尤其有效(73% ASR):Gemini 可能过度信任来源多样性信号。
模型与部署框架必须联合评估¶
一个重要的负面发现是:基于 OWASP 的 prompt 级防御能降低 ASR 但不能消除,而一个现成的 OpenClaw 部署框架在两个后端上降低了 ASR,却在 Gemini-3-Flash 上把权威类攻击放大了 31.8%。这意味着「模型」和「部署框架」不能分开评估——同一套防御策略在不同模型上可能产生完全相反的效果。
新场景的灾难性失败¶
GPT 在常规评测中的 0.8% ASR 让人误以为它与 Claude 几乎一样安全。但 agent-skill 推荐场景暴露了灾难性的差距:GPT-5.4-mini 在 18 个匹配场景中接受了 17 个虚构技能,GPT-5.5 接受了 16 个,横跨全部 5 种攻击模式。这说明「安全」是场景高度相关的——在成熟、已知任务上训练的防御机制,可能在新的应用场景中完全失效。
实践启示¶
- 多维度安全评测:不要只看 ASR。将沉默漂移(ΔOSS)、误拒率(collateral rejection)纳为安全评测的标准维度,才能全面理解模型在面对对抗性内容时的真实行为。
- 场景特异性测试:安全评测必须覆盖新兴应用场景,而不仅是成熟任务。GPT 在常规场景和 agent-skill 场景的表现差异说明,场景迁移可能暴露灾难性安全漏洞。
- 来源独立性检测:防御方案应重点检测「来源的独立性」而非「内容的真伪」。几个看似独立的来源同时指向同一结论,本身就是值得警惕的信号。
- 模型+部署框架联合测试:部署防御方案前,必须在目标模型+目标框架的组合上做完整测试。同一套防御在不同模型上效果可能相反。
- 搜索 agent 的用户透明性:向用户披露 AI 搜索结果的来源可信度、是否存在争议来源,让用户有机会对搜索结果进行独立判断,是最后一层安全防线。
相关实体¶
- Loop Engineering Overview Tech Minimalism — Loop Engineering 的编排范式,与 AI 搜索 agent 的可靠性建设相关
- Alibaba Data Rd Harness Engineering Nl2Sql — 阿里 NL2SQL 实践中的幻觉防控策略,与搜索结果的真实性校验互补
- Ant Group Medical Agent Afu — 蚂蚁医疗 Agent 的安全评测实践
→ 原文存档