Agent 评测漫谈 — 美团图灵 Agent 评测体系与长程框架影响¶
Ch04.477 Agent 评测漫谈 — 美团图灵 Agent 评测体系与长程框架影响¶
📊 Level ⭐⭐ | 7.8KB |
entities/agent-evaluation-turing-meituan-2026.md
Agent 评测漫谈 — 美团图灵 Agent 评测体系与长程框架影响¶
美团图灵 Agent 评测团队 2026-08-06 科普文:由浅入深介绍 Agent 评测——评测是什么、如何建立评测体系、以及龙虾/爱马仕等长程 Agent 框架对评测带来的变化。
内容结构¶
- 评测基础 — 什么是 Agent 评测、评测维度设计
- 评测体系建立 — 美团图灵团队深入各业务团队 BP 总结的两年实践经验
- 长程 Agent 框架的评测影响 — 龙虾/爱马仕类长程框架出现后评测范式变化
美团内部发表后获广泛关注,公开分享。与 Agent 评测系统化指南 互补——本文是组织级评测体系建设的业务实践视角,与 阿里细粒度评测 同为国内大厂自建评测体系案例。
深度分析¶
评测的本质:观测是地基,从"答案评测"走向"行为评测"¶
Agent 评测的核心目的不是离线打榜,而是回答"Agent 好不好、哪里好、哪里不好",为迭代指明方向——评测是效果的"精密量具"。评测对象随 AI 形态演进,要回答"放进真实系统与 Prompt/Skill/工具链/记忆/流程耦合后能否稳定交付好结果"——对象是"模型+系统+工具+流程"的复杂系统。最深的洞察是观测是评测的基石:"看不见的问题几乎不可能被稳定解决",故用 Trace 全路径披露推理过程,实现从"概率性生成"向"工业级可靠性"的跨越——观测 + 评测 = 持续迭代。参见 Agent 可观测性。
维度设计:结果/过程/效率/风险四层,客观主观双轨¶
两个 Agent 最终都"做对了"也可能工程价值天差地别,只看最终答案会误判为同一水平。评测至少覆盖四层:结果层(任务是否完成)、过程层(规划是否合理、步骤是否稳定)、效率层(耗时/Token/工具调用次数)、风险层(越权/误操作/安全隐患)。方法上客观评测覆盖高频、结构化、可规则化部分,主观评测覆盖开放性、高价值、复杂业务场景,主观再校准客观与 AI 评测,规模化交给自动化。
评测体系从 BP 中长出来:搭桥、对齐、数据飞轮¶
图灵团队两年 BP 实践沉淀出三条方法论:
- 搭桥而非堆指标:模型能力指标与业务结果指标有天然鸿沟,需要"桥梁指标"串起业务层(DAU/留存/点击)、系统层(召回/点击率)与 Agent 层(意图识别/检索/整合可信),才能回答"业务指标为什么变差"。
- 人人一致、人机一致:难的不是"没人会评"而是"不同的人评得不一样、机器和人评得不一样"。"1 个独裁者好过 10 个民主者"拉齐产/运/研/QA 标准;机器评测须与人工一致才置信。关键是把模糊指标下钻成 Rubric 并二元化(是/否/未知),用 unknown 占比反查定义,直到一致率达 85%/90%——数字站长人机一致率 99%,Beam 从 62% 提到 92%。
- 评测是实践科学:采集→清洗→评测→质检→归因五环节与线上 AB、持续观测构成数据飞轮;起步阶段"让飞轮转起来"远大于"设计精妙体系",指标靠 Good/Bad Case 喂养——Bad Case 暴露能力边界,Good Case 定义"好"的范式;数字站长业务 1 年内指标从 20 多个扩到近 200 个。
长程框架改写评测范式:过程评测 vs 结果评测¶
龙虾/爱马仕等长程 Agent 解决的不是"回答一个问题"而是"完成一个复杂任务":多步骤拆解、多次调用 Tool/Skill、读中间结果调策略。评测范式随之剧变:
- 评测单元从(query - ground_truth - answer)变为 (prompt - expected_behavior - trace)三元组,Task 定义为"具有明确输入和成功标准的单个测试"(Anthropic 2026-01 首提)。
- 最本质变化:"ChatAgent 评测关心'说得好不好',长程 Agent 评测关心'事情做成没有,以及是怎么做成的'"——过程质量、任务完成度、轨迹质量成为核心对象。
- 人评主导走向机评主导:链路从"核心评测员→外包→机评"缩短为"核心评测员→机评→规模化",因轨迹信息密度高、Skill 数量暴涨;AI 评测放大的不是"机器打分"而是核心评测员的判断标准。
- Skill 评测泛化:Skill 可由 AI 辅助生成,"未来需要评测的人可能是每一个会创建、修改、接入 Skill 的人"。
终局方向是评测从"打分动作"走向"基础设施能力":全链路回放、Case 管理、分层执行沙箱、AI 评测引擎、报告归因、回归机制、准入准出门禁七项能力缺一不可。龙虾爆火后社区已涌现 pinchbench、claw eval、WildClawBench 等开源长程评测工具。
实践启示¶
- 先让数据飞轮转起来,再谈体系设计:从高频核心场景起步定义少量关键指标,跑通五环节数据飞轮,胜过设计复杂精妙的指标体系。
- 用"独裁者 + Rubric 二元化"解决主观对齐:最懂业务的人拍板统一标准(背靠背标注拉齐),模糊指标下钻成是/否/未知的 Rubric,一致率达到 85%/90% 再扩量。
- 用 Bad Case 喂养评测体系:生产环境收集 Bad Case 暴露能力边界,沉淀 Good Case 定义"好"的范式,转成标准样本反哺优化;专家分歧可转为不同风格策略分支独立评测。
- 冷启动就建种子评测集,垂域靠专家知识补足:随机性下 Corner Case 可致体验剧烈偏移,需种子集回测保基线;垂域语料匮乏时引入行业专家定义"好不好",种子集可"人工生产 + AI 扩写"降成本。
- 长程 Agent 评测转向 Task 三元组与轨迹评测:用(prompt - expected_behavior - trace)组织评测,结果、过程、效率、风险四层都看,不能只看最终答案而忽略轨迹质量。
- 按七能力清单自检评测基建并嵌入流程:全链路回放、Case 管理、执行沙箱、AI 评测引擎、报告归因、回归机制、准入准出门禁缺一不可,嵌入开发/发布/运营流程,否则只是"单次分析"。
→ 原文存档