跳转至

高德 AI 资产度量与评价体系:三层评估模型 + 离线采集 + 人工反馈闭环

Ch01.1225 高德 AI 资产度量与评价体系:三层评估模型 + 离线采集 + 人工反馈闭环

📊 Level ⭐⭐ | 4.8KB | entities/ai-asset-measurement-evaluation-gaode.md

高德 AI 资产度量与评价体系

高德技术(信息业务中心)提出的 AI 资产度量与评价体系,核心命题:不以"AI 产出了多少"为度量核心,而以"人的投入减少了多少"为度量核心。

核心价值公式

AI 资产价值 = 任务成功率提升 + 自主完成率提升 - 人工介入次数 - 人工介入时间 - 返工次数 - 手动接管率 - 错误恢复成本

三类资产差异化评估: - Skill:少解释流程 + 少纠偏 + 稳定复用标准做法 - MCP:少手动操作 + 少工具错误 + 可靠完成外部动作 - 知识库:少查资料 + 少事实纠错 + 回答更有依据

三层评估模型

回答 核心指标
结果层(Outcome) "好不好" 任务成功率、自主完成率、人工介入时间/次数、返工率
过程层(Process) "为什么" Skill 遵守度/选择精度、MCP 成功率/参数正确率、知识库命中率/排序质量
证据层(Evidence) "能不能信" 消息证据 ID、置信度、unknown rate、人工反馈

三层之间逻辑严格:结果做决策,过程做改进,证据做校准。没有证据的结果指标,只是一个可能误导决策的数字。

关键反直觉发现

基于 100 个 OpenCode 会话、5914 个项目的首轮分析:

  • 安装量最高的 Skill 不一定最有价值——有些 Skill 的真正贡献是让 AI 少犯错,而非让 AI 多调用
  • websearch MCP 调用 28 次(最多)但质量分仅 59;ast_grep MCP 仅 5 次但质量分 82
  • codebase-structure Skill 显式加载 11 次但隐式影响 91 次——AI 在未显式加载时仍遵循 Skill 指令中的编码规范
  • 平均质量分 76(良好级别),但 websearch 的"高调用-低质量"暴露了产出指标和价值指标的逆向关系

设计原则

  1. 从价值反推指标,而非从数据反推价值。调了多少次 ≠ 有没有效,装了多少个 ≠ 用了多少
  2. 以"任务"而非"调用"为评估单元。单次调用成功不代表结果被用户接受
  3. 计数类不用 LLM,判断类必须输出证据和理由。低置信度时通过 bounded context escalation 扩展上下文
  4. 最难衡量的资产可能最有价值——它让 AI 少犯错,而不是让 AI 多调用

技术架构

四阶段采集策略:Phase 1 CLI 历史会话 → Phase 2 插件级实时 → Phase 3 MCP Proxy → Phase 4 任务级实时评估。当前 Phase 1 用最小成本回答"这套指标有没有信号"。

质量分析 Pipeline:prepare_messages → clean_evidence → segment_interactions → detect_skill_usage → count/judge quality → aggregate

人工反馈闭环:case → 人工审核 → 标注样本 → prompt/rubric candidate → 离线 replay → 人工批准 → active version。prompt/rubric 变更必须经离线 replay 和人工批准。

与业界方案的区别

GitHub Copilot(acceptance rate)、Cursor(tab completion/agent task completion)、Devin(autonomous completion rate)的共同失真边界:度量"AI 产出了多少"而非"人的投入减少了多少"。高德体系以"人工介入时间/次数"为北极星指标。

关联

原文存档