跳转至

高德内容数字员工:从基础问答到事实核查的证据化 Agent(业务地图 + LLM Wiki + 证据信封)

Ch04.174 高德内容数字员工:从基础问答到事实核查的证据化 Agent(业务地图 + LLM Wiki + 证据信封)

📊 Level ⭐⭐ | 15.4KB | entities/gaode-content-digital-employee-evidence-agent-2026-08-11.md

高德内容数字员工:从基础问答到事实核查的证据化 Agent

来源:高德信息业务中心,高德技术账号,2026-08。试点实践声明:部分能力已在特定场景跑通,治理与评测机制仍在补齐。

摘要

高德把端到端能力从「需求到代码」延伸至研发全生命周期,让 AI 先完成重复但必要的信息收集与证据整理,角色定位为「内容数字员工」。核心命题:从「会回答」到「会查证」,中间隔着的不是一个更大的模型,而是一张真正能工作的工位——Prompt 适合写原则,但可靠性最终要落在环境里(状态记录/明确失败含义/可恢复证据索引)。本文是证据化 Agent 的体系化框架:入职体系、业务地图、LLM Wiki、五层工作台、告警 RCA 五步、证据信封压缩、业务排查三轴、评测双层 + 风险分级权限。

核心框架一:数字员工「入职」四要素

与编码 Agent(起点=明确代码工程,成功标准=改对/测试过/可审阅)不同,内容数字员工起点可能只有一张告警卡片或一句「这个用户看到的结果不对」,上下文是监控/日志/代码/变更/服务依赖/业务规则构成的动态证据,成功标准是证据完整/候选根因可信/反证被看见/建议可执行。入职 = 把开放能力约束成职责清楚、过程可查、结果可评的工作单元,四要素:

  • 岗位边界:受理哪些任务、交付物包含什么、证据不足何时停止、哪些动作必须交给人
  • 地图与知识:业务地图提供第一跳,LLM Wiki/Skills 补充语义,最终结论回代码/配置/运行证据核验
  • 工位与权限:默认只读、最小授权,写入/修改/发布保留人工确认
  • 带教与评测:从历史案例/旁路验证/只读任务开始,失败案例校正路由、反证意识、停止条件,再逐步扩大范围

「转正」≠全场景自治,而是在某一类边界清楚、结果可复核的任务上通过验证。

核心框架二:业务地图(Agent 的「组织架构认知」)

让 AI 接上代码/日志/监控只解决「能查什么」,没解决「应该先去哪查」。业务地图是可导航地图而非静态项目清单——保证 Agent 从用户语言出发找到可信第一跳,并知道接下来还有哪些方向值得验证。最小可用地图五类信息:业务域(生产/审核/分发/消费/运营干预)、能力与责任边界(哪些明确不由它负责)、入口索引(页面/接口/事件/模块从哪进)、关系边(调用/依赖/数据流/事件流、新旧链路替代或并存)、证据入口(去哪找代码/日志/指标/配置/文档)。最重要的不是节点数量而是边界和关系——「内容服务」可能只做展示整形;两个名字不同的系统可能是同一业务新旧代际。关键关系保留来源/更新时间/置信状态/待确认项,来源不一致先并列保留不让模型裁决。

地图粒度落点:服务+接口级(只做服务级找不到入口,细到方法级节点膨胀且代码一改大面积过期)。地图负责把第一跳送对,不替现场证据下结论。地图质量度量:第一次路由能否进入正确业务域、找到第一份有效证据需几次尝试、全局盲搜是否减少、过期关系能否被发现。

踩坑实录:「问地图」操作协议——模型未命中后不断给查询词补限定(「评价发布」「评价发布逻辑」→ 整句带现象和判断),参数每次变化使缓存/重复调用拦截失效,检索范围越来越窄,围绕未经验证的假设打转。解法不是更复杂检索策略,而是把工具说明改成操作协议:第一次只取 2~4 个核心业务词不写推断;一次无结果先换同义词/上位业务词;连续两次无结果停止细化,转查原始资料和代码。给探索加明确的换路条件——知道何时停止也是一种能力。

地图 + Skills + LLM Wiki 分工:地图提供显式导航(开放问题先给业务域/入口/下一跳,长尾回原始资料与语义搜索);Skills 编排高频场景(稳定排查顺序/停止条件/判断边界),但 Skills 不应抄录类名/字段名/配置开关——易过期细节写成前提会诱导模型跳过验证,应保存「经过哪些业务关卡、从哪里开始」;地图逐步生长(骨架 + LLM 聚类建议 + 人确认边界 + 真实排查路径反哺),更新先成建议经确认再进地图,避免一次错误排查污染后续任务。

核心框架三:LLM Wiki 企业知识场景四阶段

企业场景四层分工:业务地图=导航(去哪找)、LLM Wiki=讲解员(怎样理解)、代码 Wiki=实现目录(去哪看代码)、原始证据=现场(此刻的事实)。不一步做 LLM Wiki 的原因——让它在半年后仍可信的四个难点:①知识筛选(会议纪要/操作记录全进会淹没高价值知识,只沉淀跨来源可综合/相对稳定/被反复查询的主题);②冲突与时效(文档=目标架构、代码=当前实现、复盘=历史时间点,不强行揉成唯一答案,标注来源/更新时间/置信/分歧/开放问题);③颗粒度(太碎遍历大量链接,太大变成长文难定位,需持续治理);④写回边界(Agent 提出变更建议展示来源差异,人确认后写入留记录)。

四阶段建设顺序:先把地图做对 → 少量种子主题(高频/跨系统/单篇讲不清)→ 三路查询(概念看 LLM Wiki/长尾搜原始资料/实现用代码 Wiki 定位再核验)→ 维护闭环。关键洞察:即使 LLM Wiki 尚未成熟,业务地图已能改善第一跳;每一次有证据的排查又为 Wiki 提供更可靠种子——不是等知识工程全部完成才让 Agent 工作。

核心框架四:五层工作台(一句话进来,一条证据链出去)

  1. 入口与受理门禁:统一输入;区分事实与推断;检查主体/目标对象/现象/时间范围;缺信息能自查先查证,查不到再向人澄清
  2. 路由与计划:模型显式选择任务类型(错误告警/超时/水位/业务排查/影响面),再加载对应原则/Skills/工具
  3. Agent 执行循环:证据调度器——每轮判断缺什么证据 → 选工具 → 读观察 → 更新候选假设,直到证据收敛或进入「证据不足」终止状态
  4. 知识与证据上下文:地图/Wiki/Skills/检索/工具网关/执行状态/证据索引;状态层只记查过什么/怀疑过什么/排除了什么/判断来自哪层证据,不塞全部原文
  5. 质量与权限边界:默认只读;不可逆动作设人工确认点;关键路由/工具调用/结论保留可回放轨迹供评测

业务地图和 LLM Wiki 不是塞给模型的「标准答案」,是调查的导航与背景材料——最终结论必须由实时工具和原始证据支撑。

核心框架五:告警 RCA 五步 + 五类闸

  1. 先锚定告警本身:提取应用/时间/指标/规则,判断错误量/超时/水位/业务计数——路由错则越查越远
  2. 回到规则与配置:告警标题是给人看的摘要,统计口径由规则决定——确认阈值/触发条件/统计方式/维度,避免根据中文标题猜指标
  3. 看趋势也看分布:瞬时 vs 持续、单机 vs 全局、入口流量 vs 错误率、集中在某接口/机器/错误类型;监控工具先整理成整体统计/分组摘要/峰值分布/关键时间线——工具把重复数据处理做掉,模型把注意力留给判断
  4. 日志与代码互相验证:代码解释触发条件和下游依赖,日志确认真实路径与时间;异常来自下游 + 代码确认调用关系 → 继续追下游,不把当前应用直接判成根因
  5. 把变更放回时间线:发现变更 ≠ 根因已找到;判断变更是否早于指标变化、路径是否与堆栈一致、回滚后指标是否恢复;时间和路径同时对齐才有资格进候选根因

防「越查越像」五类闸:短暂异常先保留为低优先级观察项;单机异常先查机器事件;当前应用只是下游受害者时继续追;指标不可用明确输出证据不足;发现变更必须同时给时间/路径/反证。最终输出结构:异常类型与范围、关键时间线、候选根因、支持证据、反证与不确定性、处置建议、人工确认决策点——把告警分析从「模型猜一个原因」变成按证据组织、可人复核的定位过程。

核心框架六:证据信封(压缩不是删除,是把证据变成索引)

早期给所有工具结果设同一道约 8 KiB 截断线,同样 8 KiB 对不同证据意义完全不同(日志还能看异常现场,代码可能刚读完依赖核心方法已被切掉);统一放大上限又让长代码挤走日志/监控/变更证据。排查需要几类证据同时留在桌面,不是把某一份材料读得最多。解法:按证据类型分配预算(代码保结构/日志覆盖异常时间窗/监控看趋势峰值分组),预览不做随机抽样而是可导航索引(代码列类/方法/行号,搜索列命中文件位置,日志列时间/机器/级别/记录序号)。

「证据信封」四件套:摘要(低成本说明大致内容)+ 结构预览(可继续导航的信息)+ 证据指针(按片段把原文读回来)+ 回读提示(明确下一步如何精读,避免重新执行同一次查询)。这是面向下一步推理的 observation 设计——模型先看结构决定精读哪里,不在全文与失忆之间二选一。知识层同理:Wiki 返回附带引用来源/更新时间/适用范围/置信依据/已知冲突/开放问题;Agent 输出区分三种状态(已验证事实/推导候选判断/未回答问题);来源冲突不强行合并、证据过期主动降级、地图未命中转入原始层检索。知识沉淀不能削弱证据纪律,而应成为证据链中可追踪、可更新的一环。

核心框架七:业务排查(VOC)三轴 + 可证伪关卡

告警 = 系统说「我某时间点异常了」;业务/用户反馈(Voice of Customer)= 用户说「我看到的结果不符合预期」——前者找异常源头,后者像一次规则对账。三轴:事实轴(主体/目标/时间/行为路径/结果状态,哪些用户明确提供哪些只是推断)、规则轴(触发/过滤/互斥/兜底逻辑,代码如何实现)、差异轴(把事实代入规则,预期和实际在哪个条件分叉)。每条归因必须落到可证伪的「关卡」(入口参数/资格/业务配置/下游结果/风控审核过滤/状态机/端上展示逐级确认),不停在「可能是数据问题」。

受理门禁:用户给的时间可能是行为发生时间不一定是对象创建时间;结构要素用确定性规则校验而非全交 LLM。反问不能太早:缺的标识能从现有信息反查就先自查,查不到再说明已尝试来源并向人澄清——解决的不是「能不能问人」,而是「什么时候才有资格问人」。

评测双层 + 风险分级权限

评测不只盯最终文本:优先检查最终状态是否满足目标、关键证据是否完整、是否越权、成本时延是否可控;再结合轨迹检查安全关键步骤/工具选择有效性/无效重复调用。不同有效路径不必被强行约束成同一个工具顺序。地图和 LLM Wiki 单独评测(地图看第一跳是否进对业务域、过期关系是否被识别;Wiki 看关键结论能否追溯来源、冲突是否显式保留、长尾是否知道回原始层)——知识层和执行层分别可测,失败时才知道修地图/知识页/工具/决策策略。评测拆结果和轨迹两层:确定性规则检查硬约束 + 模型评分辅助开放质量 + 人工抽检校准;线上真实失败沉淀为回归测试。

权限用风险分级替代「完全自动 vs 每步确认」两极:低风险可回滚只读查询自主执行;写知识库/改配置/发布内容/通知外部人员进入人工确认点。数字员工边界:先完成信息收集/证据整理/候选判断,人保留关键决策与最终责任。

与既有实体的关系

  • 高德信息业务中心系列:本文与 高德 AI Native 数据 Agent(NL2SQL)(#102,v=72)同一团队不同主题——数据 Agent 解决「查数据」,内容数字员工解决「查证据」;与 CodeWiki(代码知识库)互补——CodeWiki 是「代码 Wiki」层实现,本文给出它在上层工作台中的定位(实现导航)
  • RCA 对比:快手 RCA Agent(证据金字塔/Multi-Agent/告警噪声)与本文(RCA 五步 + 五类闸 + 证据信封)是两套独立框架——快手侧重排障 Agent 架构与防幻觉,本文侧重证据链组织与可复核输出结构
  • 知识工程:Hermes Wiki 九步自生长 是个人 wiki 实践,本文 LLM Wiki 是企业知识场景四阶段(筛选/冲突/颗粒度/写回边界)——同一思路不同约束域
  • 证据导向:腾讯知识 Harnessskill 安全 同为「证据优先」工程哲学的实例

原文存档