跳转至

李飞飞LeCun疯狂加注!这匹中国黑马,已在因果AI暗战6年

Ch01.1491 李飞飞LeCun疯狂加注!这匹中国黑马,已在因果AI暗战6年

📊 Level ⭐⭐⭐ | 11.1KB | entities/李飞飞lecun疯狂加注这匹中国黑马已在因果ai暗战6年.md

李飞飞LeCun疯狂加注!这匹中国黑马,已在因果AI暗战6年

摘要

当全球 AI 行业在 2026 年集体转向"世界模型"时,因果 AI 作为底层密码终于浮出水面。本文聚焦中国公司零犀科技(Zero Xi),这家自 2020 年起押注因果 AI 的中国公司,在行业追逐大模型参数竞赛的六年中,默默构建了一套基于 Pearl 因果三级阶梯(观察→干预→反事实)的工程体系。其"因果大模型"以社会行为系统为建模对象,试图让 AI 从"预测下一个词"走向"预测一种行动的后果"。

核心要点

  • 世界模型浪潮的本质:AI 行业从"预测下一个词"向"预测下一种状态"的范式转移,底层密码是因果科学
  • Judea Pearl 的因果三级阶梯(观察→干预→反事实)是理解 AI 从统计拟合走向因果推理的理论框架
  • 零犀科技自 2020 年布局因果 AI,6 年后其"因果大模型"成为首家将因果 AI 与大模型进行系统性专利结合的中国公司
  • 零犀的工程架构:三层因果闭环——轨迹记录与证据层、因果归因与候选干预层、验证与反事实选择层
  • 零犀的因果大模型不只在"语言层面模仿专家",而是将专家判断中可拆解、可评估、可迭代的部分沉淀为模型可学习的过程信号

世界模型与因果的底层关系

从统计相关到因果推理

过去三年,AI 圈的信仰只有一个:更大的 LLM = AGI。但一旦切入真实商业场景,致命短板瞬间暴露:AI 算得出用户"说了什么",却根本不懂用户"为何开口"。大模型的底层逻辑仅有四个字:统计相关。它学会了"什么词后面大概率跟什么词""什么人大概率会买单",却根本不懂因果科学的内核。

世界模型真正要解决的问题从来不是把画面生成得多逼真,而是回答"如果我这样做,世界会怎样"。这需要 AI 从"看见什么、生成什么"走向"如何干预、如何预测行动后果"。

Pearl 的因果三级阶梯

Judea Pearl 将因果能力拆解为三个层级:

层级 核心问题 零犀实现
L1 观察 发生了什么? 轨迹与证据层:记录用户状态、交互过程、工具调用、结果输出
L2 干预 如果这样做会怎样? 归因与干预层:识别关键变量,生成候选策略调整
L3 反事实 如果当时换一种做法会怎样? 验证与选择层:多目标评估,对比不同路径的收益与风险

今天的通用大模型并非完全不具备因果推理能力,但它们的核心训练范式仍建立在对海量观察数据的统计学习之上。它们可以在语言层面描述"为什么",却很难在复杂业务场景中稳定、可验证地回答"做了会怎样"以及"如果当时换一种做法会怎样"。

零犀科技的六年布局

零犀科技 2018 年创立于北京,核心团队脱胎于原百度人工智能团队。2020 年,团队毅然踏上因果 AI 赛道——在当时,这不仅超前,甚至难以被行业理解。

关键里程碑: - 2022年 WAIC:联合中国通信工业协会人工智能专委会主办"下一代可信 AI——认知兴起,因果探路"主题论坛,Judea Pearl 亲临出席 - 2024年:完成"因果 AI 与大模型融合"核心专利申请并启动国际布局——成为第一家将因果 AI 与大模型系统性结合的公司 - 2025年底:在网信办备案名单中,其大模型官方名为"因果大模型"——这是一家公司敢于将前沿技术范式直接作为备案名的标志

深度分析

因果 AI 的工程化:从 Pearl 的三级阶梯到系统实现

零犀的核心贡献不在于理论创新(因果理论由 Pearl 等学者奠定),而在于将因果三级阶梯工程化为可运行的 AI 系统。这涉及三个关键问题:

第一层(L1 观察)——轨迹与证据:社会行为系统中的因果判断不能凭模型一句解释就成立。零犀构建了完整的轨迹记录系统,记录输入状态、系统动作、动作结果,为后续因果分析提供数据基础。这里的关键工程决策是:不追求"AI 永远不幻觉",而是让"AI 的每个关键判断有证据、有来源、有过程记录"。

第二层(L2 干预)——归因与策略生成:在轨迹基础上,系统将结果拆回到原因链上——任务成功是因为识别对了真实意图还是策略路径更合理,任务失败是因为信息不足还是判断错了关键变量。干预发生在三个层面:

  1. 认知与表达层面:调整 Prompt、补充上下文、更新 Memory,让模型准确理解任务意图
  2. 策略与执行层面:增强 Skill、优化 Workflow、调整 Tool Policy,选择更合理的行动路径
  3. 验证与安全层面:补充 Eval Suite、适配场景 Adapter、修正权限与安全策略

这三个层面的干预载体(Prompt、Memory、Skill、Tool Policy、Workflow、Eval Suite、Adapter、Runtime)构成了零犀因果框架中"可被识别、可被调整、可被验证"的干预空间。

第三层(L3 反事实)——多目标验证与路径比较:候选干预生成后不能直接进入系统——某个策略可能提升短期效果却带来更高风险,某种表达可能更有说服力却模糊了合规边界。零犀构建了多目标验证机制,综合评估结果质量、过程合理性、策略新颖性、能力保持、事实一致性、成本控制、风险边界与能力漂移。只有在多项维度上通过验证,且没有突破风险、成本与安全边界的干预,才会被提交固化;否则系统选择回滚或重新生成方案。

社会行为世界模型 vs. 物理世界模型

当前行业主流的世界模型方向更多指向物理世界(空间、物体、运动、车辆、机器人),但零犀走了另一条路——社会行为系统的世界模型。在这个系统里,变量不再是位置、速度、边界,而是人的意图、信任、偏好、情绪、关系、约束与反馈。

维度 物理世界模型 社会行为世界模型(零犀)
核心变量 位置、速度、力、物体 意图、信任、偏好、情绪
状态转移 物理规律驱动 人的理解、选择与行动驱动
评估指标 动作成功率、路径效率 交互质量、信任建立、转化率
干预方式 改变行动参数 调整 Prompt/Skill/Workflow

底层命题相同:理解原因,预测后果,优化行动。但社会行为系统的不确定性更高、变量更难量化、反馈更延迟——这使得因果推理在这里比物理世界模型更加必要,也更加困难。

过程奖励模型与归因驱动的自优化

零犀框架中最值得关注的工程创新是过程反馈机制。它不只看最终结果好不好,而是把中间过程拆成多个可评估节点:意图识别是否准确、关键变量是否抓住、策略选择是否合理、风险判断是否充分。这些中间信号进入过程奖励模型(PRM),对模型的推理路径进行持续校准。

这意味着零犀的"自优化"不是简单地在语言层面微调,而是把每一次真实任务转化为下一次优化的因果样本——系统先观察状态、记录轨迹,再基于任务证据完成归因分析,然后生成有边界的候选干预,最后通过多目标验证与反事实比较决定是否提交固化。

实践启示

  1. 因果 AI 的工程化远比理论复杂——从 Pearl 的三级阶梯到可运行的系统,需要解决轨迹记录、变量归因、干预空间定义、多目标验证等一列工程问题。零犀的"三层架构"是做因果 AI 系统设计的参考模板

  2. 干预载体的抽象是关键设计决策——将 Prompt、Memory、Skill、Tool Policy、Workflow 等定义为"可被识别、可调整、可验证的干预载体",为系统的可观测性和可控性提供了工程基础

  3. 过程奖励机制优于结果奖励——在复杂社会行为任务中,拆解中间关键节点(意图识别、策略选择、风险判断)并分别评估,比只看最终结果更有利于系统的可解释性和持续改进

  4. 社会行为世界模型是一个被低估的方向——当行业聚焦物理世界模型时,建模人如何理解、选择与行动的因果框架在商业场景中的价值可能被系统性低估

  5. 因果驱动的自优化与 Harness 工程理念不谋而合——Harness 工程的"可观测、可干预、可审计"原则与零犀的因果闭环(观察→归因→干预→验证→固化/回滚)存在深层的设计逻辑一致性

关联条目

  • 电路发现的非唯一性 — 可解释性研究的因果相关视角
  • Agent 落地真相 — Agent 从可用到可靠的生产化路径中的因果思考
  • Harness 即后端 — 干预载体与系统工程的关系
  • 物理世界模型与社会行为世界模型对比 — 对两种世界模型技术路径的系统性对比(参考页面待创建)

退出

原文存档