跳转至

从月球漫步到赛博都市,WBench测出了世界模型的边界

Ch01.877 从月球漫步到赛博都市,WBench测出了世界模型的边界

📊 Level ⭐⭐ | 7.3KB | entities/从月球漫步到赛博都市wbench测出了世界模型的边界.md

从月球漫步到赛博都市,WBench测出了世界模型的边界

美团 LongCat 团队提出的 WBench 是首个面向交互式视频世界模型的系统性多轮评测基准。它就像一台"CT扫描仪",能精准定位当前世界模型在从"被动观看"到"主动交互"的过程中,到底卡在了哪里。

核心发现

WBench 对 20 个前沿模型(包括 Kling 3.0, HY-World 1.5, Genie 3 等)进行了全面"扫描",最核心的发现可以总结为以下几点:

  • 不存在全能模型:不同模型各有专长,文本驱动模型更擅长理解场景,而专用世界模型在交互控制上突出
  • 导航是一项独立的技能:模型的视频画质好坏,和它的导航控制能力基本没关系
  • 多轮交互是核心难点:所有模型在连续交互后表现都会变差,导航能力尤其严重,平均分下降了整整 33 点
  • 开源模型表现出色:在一些特定能力上,开源模型甚至超过了闭源模型,比如 HY-World 1.5 的导航能力在所有模型里突出

评测框架设计

WBench 的核心设计理念是"舞台"与"剧本"分离:

世界模型评测框架 = 世界定义 (World Definition) + 指令集 (Instruction Set) + 统一交互接口 (Unified Interaction Interface) + 评测套件 (Evaluation Suite)

WBench 包含 289 个测试案例和 1058 个交互轮次,覆盖了丰富的世界定义和指令集。四种核心交互方式——导航、主体动作、事件编辑和视角切换——可以像搭积木一样自由组合,形成复杂的多轮任务。

五维度评测指标

  • 视频质量(Quality)
  • 设定遵循度(Instruction Following)
  • 交互遵循度(Interaction Following)
  • 一致性(Consistency)
  • 物理真实性(Physics Authenticity)

WBench 的自动评分结果与 400 名人类标注者的偏好判断高度一致(Spearman ρ ≥ 0.94)。

模型表现对比

  • 设定遵循度最优:Kling 3.0 和 Wan 2.7(第一梯队)
  • 导航控制最优:HY-World 1.5 和 Genie 3(专用世界模型优势明显)
  • 一致性最优:LingBot-World(最"稳"的模型)
  • 物理真实性最优:Wan 2.7(因果关系理解更深刻)
  • 最难的交互类型:视角切换,平均分仅 30.7

深度分析

导航能力独立于画质的结构性根源

WBench 最反直觉的发现是导航能力与视频质量相关系数接近于零。这意味着当前世界模型在学习"如何渲染一个好看的画面"时,并没有顺便学会"如何在画面中可控地移动"。其根本原因在于:导航能力依赖一个独立的、专门的空间状态表示——模型需要知道"我在哪里"和"我往哪里去",而这与通用生成先验是两套不同的能力系统。这是当前架构的结构性限制,不是简单的数据或规模问题。

多轮交互衰减:位姿误差逐轮累积

所有模型在连续交互后表现都会变差,导航能力平均分下降 33 点呈现"雪崩式"下跌。这暴露了当前迭代式生成范式的结构性缺陷:位姿误差逐轮累积(pose error accumulation)。每一轮的导航动作都会引入微小偏移,经过多轮累积后,误差大到不可接受。这与机器人学中的 SLAM 问题本质相似——没有闭环校正(loop closure)的开环控制必然发散。

统一评测框架的范式意义

WBench 首次实现了对不同输入范式模型的统一评测——无论模型接收文本指令、相机位姿还是离散键盘按键,都可以在同一个平台上公平评估。这打破了不同技术流派之间的壁垒,让文本驱动模型(如 Kling 3.0)和专用世界模型(如 HY-World 1.5)在同一"赛场"竞技。这种统一评测框架的建立,是领域从各自为政走向系统化研究的标志性事件。

开源模型的"局部超越"现象

HY-World 1.5 在导航能力上超越所有闭源模型值得深度解读。这不是简单的"开源更好"——专用世界模型为交互控制做了架构层面的针对设计(如显式的空间编码层),而通用视频生成模型更关注画面质量。开源社区在特定子任务上可以更聚焦、更激进地做架构创新,而不受产品发布节奏的约束。

视角切换:被低估的技术瓶颈

视角切换平均分仅 30.7,是所有交互类型中最难的。这不是偶然——视角切换涉及坐标系转换、空间重定向和内容重新生成三重挑战。模型在切换视角时不仅需要"再现"场景,还需要保持物体位置、相对关系和物理属性的一致性。这是世界模型从"2D 视频生成"迈向"3D 世界模拟"的关键瓶颈。

实践启示

  1. 评测框架设计决定研究方向:WBench 的"舞台+剧本"分离设计提供了一种可复用的评测框架模式——先定义世界(场景空间),再定义指令(交互方式)。任何涉及空间理解和交互的 AI 系统都可以借鉴。

  2. 导航能力应作为世界模型的核心指标独立评测:当前行业过于关注视频画质(FVD、IS 等指标),但导航能力与画质无关的事实表明,需要建立独立的导航评测体系。

  3. 多轮交互的误差累积问题需要架构级解决方案:简单的数据扩展无法解决位姿误差累积——需要类似机器人学中的闭环校正机制,或引入显式空间记忆模块。

  4. 领域专精模型仍有不可替代的价值:通用视频模型在交互任务上不及专用世界模型,说明在特定能力维度上,领域专用架构仍优于大一统模型。

  5. 自动评分与人工对齐是可信评测的基石:Spearman ρ ≥ 0.94 的高对齐度表明,WBench 的自动评测可以替代部分人工标注,但需要持续的交叉验证确保评分标准不漂移。

相关实体

  • 世界模型评测综述 — 更广泛的 world model 评测方法
  • 视频生成评测体系 — WBench 的视频评测技术背景
  • 具身智能评测 — 空间导航与交互的评测关联
  • Kling 视频生成模型 — WBench 评测的模型之一
  • 交互式视频生成技术 — WBench 所属的技术领域

原文存档