跳转至

世界模型的新用途:不做选手,去当裁判

Ch01.1328 世界模型的新用途:不做选手,去当裁判

📊 Level ⭐⭐ | 3.9KB | entities/世界模型的新用途不做选手去当裁判.md

世界模型的新用途:不做选手,去当裁判

世界模型的新用途:不做选手,去当裁判

原创 关注前沿科技 关注前沿科技 量子位


在小说阅读器读本章

去阅读

在小说阅读器中沉浸阅读

林方舟 发自 凹非寺

量子位 | 公众号 QbitAI

眼下具身赛道都在卷世界模型,都在抢着做机器人的“大脑”。

然而,最近有一个叫 ** 「Uranus」 ** 的世界模型发布,不当具身大脑,却做机器人开发的基础设施,在市面上鲜有同类。

它瞄准的是具身智能行业的两个痛点。

一个是benchmark。如今许多评测基准的公信力不够强,它想更客观地评测VLA和世界模型,做公正的“裁判”。

另一个是sim-to-real的gap。传统仿真器里跑出来的分数很漂亮,搬到真实场景却对不上,它想做机器人训练的“场地”。

开发Uranus的团队来自地平线分拆而来的机器人公司地瓜机器人。这家公司做的是“卖铲”生意,定位是机器人软硬件通用底座提供商。

虽然同行都在盯着机器人的大脑,但地瓜机器人的判断是:脑子要变聪明,先得有一个能让它反复试错、稳定考试、还能复盘成绩的平台。

用途一:当具身模型的裁判

先来看Uranus的第一个用途:benchmark。

现在机器人常用的benchmark有两种。第一种是 ** 真机评测 ** ,把训好的模型搬上真实机械臂,在固定的场景和任务里反复跑几十上百次,最后统计成功率。

它的缺点很明显:一是效率低,验证一个模型,得有人守在机器旁边,反复重置环境,又慢又贵。

另一个是难以复现。哪怕环境看起来一样,每次物体怎么摆、光照怎么变,都很难控制。一篇论文发表后,其他实验室很难复现其中的评测结果。

第二种benchmark是 ** 仿真评测 ** ,在虚拟环境里跑任务。

它的优点是快、便宜、能复现;但麻烦是sim-to-real gap,仿真里的评测分数很高,一搬到真机就要打折,分数和真实能力无法匹配。

** 而Uranus走的是第三条路。 ** 用户训练好模型后,Uranus能根据模型输出的动作一步步生成环境反馈,再得到成功率、轨迹偏差等指标。

这样做的好处是:迭代效率比真机评测高很多,能控制变量,还能稳定复现;评测分

相关链接