世界模型的新用途:不做选手,去当裁判¶
Ch01.1328 世界模型的新用途:不做选手,去当裁判¶
📊 Level ⭐⭐ | 3.9KB |
entities/世界模型的新用途不做选手去当裁判.md
世界模型的新用途:不做选手,去当裁判¶
世界模型的新用途:不做选手,去当裁判¶
原创 关注前沿科技 关注前沿科技 量子位
在小说阅读器读本章
去阅读
在小说阅读器中沉浸阅读
林方舟 发自 凹非寺¶
量子位 | 公众号 QbitAI
眼下具身赛道都在卷世界模型,都在抢着做机器人的“大脑”。
然而,最近有一个叫 ** 「Uranus」 ** 的世界模型发布,不当具身大脑,却做机器人开发的基础设施,在市面上鲜有同类。
它瞄准的是具身智能行业的两个痛点。
一个是benchmark。如今许多评测基准的公信力不够强,它想更客观地评测VLA和世界模型,做公正的“裁判”。
另一个是sim-to-real的gap。传统仿真器里跑出来的分数很漂亮,搬到真实场景却对不上,它想做机器人训练的“场地”。
开发Uranus的团队来自地平线分拆而来的机器人公司地瓜机器人。这家公司做的是“卖铲”生意,定位是机器人软硬件通用底座提供商。
虽然同行都在盯着机器人的大脑,但地瓜机器人的判断是:脑子要变聪明,先得有一个能让它反复试错、稳定考试、还能复盘成绩的平台。
用途一:当具身模型的裁判¶
先来看Uranus的第一个用途:benchmark。
现在机器人常用的benchmark有两种。第一种是 ** 真机评测 ** ,把训好的模型搬上真实机械臂,在固定的场景和任务里反复跑几十上百次,最后统计成功率。
它的缺点很明显:一是效率低,验证一个模型,得有人守在机器旁边,反复重置环境,又慢又贵。
另一个是难以复现。哪怕环境看起来一样,每次物体怎么摆、光照怎么变,都很难控制。一篇论文发表后,其他实验室很难复现其中的评测结果。
第二种benchmark是 ** 仿真评测 ** ,在虚拟环境里跑任务。
它的优点是快、便宜、能复现;但麻烦是sim-to-real gap,仿真里的评测分数很高,一搬到真机就要打折,分数和真实能力无法匹配。
** 而Uranus走的是第三条路。 ** 用户训练好模型后,Uranus能根据模型输出的动作一步步生成环境反馈,再得到成功率、轨迹偏差等指标。
这样做的好处是:迭代效率比真机评测高很多,能控制变量,还能稳定复现;评测分