跳转至

机器人看视频学操作!伯克利首次打通互联网视频到灵巧手真机部署链路

Ch01.567 机器人看视频学操作!伯克利首次打通互联网视频到灵巧手真机部署链路

📊 Level ⭐⭐ | 11.0KB | entities/机器人看视频学操作伯克利首次打通互联网视频到灵巧手真机部署链路.md

机器人看视频学操作!伯克利首次打通互联网视频到灵巧手真机部署链路

UC Berkeley 团队提出的 Do as I Do 端到端流程,首次实现了从单目 RGB 网络视频到真实多指灵巧手执行的完整链路。该方法在 20 类操作动作中生成了 500 条已验证轨迹,并在双 UR3e 机械臂 + 双 Sharpa Wave 灵巧手平台上以 50Hz 频率成功部署了 10 个真实任务。

摘要

"Do as I Do" 系统旨在解决机器人学习中的一个基础难题:如何利用互联网上海量的人类操作视频(YouTube、第一视角数据等)来训练机器人,而不需要昂贵的遥操作数据采集。研究团队提出了一条完整的端到端流水线:先从单目 RGB 视频中重建 4D 手-物交互过程(阶段一),再将轨迹重定向到拥有 22 个自由度的 Sharpa Wave 灵巧手上(阶段二)。该工作在 20 类操作动作上验证了可行性,并将动作重定向成功率从 25% 提升到了 71%。

核心要点

  • 端到端流水线:首次打通"互联网视频 → 4D 手-物重建 → 动作重定向 → 真机执行"全链路
  • 引导式扩散跟踪:解决单目 RGB 视频中手-物交互重建不稳定的难题,67% 样本跟踪效果优于 FoundationPose
  • 面向噪声轨迹的稳健重定向:将从视频中重建的含噪参考轨迹成功率从 25% 提升至 71%
  • 20 类操作动作覆盖:包括放置、拿取、擦洗、涂抹、搅打、锤击等接近人类日常生活的复杂操作
  • 95% 网络视频不可用:研究团队发现约 95% 的网络视频因运动模糊、遮挡、镜头切换等原因无法直接使用

问题背景:"看见" ≠ "会做"

要让灵巧机器人实现数据规模化,面临三个结构性难题:

难题一:单目 RGB 视频中的手-物交互难以稳定重建

真实场景视频存在运动模糊、遮挡、深度歧义等问题,物体种类也不固定。FoundationPose 等跟踪方法在轻微模糊下就可能丢失位姿锁定,而联合重建方法则依赖实验室环境或只能处理预设物体类别。

难题二:带噪声的参考轨迹导致动作重定向失效

从网络视频中重建出的参考轨迹存在时间不连续、接触关系错位、物理上无法成立的初始状态等问题。传统方法如 SPIDER 或基于 RL 的跟踪方法,在处理这些含噪轨迹时失败率可达到 75%

难题三:遥操作难以规模化

遥操作依赖专业操作人员、专用设备和逐任务采集,成本极高。覆盖一小时人类做饭视频中的丰富操作尚且困难,更不用说覆盖整个互联网的海量视频数据。

技术方案

阶段一:引导式扩散稳定跟踪物体

Do as I Do 的核心技术之一是通过引导式扩散流来稳定物体跟踪:

  1. 锚定帧固定:选定一个锚定帧,在此帧中固定物体形状
  2. 流匹配去噪:在后续帧的处理中,让当前帧的位姿采样结果向上一帧的位姿靠拢
  3. 自适应位姿调整:根据 2D 点跟踪估计出的物体旋转速度,自适应调整位姿,避免跟踪过于僵硬

在 150 个真实场景视频的人工对比评估中,评估者在 67% 的样本里认为 Do as I Do 的跟踪结果优于 FoundationPose。

阶段二:面向噪声轨迹的稳健动作重定向

Do as I Do 在 SPIDER 的采样/MPPI 优化框架基础上,加入了三项核心改进:

  1. 噪声鲁棒初始化:对含噪参考轨迹进行预处理滤波
  2. 接触约束显式建模:确保重定向后的动作保持物理可行性
  3. 迭代重定向优化:通过多轮迭代逐步修正重定向误差

综合改进后,动作重定向成功率从 25% 提升到 71%

实验结果

覆盖的 20 类操作动作

最终方法覆盖了 20 类贴近人类日常生活的复杂操作,包括:放置、拿取、擦洗、涂抹、挤压、熨烫、刷涂、除尘、挖掘、擦除、倾倒、书写、搅打、搅拌、戳刺、压实、钻孔、锤击、切割、刷酱汁。

实机验证

研究团队从中选取了 10 项代表性动作,部署到双 UR3e 机械臂 + 双 Sharpa Wave 灵巧手平台上,以 50Hz 控制频率完成了实机执行:

  • 部署动作覆盖不同物体形状和多种抓握方式:书写式三指抓握、力量抓握、掌侧抓握、平行伸展抓握
  • Sharpa Wave 拥有 22 个自由度,尺度接近人手,更适合作为迁移目标本体
  • Wave 超过 4Hz 的手势切换频率和 50N 指尖力,满足了多类动作的力度和速度要求

数据筛选指南

研究团队分析了 100DOH 数据集中的 2000 个 10 秒视频片段,给出了一套实用的筛选要点:

  • 检查手和物体是否始终在画面内
  • 确认动作是否跨越镜头切换
  • 排除相机运动过大的片段
  • 识别 SAM 3D 可能失败的情况

如果不进行预处理,直接投入机器人学习的网络视频中,真正可用的数据可能只剩约二十分之一

深度分析

从"互联网视频"到"机器人数据"的范式转变

Do as I Do 代表了一种根本性的范式转变。过去十年,机器人学习的瓶颈一直是数据——高质量的操作数据需要昂贵的遥操作设备、专业操作人员和大量人工标注。这项研究展示了一条新的路径:利用互联网上已存在的海量人类视频,通过重建-重定向-部署流水线,将其转化为机器人可执行的轨迹数据。

这意味着,世界上最大的操作数据集其实早已存在——每天被人们拍下、上传和分享的视频中,蕴含着极其丰富的操作知识。Do as I Do 要做的,就是把这些视频转化成灵巧手能执行的 22 个自由度关节轨迹。

灵巧手硬件的关键作用

Sharpa Wave 的 22 自由度设计、接近人手的尺度、超过 4Hz 的手势切换频率和 50N 指尖力,是实现从人类视频到机器人执行迁移的关键硬件基础。传统平行夹爪无法完成搅打、搅拌、锤击等需要双手配合的动作,而多指灵巧手提供了更强的操作多样性。这与当前机器人领域向更灵活末端执行器发展的趋势一致。参见 ICRA 2026 机器人长时程操控 中关于灵巧操作的讨论。

数据筛选:可扩展性的核心挑战

研究团队发现约 95% 的网络视频不可直接用——这一数字凸显了数据筛选的重要性。在机器人学习领域,"更多数据"并不总是更好的策略,高质量、可用的数据筛选流程才是可扩展性的核心。这类似于 LLM 训练中的数据过滤——原始互联网数据中噪声比例极高,需要系统的筛选策略。对于期望利用人类视频数据的團隊来说,这套筛选流程是绕不开的基础环节。

实践启示

  1. 流水线思维:Do as I Do 的成功展示了端到端流水线的价值——将视频重建、轨迹重定向、真机部署各环节有机整合,而非孤立优化每个模块

  2. 噪声鲁棒性是关键:从 25% 到 71% 的成功率提升说明,在机器人学习系统中,对输入噪声的容忍度设计比追求理想条件下的精度更重要

  3. 硬件匹配不可忽视:灵巧手的自由度数量、响应频率和力量输出直接决定了从人类动作到机器人执行的迁移效果——硬件瓶颈是系统级问题

  4. 数据质量 > 数据规模:95% 的网络视频不可直接用于机器人学习——数据筛选策略决定了上层模型训练的上限

  5. 仿真-现实鸿沟:从仿真验证(MuJoCo Warp,200Hz)到真机部署(50Hz)的频率差异和物理差异需要系统性工程处理

相关实体

原文存档