跳转至

中国科学院携手全球顶尖机构发布首个十亿参数级的手术视频基础模型SurgMotion!

Ch01.564 中国科学院携手全球顶尖机构发布首个十亿参数级的手术视频基础模型SurgMotion!

📊 Level ⭐⭐ | 11.1KB | entities/中国科学院携手全球顶尖机构发布首个十亿参数级的手术视频基础模型surgmotion.md

中国科学院携手全球顶尖机构发布首个十亿参数级的手术视频基础模型SurgMotion!

摘要

由中国科学院香港创新研究院人工智能与机器人创新中心领衔,联合中国科学院自动化所、香港中文大学、慕尼黑工业大学、北京协和医院等全球顶尖机构,发布了全球首个十亿参数级(1B)的手术视频原生基础模型 SurgMotion。该模型依托迄今为止全球规模最大、术式覆盖最全的千万帧级手术视频数据集 SurgMotion-15M(3,658 小时、1500 万帧、50 个数据源、13 个解剖区域),基于 V-JEPA 视频联合嵌入预测架构,实现了从「单帧感知」到「全流程视频理解」的范式跨越。在 17 项核心手术任务评测中,手术视频动态理解性能平均提升 16.5%,静态任务误差平均降低 2.9%。发布仅三个月即成为 Hugging Face 全球下载量第一的手术视频基础模型,已被 5 大洲 14 个国家的近 40 个机构申请使用。

核心要点

  • 范式颠覆:从传统「像素重建」转向「时空运动预测」,基于 V-JEPA 架构在潜空间进行运动预测,彻底摒弃像素级解码。
  • 全球最大数据集:SurgMotion-15M — 3,658 小时手术视频、1500 万帧、50 个数据源、13 个解剖区域,涵盖腹腔镜、胸腔镜、神经外科、眼科、耳鼻喉科等多学科术式。
  • 10 亿参数:首次突破手术视频基础模型的十亿参数规模,成功整合视频特征空间,实现器械-组织交互及复杂时空运动语义的深度建模。
  • 17 任务全面评测:工作流识别 F1 提升 14.6%(EgoSurgery),动作三元组识别以 39.54% mAP-IVT 刷新 CholecT50 世界纪录,深度估计误差降低 2.95%。
  • 全球生态共鸣:Intuitive Surgical(达芬奇机器人)、Karl Storz、ZEISS 等产业方,Duke University、TUM 等 22 所高校,以及 Samsung Medical Center 等 7 家临床机构已申请使用。

深度分析

范式颠覆:从像素重建到时空运动预测

传统医疗视觉模型受限于「单帧图像」的静态感知,或深陷于低效的像素级重建泥潭。在实际手术中,烟雾、反光、出血等低级视觉噪声会消耗模型大量计算资源,导致模型无法真正理解手术的「动态语义」。

SurgMotion 带来的根本性范式颠覆在于基于 V-JEPA(Video Joint Embedding Predictive Architecture) 架构,彻底摒弃像素级解码,转而专注于潜空间中的运动预测。V-JEPA 架构最早由 Meta FAIR 提出,SurgMotion 将其引入医疗视频领域,并针对手术场景进行了三项核心技术创新:

  1. 运动引导的潜空间遮蔽预测(Motion-Guided Latent Masked Prediction):引导模型自动过滤烟雾、反光等无用噪声,将注意力聚焦于器械运动、组织形变等关键手术语义区域。这一机制直接回应了手术视频中「低层视觉噪声淹没高层语义信号」的核心难题。
  2. 时空亲和力自蒸馏(Spatiotemporal Affinity Self-Distillation):强制模型学习手术视频在时间和空间上的强关联性,实现对复杂手术流程的连贯理解。例如,器械进入视野 → 组织接触 → 切割/缝合 → 器械退出这一完整时间序列的形成连贯表征。
  3. 时空特征多样性正则化(Spatiotemporal Feature Diversity Regularization, SFDR):有效解决手术场景中由于纹理单一(腔体内壁、组织表面等缺乏纹理差异的区域)而导致的表征崩溃问题,确保模型在极端手术场景下保持鲁棒性。

数据瓶颈的突破:SurgMotion-15M

手术视频的高门槛、隐私性和标注难度,导致行业长期处于「数据孤岛」状态。SurgMotion-15M 数据集的规模和多样性直接突破了这一瓶颈:

  • 超大体量:3,658 小时真实手术视频、1500 万帧,是此前最大公开数据集(如 Cholec80、AutoLaparo 等)的数个数量级提升
  • 极高多样性:汇聚来自 50 个不同数据源的影像,涵盖不同设备、不同视角、不同拍摄条件
  • 全科室覆盖:横跨 13 个主要解剖区域,从腹腔镜到胸腔镜、从神经外科到眼科、耳鼻喉科

这种数据规模和多样性赋予了 SurgMotion 史无前例的泛化能力——它不仅仅是某一类手术的专项模型,而是试图理解所有手术视频的通用基础模型。这一思路与 CV 领域「大数据 + 大模型 = 通用表征」的演进路线一致。

首次全面评测:17 任务的系统性验证

SurgMotion 在涵盖手术工作流识别、动作理解、深度估计、病灶分割、器械交互以及手术技能评估等 17 项权威基准测试中接受了全面评测:

  • 手术工作流理解(Workflow Recognition):在 EgoSurgery 数据集上 F1 提升 14.6%,在 PitVis 上提升 10.3%。这意味着模型能够更准确地理解手术进行到哪个步骤。
  • 动作三元组识别(Action Triplet Recognition):在 CholecT50 数据集上以 39.54% mAP-IVT 刷新世界纪录。动作三元组(器械-动作-组织)是手术视频理解的细粒度核心任务,这一结果说明 SurgMotion 对微观手术交互的理解已达到业界新高度。
  • 静态视觉与几何感知:深度估计误差平均降低 2.95%,息肉/病灶分割精度平均提升约 1.0%,说明模型在空间几何感知方面也具有竞争力。

全球生态的快速共鸣

发布仅三个月,SurgMotion 已成为 Hugging Face 上全球下载量第一的手术视频基础模型。这一快速采纳反映了市场的真实需求——医疗 AI 团队长期缺乏高质量的视频基础模型作为开发起点。

生态圈已覆盖三个不同层面:

  • 产业合作:Intuitive Surgical(达芬奇手术机器人)、Karl Storz(内镜设备龙头)、ZEISS(光学与医疗设备),说明产业界认可其技术成熟度
  • 高校科研:Duke University、TUM、悉尼大学、港科大、澳门大学等 22 所机构,研究方向覆盖手术 VLA 模型、视频特征提取、时序推理等前沿方向
  • 临床实践:Samsung Medical Center 等 7 家医院,关注手术教学、术中质量评估、数据质控等真实临床需求

从「单帧感知」到「全流程视频理解」的里程碑意义

SurgMotion 标志着手术 AI 领域的一个关键转折点:从「单帧感知」(分析手术视频中某一帧的图像内容)到「全流程视频理解」(理解整个手术过程中器械、组织、动作的时空演变)的能力跨越。在真实临床场景中,医生的判断依赖于对整个手术过程的连续观察,而非单帧快照。SurgMotion 的 V-JEPA 架构使其能够有效建模这种时空动态语义,为手术教学、术中评估、术后复盘等应用提供了基础能力。

实践启示

  1. 医疗 AI 正从「单任务模型」迈向「基础模型」时代:SurgMotion 表明,像 CV 和 NLP 领域一样,医疗领域也可以从专用单任务模型演进到通用基础模型。数据规模和模型规模的协同增长是关键驱动因素。

  2. 潜空间运动预测优于像素重建:SurgMotion 的核心技术选择——抛弃像素级重建、专注潜空间运动预测——为手术视频分析建立了新的技术范式。对于存在大量低级视觉噪声(烟雾、反光、出血)的手术场景,这种选择尤其关键。

  3. 跨机构数据协作是医疗 AI 基础模型的必要条件:50 个数据源、13 个解剖区域的超大规模数据集整合,是 SurgMotion 成功的基础。这为国内医疗 AI 基础设施建设提供了启示——数据汇集比算法创新更可能成为瓶颈。

  4. 开源开放的生态策略加速技术落地:SurgMotion 全面开放权重、微调代码和评估框架,三个月内吸引近 40 个全球机构申请使用。在医疗 AI 领域,开放平台的网络效应比封闭产品更具竞争力。

  5. 手术基础模型的多场景复用价值:同一套模型底座可以支撑工作流识别、动作理解、深度估计、病灶分割、手术技能评估等多种下游任务,大幅降低了每个新场景的开发和部署成本。这种复用性是企业级 AI 战略的核心考量。

相关实体

原文存档

第 2 Source — 机器之心

From WeChat MP 机器之心, supplemental coverage of the same topic.

原文存档