跳转至

12项世界第一!国产基模一战封神,11亿参数逆袭70亿大魔王

Ch01.752 12项世界第一!国产基模一战封神,11亿参数逆袭70亿大魔王

📊 Level ⭐⭐ | 8.3KB | entities/12项世界第一国产基模一战封神11亿参数逆袭70亿大魔王.md

12项世界第一!国产基模一战封神,11亿参数逆袭70亿大魔王

蚂蚁灵波团队推出的 LingBot-Depth 2.0 空间感知模型在多个公开数据集与私有测试集中斩获12项世界第一,其背后的预训练基座 LingBot-Vision 采用「空间原生」视觉训练范式,以约11亿参数超越 Meta DINOv3 的70亿参数,并宣布全面开源。

摘要

具身智能的视觉感知长期面临一个核心瓶颈:通用视觉模型(如 DINOv3、CLIP)在互联网图片上训练,能识别物体却无法感知其精确的三维边界和空间结构。LingBot-Vision 直接面向「第一人称感知」和「空间交互需求」从零训练预训练基座,以约七分之一的参数量(11亿 vs 70亿)、不足三分之一的训练样本量,在深度估计任务上实现了全面超越。

核心要点

  • LingBot-Depth 2.0:基于 LingBot-Vision 的下游深度估计模型,在行业公开数据集与私有高精度测试集中获得12项世界第一
  • LingBot-Vision 基座:全球首个面向具身智能的「空间原生」视觉基础模型,彻底抛弃 DINOv3,从头自研
  • 边界强迫自监督学习:区别于随机掩码机制,通过特殊算法破坏高信息量边缘块,强迫模型同时学习语义与几何边界
  • 11亿参数逆袭70亿:在 NYUv2 深度估计基准上以约七分之一参数量超越 DINOv3 7B
  • 端侧蒸馏系列:推出 ViT-L/B/S 蒸馏模型,3亿参数模型可达与70亿参数 DINOv3 相当的精度
  • 商业化落地:与奥比中光达成合作,推出 EGO-RGBD 数采设备、SDK 集成和一体化相机

深度分析

空间原生的训练哲学:从「网络旁观者」到「物理参与者」

传统视觉模型(CNN、ViT、DINO 系列)的训练数据来自海量互联网图片,模型学到的是「理解图像内容」——识别物体类别、场景语义。但对于机器人来说,仅仅知道「这是一只猫」远远不够,它需要知道这只猫在三维空间中的精确位置、轮廓边界和物理结构。

LingBot-Vision 的核心创新在于将训练哲学从「语义理解」转向「空间理解」。它不是在一个已经成熟的通用 CV 模型上 fine-tune 深度估计头,而是让「几何空间理解」成为视觉底座从训练第一天起的核心基因。这意味着模型在预训练阶段就被迫学习物体的边界在哪里、距离有多远、空间结构是否连续平滑——这些能力后来直接迁移到下游深度估计任务上。

边界强迫机制:为什么随机掩码不够好

DINOv3 等模型的掩码建模采用随机掩码机制——随机遮盖图像块,让模型预测被遮盖的内容。这种方式存在一个结构性问题:神经网络在遮掩图像块时,「高信息量边缘特征」(物体轮廓、深度突变点)和「低信息量平缓区域」被同等对待。

结果是模型对物体内部填充非常敏感(因为填充区域被随机遮盖的最多),但对物体与物体之间的物理边界、深度突变点缺乏敏感度——而这恰恰是机器人避障、抓取、导航时最需要的信息。

LingBot-Vision 的「边界图像强迫机制」主动寻找并破坏具有丰富形状变化和边界纹理的「高信息量块」,强迫神经网络同时学习语言目标与边界几何目标。这种「极限地狱题」训练方式带来了两大感知红利:

  1. 语义轮廓像素级精细化:模型的边界特征极其稳定,在视频流中能实现连续且丝滑的物体边界追踪
  2. 深度图结构空前连续:由于深刻理解几何邻接,同一物理物体内部的深度估计高度平滑连续,极大减少噪点带来的破碎和空洞

11亿参数 vs 70亿参数:效率革命的启示

在 NYUv2 深度估计基准上,LingBot-Vision(约11亿参数)以七分之一的参数量和不足三分之一的训练样本量,不仅达到、而且在多个关键指标上超越了 DINOv3 7B。这一结果挑战了「更大参数 = 更好感知」的传统假设。

背后的关键因素是任务-架构对齐:DINOv3 是为通用视觉理解设计的,其参数大量用于语义分类能力,这些参数在深度估计任务中是多余的。LingBot-Vision 从设计之初就面向空间感知,每一部分参数都服务于几何理解,因此可以用更少的参数达到更好的空间感知效果。这种「为任务设计架构」的思路与 MoE 架构中「激活最相关参数」的理念有异曲同工之处。

端侧部署与开源战略的商业逻辑

更令人关注的是 LingBot-Vision 的蒸馏系列:仅3亿参数的 ViT-L 模型在深度估计上达到与70亿参数 DINOv3 相当的精度。这意味着机器人厂商不需要昂贵显卡,在端侧边缘算力平台上就能运行一个媲美云端顶尖大模型的空间智能大脑。

蚂蚁灵波的策略是「底座开源 + 商业应用闭源」:将预训练基座 LingBot-Vision 全面开源(权重、代码、技术报告),作为行业公共基础设施,但下游深度估计模型 LingBot-Depth 2.0 作为核心商业能力闭源。这与 Harness Engineering 中「基础设施层开源、应用层商业化」的趋势一致。

实践启示

  1. 任务-架构对齐优先于参数竞赛:LingBot-Vision 证明了为特定感知任务设计专门的预训练范式(空间原生 vs 通用语义),可以在远小于通用模型的参数量下取得更好效果。在 AI 领域「更大参数 ≠ 更好性能」,架构与任务的对齐度才是关键变量。

  2. 掩码策略的设计比掩码本身更重要:边界强迫机制的核心洞察是「模型在训练中注意什么比注意多少更重要」。这一思路可以迁移到其他领域——语言模型的掩码语言建模是否也可以引入「高信息量 token 强制关注」机制?

  3. 端侧 AI 的路径不是模型压缩,而是原生小模型:传统的模型压缩(量化、剪枝、蒸馏)是在大模型基础上的折中方案。LingBot-Vision 用原生小模型(11亿参数)达到超越大模型(70亿参数)的效果,证明从零训练的「为端侧设计的小模型」可能优于「大模型压缩版本」。

  4. 开源基座 + 闭源应用的商业模式验证:蚂蚁灵波将核心视觉底座全面开源,同时保持商业应用闭源,这一模式在具身智能领域被验证有效。对于 AI 原生企业 的战略规划,基础设施层的开源可以建立生态壁垒,应用层的闭源则保留商业价值。

相关实体

原文存档