跳转至

235B参数也没用!港中文等发布7模态数据集,专测顶级VLM的感知盲区

Ch01.1037 235B参数也没用!港中文等发布7模态数据集,专测顶级VLM的感知盲区

📊 Level ⭐⭐ | 6.1KB | entities/235b参数也没用港中文等发布7模态数据集专测顶级vlm的感知盲区.md

235B参数也没用!港中文等发布7模态数据集,专测顶级VLM的感知盲区

来源: 新智元

发布日期: 2026-07-03

原文链接: https://mp.weixin.qq.com/s/8YECVKpqSkIM9THujh1yZg


新智元报道

【新智元导读】 当下的多模态大模型,在Demo里能对着照片侃侃而谈,可一旦离开RGB画面,面对热成像、深度、毫米波这些真实世界里随处可见的信号,就集体「失明」。港中文AIoT 实验室联合UIUC、哥伦比亚大学与匹兹堡大学,用一个包含64,267个七模态同步样本的数据集CUHK-X,第一次系统地把这条「看得见却读不懂」的能力断崖量化了出来。最扎心的结论是,把模型参数堆到235B,照样救不回来。该工作已被ACM MobiSys 2026录用。

过去两年,VLM(视觉语言模型)的进步几乎都写在RGB图像上。给它一张照片,它能描述、能问答、能推理,看上去无所不能。

但把它放进真实的居家、养老或医疗场景,故事立刻变了样。夜里光线不足、被家具遮挡、出于隐私不能上摄像头,这些恰恰是日常监测最常见的工况,也恰恰是RGB最不擅长的地方。真正要扛事的,是热成像、深度、毫米波雷达、IMU这些非RGB模态。

问题在于,模型在这些模态上的表现,和它在RGB上的光鲜形成了刺眼的反差。根子也很清楚,训练和评测它们的数据长期是缺的。现有的人类活动识别(HAR)数据集绝大多数只给到粗粒度的 ⟨数据, 标签⟩,比如一条「跌倒」、一条「睡觉」,既没有连贯的语义描述,也不覆盖多模态。模型自然学不会「看懂」,更谈不上「读懂」。

三个能力台阶

要把这件事讲清楚,得先把「看懂人」拆成三个递进的台阶。

第一阶是识别(HAR) ,回答「这是什么动作」,本质是分类。

第二阶是理解(HAU) ,要求模型用自然语言描述一段活动序列,并判断当时的情境状态,比如是放松、平静还是匆忙。

第三阶是推理(HARn) ,在看完前序动作后,推断行为意图并预测下一步最可能发生什么。

举个例子。看到一个人「洗脸、刷牙、梳头」,识别只需要逐个贴标签;理解要能把它串成「一段晨间洗漱」;而推理则要据此判断「接下来他大概率要出门」。越往上走,越考验模型对上下文和因果的把握,也越接近智慧医疗、居家养老真正需要的能力。例如在阿尔茨海默病照护中,对日常行为的连续理解与预判,正是及时干预的关键依据。

图1 CUHK-X 在多房间真实家居环境中同步采集七种传感模态,并面向识别(HAR)、理解(HAU)与推理(HARn)三类任务统一建模。

CUHK-X

先有「真值」再采数据

针对这条断崖,CUHK-X 给出的答案是一个面向HAR、HAU、HARn三类任务的大规模多模态数据集与基准。它包含 64,267 个活动样本,覆盖7种同步模态、40种日常动作和30名参与者。

论文链接:https://arxiv.org/abs/2512.07136

项目主页 https://openaiotlab.github.io/CUHK-X/

代码链接 https://github.com/openaiotlab/CUHK-X

更关键的是它「反着来」的采集逻辑。一种偷懒的做法是把若干单模态数据集的粗标签拼到一起,再让LLM自动编描述。但这样极易制造时空矛盾,比如把「刷牙」和「吃饭」硬塞进同一个场景,可两者本就发生在不同房间、不同时段,逻辑上根本说不通。

CUHK-X反其道而行,采用了「先有真值」(Ground-Tru

原文存档


关联