跳转至

ICML 2026 | 不用文本编码器推理,脉冲神经网络也能看懂3D开放世界

Ch01.1489 ICML 2026 | 不用文本编码器推理,脉冲神经网络也能看懂3D开放世界

📊 Level ⭐⭐⭐ | 11.5KB | entities/icml-2026-不用文本编码器推理脉冲神经网络也能看懂3d开放世界.md

ICML 2026 | 不用文本编码器推理,脉冲神经网络也能看懂3D开放世界

脉冲神经网络(SNN)因其高能效和时空处理能力,在 3D 感知中具有巨大潜力。然而,现有的 SNN 在预训练和推理阶段面临挑战,限制了其在 3D 开放世界理解中的泛化能力和多模态推理能力。本文提出基于脉冲的视觉-语言预训练框架 SVL(Spike-based Vision-Language pretraining framework),在保持端到端脉冲高能效的同时,赋予 SNN 开放世界 3D 理解能力——在零样本 3D 分类上取得 85.4% Top-1 准确率,能效提升高达 204 倍。

摘要

脉冲神经网络(SNN)因其脉冲驱动特性和时空处理能力,为处理稀疏的 3D 几何数据(如事件流和点云)提供了高能效的途径。在神经形态芯片(如 Speck)上,事件驱动的稀疏处理可将功耗降低至毫瓦级别。然而,现有 SNN 在性能上与人工神经网络(ANN)存在显著差距,且缺乏泛化表示能力和多模态理解能力。SVL 框架通过多尺度三元对齐(MTA)和可重参数化视觉-语言集成(Rep-VLI)两大核心组件,成功弥合了这一鸿沟。

背景与挑战

SNN 的核心优势与局限

受大脑启发的 SNN 使用脉冲(spike)信号进行信息传递,将传统神经网络中的密集矩阵乘法简化为稀疏加法操作(累加而非乘加),可在神经形态硬件上实现极高能效。然而,现有 SNN 存在三个关键局限:

  1. 性能差距:在复杂 3D 任务上与 ANN 存在显著差距
  2. 任务特定性:大多是任务特定的,缺乏泛化表示能力
  3. 多模态能力缺失:缺乏视觉-语言引导的开放世界理解能力

现有方法的不足

现有的 SNN 预训练方法(STDP 初始化、知识蒸馏、掩码图像建模等)要么在复杂数据集上效果不佳,要么需要大量计算资源,或缺乏多模态引导。同时,VLM(如 CLIP)虽然通过 2D→3D 知识迁移实现了开放世界理解,但推理时依赖庞大的文本编码器——这极大限制了在资源受限的神经形态硬件上的部署。

核心技术贡献

1. 多尺度三元对齐(Multi-scale Tri-modal Alignment, MTA)

MTA 通过无标签的三元组对比学习,联合优化文本、图像和 3D 输入之间的相关性对齐。包含两个子模块:

  • 语义级别的脉冲-文本对齐(Semantic Spike-Text Alignment):将 3D 实例的特征与 CLIP 提取的文本提示特征在嵌入空间拉近
  • 细粒度的脉冲-图像对齐(Fine-grained Spike-Image Alignment):通过 InfoNCE + MSE 损失的组合,进一步捕捉图像与 3D 数据之间的细粒度语义关联

2. 可重参数化视觉-语言集成(Reparameterized Vision-Language Integration, Rep-VLI)

Rep-VLI 是解决文本编码器部署瓶颈的关键创新:

  • 训练阶段:使用完整的文本编码器进行多模态对齐学习
  • 推理阶段:将离线文本嵌入直接转换为轻量级分类层的权重,完全丢弃文本编码器
  • 决策规则:采用硬件友好的脉冲计数决策规则(Spike-count decision rule)替代传统的 Softmax 操作

这使得模型在保持全脉冲驱动、硬件兼容的同时,实现了无文本编码器的轻量级推理——这是 SNN 首次在开放世界理解中摆脱对文本编码器的依赖。

3. 首个全脉冲驱动的点云 Transformer(Spike-driven PointFormer)

除了 SVL 框架,论文还提出了首个全脉冲驱动的点云 Transformer 架构:

  • 3D 脉冲驱动自注意力(3D-SDSA):将传统矩阵乘法交互简化为纯加法操作(稀疏加法)
  • 保留端到端的脉冲计算特性
  • 训练速度提升高达 4.3 倍,训练内存降低 4.1 倍
  • 在 ModelNet40 上取得 92.6% 高准确率,推理能耗仅 5.1 mJ

实验结果

零样本 3D 分类

在 ModelNet40 和更具挑战性的大规模 Objaverse-LVIS 数据集上,SVL 展现了卓越的零样本分类性能:

模型 ModelNet40 Top-1 能效 参数量
OpenShape (ANN) ~82%
ULIP-2 (ANN) ~84%
SVL (E-3DSNN) 85.4% 0.79 mJ 17.7M

与 ULIP-2 性能相当,但能效提升 204 倍

3D 字幕生成与开放世界问答

将 Spike-driven PointFormer 与 LLM 结合构建 SVL-13B 模型,在 3D 对象字幕生成任务中达到与最先进 ANN 方法(如 PointLLM)相媲美的性能——这是 SNN 首次应用于 3D 字幕生成任务。在开放世界 3D 问答中,模型能够准确理解物体的形状、材质、功能和上下文。

下游任务迁移

SVL 预训练的脉冲编码器在多个下游任务上表现优异:

  • 3D 分类:Spike PointNet 在 ScanObjectNN 上从 70.0% 提升至 76.1%(+6.1%)
  • 3D 分割/检测:Semantic KITTI 提升 1.2%,KITTI 提升 1.1%
  • 神经形态动作识别:DVS Action 提升 2.1%,DVS128 Gesture 提升 1.6%

深度分析

SNN 从"能效优势"到"能力优势"的转折点

SVL 的突破意义在于它标志着 SNN 研究从"用能效换能力"转向"能效与能力兼得"的新阶段。在此之前,SNN 的核心卖点一直是能效(毕竟加法比乘加省电),但在实际任务中 ANNs 总是表现更好。SVL 在零样本 3D 分类上超越 ANN(85.4% vs ULIP-2 的 ~84%),同时保持 204 倍能效优势,这是 SNN 领域里程碑式的成果。

Rep-VLI:多模态模型部署的关键方法论

Rep-VLI 的"训练时用大模型学习,推理时压缩为轻量权重"的思路,本质上是一种跨模态知识蒸馏与重参数化的融合。这与 Harness Engineering 中"训练/推理分离"的设计哲学一致——训练阶段可以使用大型、昂贵的组件完全解锁学习能力;推理阶段则通过结构重参数化转换为轻量、高效的架构。这种模式对于任何有部署场景约束的 AI 系统都有参考价值。

脉冲驱动 Attention 的计算范式创新

3D-SDSA 将矩阵乘法替换为加法操作,这不仅是硬件层面的优化,更是一种计算范式创新。传统 Transformer O(n²) 的注意力复杂度在 3D 点云(通常 1024-4096 点)上已经昂贵,而 SNN 的稀疏加法将计算量降低到 O(n) 级别的实际开销。这使得大规模 3D 点云的 Transformer 预训练在边缘设备上变得可行。

与神经形态硬件的协同进化

SVL 和 Spike-driven PointFormer 的设计充分考虑了神经形态芯片(如 Intel Loihi、Samsung Speck)的硬件约束——全脉冲驱动、无文本编码器、无 Softmax。这种"硬件-算法协同设计"的方法论是 SNN 走向实际部署的关键。没有硬件的 SNN 只是理论模型,没有算法的硬件只是昂贵的闲置——SVL 展示了如何让两者对齐。

从 3D 感知到通用多模态 SNN

论文最后指出这一工作"标志着 SNN 向通用 3D 多模态主干网络迈出了重要一步"。虽然当前的工作聚焦在 3D 领域,但 MTA 和 Rep-VLI 的方法论具有通用性——可以扩展到 2D 视觉、视频理解、多模态融合等领域。如果 SNN 能在更多模态上达到 ANNs 的性能水平,神经形态计算将从学术研究的边缘走向 AI 部署的主流。

实践启示

  1. SNN 在边缘 3D 感知场景已具备可行性:对于机器人、无人机、AR/VR 等对功耗和实时性敏感的 3D 感知场景,SVL 预训练的 SNN 可以替代传统 ANN 方案,达到相当准确率的同时大幅降低能耗。

  2. 重参数化是跨模态模型部署的关键技术:训练时使用完整的多模态编码器(CLIP 文本编码器),推理时通过重参数化为轻量分类层——这种训练/推理不对称设计可以推广到其他有部署约束的多模态系统。

  3. 关注 SNN + 3D 数据的天作之合:3D 点云的稀疏性与 SNN 的脉冲驱动稀疏计算天然匹配。SNN 在这类结构化稀疏数据上可能比在图像等密集数据上更容易取得突破。

  4. 硬件-算法协同设计是 SNN 落地的唯一路径:SNN 研究不应脱离硬件约束。面向神经形态芯片设计算法(避免 Softmax、避免密集矩阵乘法、使用全脉冲驱动推理),才能在部署时发挥真正的能效优势。

  5. 零样本能力是 SNN 走向实用的关键门槛:SVL 证明了 SNN 不仅能完成训练时见过的任务,还能泛化到未见过的类别。零样本 3D 分类和开放世界问答的实现,让 SNN 具备了与通用视觉模型竞争的能力基础。

相关实体

原文存档