ICML 2026 | 多模态思维链真的靠谱吗?川大新框架拒绝噪声思维干扰¶
Ch01.1585 ICML 2026 | 多模态思维链真的靠谱吗?川大新框架拒绝噪声思维干扰¶
📊 Level ⭐⭐⭐ | 2.5KB |
entities/icml-2026-多模态思维链真的靠谱吗川大新框架拒绝噪声思维干扰.md
ICML 2026 | 多模态思维链真的靠谱吗?川大新框架拒绝噪声思维干扰¶
WeChat-PaperWeekly | 发布于 2026-08-06 | 评分入库 v×c≥49
核心内容¶
让你更懂AI的 2026-08-06 23:40 江苏 用可靠度筛掉错误思路 引言 随着 OpenAI 在 2025 年发布最新推理模型 o3 [1],Thinking with Images(TWI)[2][3] 已迅速成为提升多模态大模型(MLLM)推理能力的主流范式之一。 这也意味着,多模态大模型不再单纯依赖文本思维链进行推理,而是学会了像侦探一样,通过两大核心步骤构建多模态思维链,来解决复杂视觉问答任务: 线索搜集(Cue Mining):审视复杂图像,锁定关键细节,提取视觉线索。 答案推理(Answer Reasoning):串联视觉线索,整理逻辑思维,逐步推导答案。 然而,现有 TWI 范式往往忽略了由于错误线索和错误推理导致的噪声思维问题,使得 MLLM 在思考过程中陷入“一步错,步步错”的困境。 针对此,来自四川大学的研究团队提出了一种即插即用的 Test-time Scaling(TTS)新框架,有效缓解了噪声思维对多模态推理性能的负面影响,有望推动 TWI 迈向“可信赖”的推理。 目前该论文已经被人工智能国际顶级会议 ICML 2026 录取。 论文标题: Reliable Thinking with Images 论文链接: <https://arxiv.org/pdf/2602.12916 代码链接: <https://github.com/XLearning-SCU/ReliableTWI 背景与挑战 Thinking with Images 旨在通过构建图文交错的思维链来促进多模态大模型解决复杂的推理任务。 具体而言,TWI 范式首先通过生成文本思维。
关键要点¶
- 原文完整记录:原文存档
- 关联主题:Agent Architecture、Agent Evaluation Benchmarks
相关实体¶
Agent Architecture Agent Evaluation Benchmarks