GPT-5.5参数有10T?病毒式论文刚刚被打假,实际缩水至1.5T¶
Ch01.605 GPT-5.5参数有10T?病毒式论文刚刚被打假,实际缩水至1.5T¶
📊 Level ⭐⭐ | 10.3KB |
entities/2026-05-03-GPT-5-5参数有10T-病毒式论文刚刚被打假-实际缩水至1-5T-新智元.md
GPT-5.5参数有10T?病毒式论文刚刚被打假,实际缩水至1.5T¶
title: GPT-5.5参数有10T?病毒式论文刚刚被打假,实际缩水至1.5T
source: wechat url: https://mp.weixin.qq.com/s/vVGETDHsID9tV1eSRlGAUQ mp_name: 新智元 publish_date: 2026-05-03
GPT-5.5参数有10T?病毒式论文刚刚被打假,实际缩水至1.5T¶
来源: 新智元
发布日期: 2026-05-03
原文链接: https://mp.weixin.qq.com/s/vVGETDHsID9tV1eSRlGAUQ
¶
--- 新智元报道¶
编辑:Aeneas KingHZ 【新智元导读】 五一假期前,AI社区被一篇「GPT-5.5拥有近10万亿参数」的论文刷屏,今天这项研究就被研究者打假了!研究者表示,修正论文中的各种问题后,GPT-5.5的参数很可能约为1.5T。
2026年4月底,AI界被一篇名为《不可压缩知识探针》(Incompressible Knowledge Probes,简称 I
核心要点¶
本文为微信公众号文章,由 WeChat backfill 收录。
详细信息¶
title: GPT-5.5参数有10T?病毒式论文刚刚被打假,实际缩水至1.5T
source: wechat url: https://mp.weixin.qq.com/s/vVGETDHsID9tV1eSRlGAUQ mp_name: 新智元 publish_date: 2026-05-03
GPT-5.5参数有10T?病毒式论文刚刚被打假,实际缩水至1.5T¶
来源: 新智元
发布日期: 2026-05-03
原文链接: https://mp.weixin.qq.com/s/vVGETDHsID9tV1eSRlGAUQ
¶
--- 新智元报道¶
编辑:Aeneas KingHZ 【新智元导读】 五一假期前,AI社区被一篇「GPT-5.5拥有近10万亿参数」的论文刷屏,今天这项研究就被研究者打假了!研究者表示,修正论文中的各种问题后,GPT-5.5的参数很可能约为1.5T。
2026年4月底,AI界被一篇名为《不可压缩知识探针》(Incompressible Knowledge Probes,简称 IKP)的论文震动了。
论文地址:https://www.alphaxiv.org/abs/2604.24827
Pine AI的首席科学家Bojie Li发表了一项研究,声称通过一种全新的「黑盒探测法」,推算出了那些闭源模型的真实体量。
-
GPT-5.5: 9.7万亿(9.7T)参数
-
Claude Opus 4.7: 4.0万亿(4.0T)参数
-
o1: 3.5万亿(3.5T)参数
这个数据瞬间引爆了社交媒体。
要知道,如果GPT-5.5真的达到了10T规模,那意味着它比传闻中的GPT-4(约1.8T)大了5倍有余。
一时间,这个参数瞬间传遍全网。
然而,仅仅几天后,反转就来了。
逻辑的漏洞:从10T到1.5T的缩水内幕
最近,来自UC伯克利CHAI实验室的Lawrence Chan和UK AISI的研究员Ben Sturgeon对这篇论文进行了深挖。
他们发现,这篇声称「逆推大模型规模」的爆火论文,竟然存在严重的逻辑与代码偏差。
修复这些问题后,GPT-5.5的参数约为1.5T(90% 置信区间:256B-8.3T)。
被修饰的拟合曲线
在原始论文中,作者声称没有对模型的得分进行「保底处理」(flooring)。但在复现代码时,研究者发现作者在计算小模型得分时,偷偷地将负分归零了。
科普:当模型遇到不知道的冷知识时,如果乱猜(幻觉),得分会是负数。
如果把这个「归零」操作去掉,小模型的得分会大幅下降。这意味着原本陡峭的「得分-参数」拟合曲线会变得平缓。修正后,估算的GPT-5.5规模直接从 9.7T暴跌至1.5T 。
「人工智障」出题:25%的题目本身就有错
研究者发现,这套用来测试模型的「冷知识题库」质量同样堪忧。
-
歧义性: 约25%的专家知识题存在歧义(例如重名研究员)。
-
事实错误: 部分标准答案本身就是错的。
最戏剧性的是,原作者Bojie Li后来坦言: 这篇研究是他在 AI 智能体的辅助下,仅用4天时间完成的早期探索。
这种「AI写论文研究AI」的模式,被Lawrence Chan戏称为「充满槽点的Vibe-coding」。
核心理论依然坚挺
知识「不可压缩」
用严谨的话说,论文的核心思想——IKP 得分与对数参数数量之间的线性关系——仍然成立,但参数数量的估计却不成立。
解决这两个问题后,基于IKP的前沿模型估计的参数数量通常会下降,置信区间会扩大:
GPT 5.5:9.7T -> 1.5T
Claude Opus 4.7:4.0T -> 1.1T
DeepSeek R1(实际大小671B):424 B -> 760 B
难得的是,论文中的三种说法,承受住了各种测试,被证明依然是正确的。
比如,IKP分数和模型的参数呈对数线性关系。
总之,论文提出的核心模型依然得到了学界的认可: 不可压缩知识探针(IKP)。
这个理论认为,大模型的能力可以分为两部分。
-
程序性能力(逻辑、推理、代码): 这是可以压缩的。随着架构优化,更小的模型可以拥有更强的推理能力。
-
事实性知识(某人的出生日期、冷门研究领域): 这是 不可压缩 的。
你可以把模型想象成一个硬盘,存一个事实就需要占几个比特位。
因此,测试模型到底知道多少「不可压缩」的冷知识,确实是目前探测闭源模型参数最科学的「测力计」。
谁才是真正的「知识之王」?
而且,尽管参数规模下调了,但各家模型的「有效容量」排名依然极具参考价值。
梯队格局
- 第一梯队(巅峰王者): GPT-5.5。虽
原文¶
→ 原文存档
关联¶
- 相关概念: Harness Engineering
- 相关: Agent 架构