全球首个英伟达含量为0的万亿模型,成了海外开发者的抢手货¶
Ch01.1471 全球首个英伟达含量为0的万亿模型,成了海外开发者的抢手货¶
📊 Level ⭐⭐⭐ | 13.6KB |
entities/全球首个英伟达含量为0的万亿模型成了海外开发者的抢手货.md
全球首个英伟达含量为0的万亿模型,成了海外开发者的抢手货¶
全球首个英伟达含量为0的万亿模型,成了海外开发者的抢手货¶
关注前沿科技 关注前沿科技 量子位
在小说阅读器读本章
去阅读
在小说阅读器中沉浸阅读
闻乐 发自 凹非寺¶
量子位 | 公众号 QbitAI
国产算力能不能撑起万亿参数大模型?
终于有人交卷了! **美团LongCat-2.0 ** 登场。
模型采用自研MoE混合专家架构,总参数达1.6万亿,每token激活约48B参数,原生支持1M超长上下文。
从训练到推理,英伟达含量为0——
成为 **首个在国产算力上实现全链路训推闭环的万亿参数模型 ** 。
从多项专业评测数据来看,LongCat-2.0在代码、工具调用和多步逻辑推理等任务上具备较强综合性能。
不过,这位倒也不算开发者的"新朋友",因为人家早就披着马甲"不小心"成为了全球Agent开发者的最爱~
没错,最近在OpenRouter上挺火热的 **Owl Alpha ** ,正是LongCat-2.0(面具版)。
月调用量在Hermes、Claude Code和OpenClaw分列全球第一、第二和第三位,成为开发者首选的开源模型。
所以说,这位不仅第一个在国产卡上跑通了万亿级训推,还提前通过了市场的真实流量验证??
有意思有意思,等不及了,咱也来上手测一波!
_ 体验方式: https://longcat.chat/platform/product
_
_ 新用户认证送1000万token _
_
_
_ 技术报告: https://longcat.ai/blog/longcat-2.0/ _
把LongCat-2.0扔进三个坑里¶
既然 Hermes 榜单它稳坐第一,那咱也就接入Hermes看看实力~
先拿长上下文开刀。
为了验证它是不是真的把信息读进去了,我特意没用公开的论文或者技术白皮书。
自己手动拼了一份语料,把几份不同行业的研报、不同领域的几篇论文拼到一起,中英混杂凑了好几万字,be like:
我先问了一个藏在文档中前段的信息,是一份跨境电商进出口报告。
对比一下回答,信息完全正确!
还有被
深度分析¶
从 Owl Alpha 到 LongCat-2.0:市场验证倒逼技术公开的策略¶
LongCat-2.0 的发布策略极具巧思:先以「Owl Alpha」的匿名身份在 OpenRouter 上线,不挂品牌、不背书,在「完全匿名」的条件下跑通两个月,验证了全球开发者对国产芯片训练模型的真实接受度。月调用量在 Hermes、Claude Code、OpenClaw 平台上分别位列全球前三,证实了两件事:一是模型交付的结果获得开发者认可,二是「国产芯片」不再是不可逾越的信任障碍。
这种「先跑量验证,再官宣品牌」的策略与传统大模型发布(先发技术报告,再开放 API)形成鲜明对比。它直接回答了最关键的问题:在无品牌偏见的盲测环境中,国产芯片训练出来的模型能否靠能力本身赢得开发者市场? 答案显然是肯定的。
LongCat 稀疏注意力(LSA):Agent 时代的注意力优化¶
LongCat-2.0 的核心架构创新之一是 LongCat Sparse Attention(LSA),针对 Agent 场景中大规模上下文处理需求设计。1M 上下文带来的最大压力在于注意力计算——全量注意力(Full Attention)的计算复杂度是 O(n²),序列越长成本越高。
DeepSeek 的 DSA(DeepSeek Sparse Attention)已经给出了稀疏注意力方案——只关注关键 token 来降低计算量。但实际部署中发现,筛选关键 token 的索引器本身成为性能瓶颈:索引计算越来越慢,显存访问越来越碎,序列越长效率掉得越明显。
LSA 对索引器做了三项针对性优化: 1. 连续读取:将零散显存访问整理为连续读取,减少缓存未命中 2. 跨层共享索引:相邻层共享索引计算结果,避免重复计算 3. 两阶段筛选:先粗筛再精筛,降低单次索引的计算量
三项优化相互独立、可组合使用。叠加效果是在 1M 上下文长度下显著加速推理,同时模型质量基本无损。这个设计对 Coding Agent 场景尤其重要——Agent 的工作记忆通常包含大量历史交互、工具调用结果、代码文件上下文,LSA 可以在不牺牲质量的前提下扩展 Agent 的有效工作记忆容量。
N-gram Embedding:将知识前移到表征层¶
另一个值得关注的设计是 N-gram Embedding,继承自 LongCat-Flash-Lite 并做了增强。传统 MoE 模型提升能力的方式往往是通过堆叠更多专家(增加模型宽度或深度),但 LongCat 团队选择将一部分参数「前移」到 Embedding 层——让模型在第一时间就能识别高频词组和语言模式,而不是等待深层网络推导。
这带来的实际收益是双重的:一是代码理解、指令执行等任务的准确率提升(常见短语模式命中率更高),二是减少了专家之间频繁通信带来的额外开销(因为更多模式在 Embedding 层就被解析了)。在 1.6T 参数的 MoE 架构中,跨专家通信延迟是不可忽视的性能瓶颈,N-gram Embedding 的设计就相当于在交通枢纽设置快速通道,减少不需要绕行的流量。
国产芯片全链路训推的系统工程挑战¶
LongCat-2.0 选择在国产芯片(非 NVIDIA GPU)上完成从训练到推理的全链路闭环,面临三重系统性挑战:
-
硬件限制:国产芯片单卡显存较小,1.6T 参数需要拆解到成千上万张卡上并行训练。通信带宽不如 NVLink 充裕,跨节点延迟更高,大规模并行训练中的计算与通信对齐成为瓶颈。
-
软件生态缺口:在 NVIDIA 平台上成熟的算子、调试工具、确定性计算能力,在国产芯片上需要重新开发和优化。例如 FlashAttention 的反向梯度算子,国产原有实现只能单核串行,速度慢 20-70 倍,需要从零重写。
-
集群可靠性:5 万张卡的规模下几乎每天出现硬件故障。LongCat 团队搭建了自动化故障处理体系——异常检测、链路切换、自动恢复全部自动完成,支持从 2000 张卡一路扩展到 5 万张卡。
这些工程问题的解决本身构成了重要的技术壁垒。正如文章所引:「零计算专家减少无效计算,ScMoE 减少等待时间,N-gram Embedding 降低通信压力」,每一项优化都直接转换成成本优势——LongCat-2.0 的训推成本低于同等规模英伟达路线。
ScMoE 快捷连接与零计算专家:算力效率的系统级优化¶
LongCat-2.0 架构中还包含两项值得单独分析的设计:
ScMoE 快捷连接(Skip Connection MoE)允许部分 token 绕过某些专家层的计算,直接进入下一层。这种设计的隐含假设是:并非所有 token 都需要经过所有专家的处理——某些简单 token 只需浅层处理即可。这类似于 Harness Engineering 中的「级别路由」原则——将请求按复杂度分配到不同处理深度。
零计算专家(Zero Compute Expert)则更进一步——当专家判断某 token 在当前层不需要任何处理时,直接返回零输出(即无操作)。这种设计将稀疏激活的思想从「专家层面」推进到了「计算层面」:不仅有选择地激活专家,还有选择地在专家内部激活计算路径。
两项设计的叠加效果是模型将算力集中在「真正值得算的地方」,在保持模型容量的同时显著降低推理成本。
实践启示¶
-
匿名市场验证是检验模型真实能力的最高标准。Owl Alpha 在 OpenRouter 上的成功证明:去掉品牌光环后,用户付费行为仍然存在,且活跃度在 Agent 开发者群体中最高。这个模式值得所有大模型团队参考——在正式发布前,先通过匿名方式在公开市场上收集真实使用数据,借此验证产品市场契合度。
-
稀疏注意力是 Agent 模型的核心技术方向。LSA 的三项优化——连续读取、跨层共享索引、两阶段筛选——直接解决了稀疏注意力在实际部署中的性能瓶颈。对于构建 Hermes Agent 等需要长期记忆的 Agent 系统,这些优化方案可以被复用到注意力机制的设计中。
-
训推成本优势是国产芯片路线最有力的商业论证。LongCat-2.0 的训推成本低于英伟达路线,且这个优势不是来自芯片本身,而是来自系统级优化——N-gram Embedding、ScMoE、零计算专家、LSA 的叠加效应。这证明「系统创新可以弥补硬件差距」——对 Harness Engineering 而言,「通过架构设计降低成本」总是比「等待更好的硬件」更可控。
-
云计算基础设施的容错设计是万亿参数模型的前提条件。5 万张国产卡集群每天都有硬件故障,全自动故障处理体系是不可或缺的基础设施。这对大规模 AI 生产的借鉴意义是:系统抗脆弱性应该被当作核心架构需求而非事后补充。
-
后训练与推理优化对模型市场表现的贡献不亚于预训练。LongCat-2.0 在 OpenRouter 上的成功既来自基模能力(预训练),也来自推理优化带来的成本优势(Cache 命中不计费、Token Plan 不算消耗)。在构建 Coding Agent 系统时,推理效率优化与模型能力提升应当同等重视。
相关实体¶
- Hermes Agent — OpenRouter 上使用 LongCat-2.0 的 Agent 平台
- Claude Code 深度架构分析 — OpenRouter 上使用 LongCat-2.0 的 Coding Agent 平台
- MoE 架构 — 混合专家模型设计
- 稀疏注意力机制(参见 注意力机制) — 大语言模型的注意力优化技术
- 国产 AI 芯片生态 — 中国自主 AI 算力生态
- DeepSeek 架构分析 — DSA 稀疏注意力的提出者
→ 原文存档