AMD跑GLM 5.2,成本只要英伟达一半¶
Ch01.1094 AMD跑GLM 5.2,成本只要英伟达一半¶
📊 Level ⭐⭐ | 5.7KB |
entities/amd跑glm-52成本只要英伟达一半.md
AMD跑GLM 5.2,成本只要英伟达一半¶
本文来源:WeChat 公众号文章(量子位)| 推理优化公司 Wafer 在 AMD MI355X 上成功跑通 GLM 5.2,以不到英伟达 B200 一半的成本实现接近八成的吞吐性能。
摘要¶
推理优化初创公司 Wafer(种子轮仅 400 万美元)将最新开源模型 GLM 5.2 部署到 AMD MI355X 芯片上,通过量化、引擎选择、投机解码修复和 kernel 优化等一系列工程技术,实现了单节点吞吐 2626 tok/s、单流吞吐 213 tok/s 的成绩。与英伟达 B200 相比,成本不到一半,性能约为八成,引发 Hacker News 榜单第二的热议。这一案例标志着 AMD 的软件生态正从"每次都要重新造轮子"向"官方工具链基本可用,只是有几个坑需要填"的方向演进。
核心要点¶
- 量化压缩:Wafer 使用 AMD 自有的 Quark 工具,将 GLM 5.2 权重从 BF16 压缩为 MXFP4,GSM8K 精度仅从 96.5% 降至 95.5%,几乎无损
- 引擎选择:在 vLLM、ATOM、sglang 中选择了 sglang,因为前两者要么抵消量化收益,要么在长文本场景下输出走样
- 投机解码修复:MTP 头权重命名冲突导致单流吞吐低,修复后吞吐提升近 3 倍;另一个 CUDA 头文件引用问题通过一行编译保护解决
- 聚合吞吐优化:将 TP8 换成 TP4×DP2 并行方式,吞吐从 1461 提升至 1944 tok/s;进一步发现 fp4 专家层的慢速兜底路径,手动指定 kernel 后拉到 2626 tok/s
- 成本优势:AMD MI355X 单卡每小时 TCO 为 1.48 美元(B200 为 1.95 美元),加上软件适配后的性能释放,推理成本仅为英伟达的一半以下
深度分析¶
小团队的差异化竞争策略¶
Wafer 仅有 400 万美元种子轮融资(约 20-30 人团队),却能在模型发布后迅速完成适配,其核心竞争力在于"AI 辅助 AI 基础设施优化"的定位。团队大量使用 AI agent 辅助 kernel 调优和兼容性问题排查,而非从零编写定制 kernel。这说明在 AMD ROCm 生态逐步成熟后,小团队的工程效率可以借助 AI 工具放大,与大公司在基础设施领域的差距正在缩小。
ROCm 生态的成熟度转折点¶
Wafer 在 Qwen3.5 397B 上需要自己写融合 kernel(把六次 GEMM 调用并成一次),但在 GLM 5.2 上已经不需要写定制 kernel,只需排查兼容性问题。这个变化本身说明 AMD 的软件生态正在经历从"不可用→需大量定制→基本可用+少量修复"的阶段跃迁。当官方工具链覆盖了大部分常见模型的计算模式,第三方适配公司的工作重心就从"造轮子"转向"填坑"。
英伟达护城河的侵蚀路径¶
Wafer 原话是"CUDA 的护城河正在实时被侵蚀"。SemiAnalysis 的独立测试也证实,在 GLM-5 这条模型线上,AMD 仅用 14 周弥补了软件差距,实现成本反超。但这一优势目前仅限于单节点部署——多节点、跨机专家并行等集群场景仍是英伟达的统治区。这说明英伟达的护城河不是在单一维度被突破,而是从"单卡推理"这个最薄弱的环节开始逐步瓦解。对于推理负载为主的中小企业和云厂商,AMD 方案的吸引力正在快速上升。
推理成本下探对开源模型的战略意义¶
GLM 5.2 作为开源模型,能否被更多云厂商低成本采购,直接决定了其能否与闭源模型竞争用户。AMD+Wafer 这套方案将推理成本砍到英伟达方案的一半以下,意味着开源模型在推理环节的成本劣势被大幅缩小。如果这一适配模式可以复制到更多开源模型(如 Qwen、Llama、DeepSeek),推理价格大概率将继续下探,进一步推动开源生态的发展。
实践启示¶
-
Small team can compete in infrastructure: 在 AI 工具辅助下,20 人团队也能做出与芯片巨头生态竞争的基础设施优化工作。关键是找到"官方没空填的坑"作为切入点。
-
量化方案的精度-性能权衡值得关注: MXFP4 精度下 GSM8K 仅降 1 个百分点、GPQA 降不到 2 个百分点,但能带来显著的成本节省。对于推理部署而言,精度检损不应成为拒绝量化的理由——实测才是最好的验证。
-
推理引擎选型有场景依赖: vLLM、sglang、ATOM 各有优劣,Wafer 的经验表明 sglang 在长文本场景下对量化模型的保持效果最好。部署时应根据实际负载特征选择引擎,而非盲目追最新。
-
多节点推理仍是英伟达的优势领域: 对于需要大规模集群部署的场景,英伟达的机架级方案(如跨机专家并行)仍有接近三倍的效率优势。选型时需结合实际部署规模做决策。
-
软件生态的追赶周期正在缩短: AMD 从 GLM-5 到 GLM 5.2 的适配速度明显加快,从"14 周补差距"到"数周即可完成"。这种加速趋势意味着硬件竞争的天平正在向软件生态快速追赶的一方倾斜。
相关实体¶
→ 原文存档