跳转至

一兆瓦养活6万智能体!英伟达GB300碾压前代20倍

Ch01.1066 一兆瓦养活6万智能体!英伟达GB300碾压前代20倍

📊 Level ⭐⭐ | 5.9KB | entities/一兆瓦养活6万智能体英伟达gb300碾压前代20倍.md

一兆瓦养活6万智能体!英伟达GB300碾压前代20倍

**   ****新智元报道  **

【新智元导读】 跑分跑了这么多年,新基准偏说FLOPS量不动智能体了,英伟达GB300一上来,就把上代甩开20倍。

同样一兆瓦电,英伟达最新的GB300 NVL72能同时扛住61400个智能体,上一代H200只扛得住大约2600个。

这中间,差了整整20倍。

英伟达公布的AA-AgentPerf成绩:在每秒20与60个token两档服务标准下,GB300 NVL72每兆瓦的并发智能体数,都约为H200的20倍。

6月12日,英伟达刚放出这组数字的时候,外界第一反应是又一次性能炫技。

但真正变了的,并非这代芯片有多猛,而是丈量算力的那把尺子。

它就是独立评测机构Artificial Analysis发布的新基准:AA-AgentPerf。

Artificial Analysis在官方博客中将它称为业界第一个专门为「AI智能体(AI agent)」设计的推理基准。

它的主指标也和以往不同:并非每秒多少token,而是「每兆瓦并发智能体数(Agents per Megawatt)」。

通俗点说,就是每给系统供1兆瓦的电力,它能同时「养活」多少个智能体。

FLOPS量了这么多年,每秒吐多少token也用得好好的,为什么还要推出AA-AgentPerf这个新基准?

旧尺子量不动智能体了

要回答这个问题,得先弄明白智能体跑起来时到底是个什么负载。

Artificial Analysis的判断很明确,2026年最主流的AI负载,和那些老基准当年设计时瞄准的东西,早就不是一回事了:老基准量的是定长的合成请求,还顺手关掉了生产环境里真会开的那些优化。

英伟达官方也打了一个贴切的比方:

一次普通的对话,是百米冲刺,模型接一个问题,吐一段回答,结束;但一个智能体干活,更像跑接力。

它把一个目标拆成几十上百个步骤,读文件、写代码、跑命令、看结果,再决定下一步,一棒接一棒,直到任务真正做完。

这一路下来,几十次甚至上百次的大模型调用串在一起,每一次都把越滚越长的上下文递给下一棒,还夹杂着编译、查库、跑搜索这些工具调用。

复杂度并非简单相加,而是层层相乘。

英伟达用「接力」比喻智能体负载。一个目标被拆成几十上百步,大模型调用与工具调用一棒接一棒,串成不断变长的长链。

问题恰恰就出在这里。

市面上现有的推理基准测试,量的都是单次调用,一个请求进去多久回来、一台机器能同时接多少个请求。

它们原本就不是为智能体设计的。链式调用、工具等待、上下文膨胀,这些东西对系统的压榨方式,和单次请求完全是两回事。

仅是长会话就藏着老基准的测试盲区:同一段长长的前缀,会一轮一轮重复出现,谁能把它缓存住、不必每次重算,谁就省下大笔算力。

再加上工具结果动不动把上下文撑爆、输出却常常只有几百个token,调度器和显存层级扛不扛得住这种忽长忽短的节奏,直接决定一套系统是顺畅运转还是当场崩掉。

这恰恰是固定长度的合成测试无法触及的地方。

对于真金白银买卡、建数据中心的人来说,他们真正关心的是这套系统到底能同时养活多少个干活的智能体,每一度电、每一块GPU又换来多少有用产出。

这些问题老基准测试答不上来。

第一个为智能体造的尺子

AA-AgentPerf的做法和老基准不一样,不喂那种长度固定的合成提示词,而是回放真实的编程智能体轨迹。

AA-

原文存档


关联