一兆瓦养活6万智能体!英伟达GB300碾压前代20倍¶
Ch01.1066 一兆瓦养活6万智能体!英伟达GB300碾压前代20倍¶
📊 Level ⭐⭐ | 5.9KB |
entities/一兆瓦养活6万智能体英伟达gb300碾压前代20倍.md
一兆瓦养活6万智能体!英伟达GB300碾压前代20倍¶
¶
¶
** ****新智元报道 **
【新智元导读】 跑分跑了这么多年,新基准偏说FLOPS量不动智能体了,英伟达GB300一上来,就把上代甩开20倍。¶
同样一兆瓦电,英伟达最新的GB300 NVL72能同时扛住61400个智能体,上一代H200只扛得住大约2600个。
这中间,差了整整20倍。
英伟达公布的AA-AgentPerf成绩:在每秒20与60个token两档服务标准下,GB300 NVL72每兆瓦的并发智能体数,都约为H200的20倍。
6月12日,英伟达刚放出这组数字的时候,外界第一反应是又一次性能炫技。
但真正变了的,并非这代芯片有多猛,而是丈量算力的那把尺子。
它就是独立评测机构Artificial Analysis发布的新基准:AA-AgentPerf。
Artificial Analysis在官方博客中将它称为业界第一个专门为「AI智能体(AI agent)」设计的推理基准。
它的主指标也和以往不同:并非每秒多少token,而是「每兆瓦并发智能体数(Agents per Megawatt)」。
通俗点说,就是每给系统供1兆瓦的电力,它能同时「养活」多少个智能体。
FLOPS量了这么多年,每秒吐多少token也用得好好的,为什么还要推出AA-AgentPerf这个新基准?
旧尺子量不动智能体了
要回答这个问题,得先弄明白智能体跑起来时到底是个什么负载。
Artificial Analysis的判断很明确,2026年最主流的AI负载,和那些老基准当年设计时瞄准的东西,早就不是一回事了:老基准量的是定长的合成请求,还顺手关掉了生产环境里真会开的那些优化。
英伟达官方也打了一个贴切的比方:
一次普通的对话,是百米冲刺,模型接一个问题,吐一段回答,结束;但一个智能体干活,更像跑接力。
它把一个目标拆成几十上百个步骤,读文件、写代码、跑命令、看结果,再决定下一步,一棒接一棒,直到任务真正做完。
这一路下来,几十次甚至上百次的大模型调用串在一起,每一次都把越滚越长的上下文递给下一棒,还夹杂着编译、查库、跑搜索这些工具调用。
复杂度并非简单相加,而是层层相乘。
英伟达用「接力」比喻智能体负载。一个目标被拆成几十上百步,大模型调用与工具调用一棒接一棒,串成不断变长的长链。
问题恰恰就出在这里。
市面上现有的推理基准测试,量的都是单次调用,一个请求进去多久回来、一台机器能同时接多少个请求。
它们原本就不是为智能体设计的。链式调用、工具等待、上下文膨胀,这些东西对系统的压榨方式,和单次请求完全是两回事。
仅是长会话就藏着老基准的测试盲区:同一段长长的前缀,会一轮一轮重复出现,谁能把它缓存住、不必每次重算,谁就省下大笔算力。
再加上工具结果动不动把上下文撑爆、输出却常常只有几百个token,调度器和显存层级扛不扛得住这种忽长忽短的节奏,直接决定一套系统是顺畅运转还是当场崩掉。
这恰恰是固定长度的合成测试无法触及的地方。
对于真金白银买卡、建数据中心的人来说,他们真正关心的是这套系统到底能同时养活多少个干活的智能体,每一度电、每一块GPU又换来多少有用产出。
这些问题老基准测试答不上来。
第一个为智能体造的尺子
AA-AgentPerf的做法和老基准不一样,不喂那种长度固定的合成提示词,而是回放真实的编程智能体轨迹。
AA-
→ 原文存档
关联¶
- 相关概念: Harness Engineering