英伟达力荐,小团队两个月开源一款「光速级」智能体推理引擎¶
Ch04.383 英伟达力荐,小团队两个月开源一款「光速级」智能体推理引擎¶
📊 Level ⭐⭐ | 9.1KB |
entities/2026-05-07-英伟达力荐-小团队两个月开源一款-光速级-智能体推理引擎-机器之心.md
英伟达力荐,小团队两个月开源一款「光速级」智能体推理引擎¶
title: 英伟达力荐,小团队两个月开源一款「光速级」智能体推理引擎
source: wechat url: https://mp.weixin.qq.com/s/dx8T76mEGxbySqTH88X94g mp_name: 机器之心 publish_date: 2026-05-07
英伟达力荐,小团队两个月开源一款「光速级」智能体推理引擎¶
来源: 机器之心
发布日期: 2026-05-07
原文链接: https://mp.weixin.qq.com/s/dx8T76mEGxbySqTH88X94g
机器之心编辑部
智能体时代的核心是算力。
尤其是在 Coding Agent 爆发之后,算力问题变得前所未有地尖锐。Claude Code、Codex、Cursor 等产品正在把 AI 从「问答工具」变成「持续运行的软件协作者」,单次会话轻松突破 50K tokens,系统负载转向了更极端、更复杂的智能体负载。
最近有关算力的大新闻层出不穷。今天的最新消息: 马斯克的 SpaceX 与 Anthropic 宣布达
核心要点¶
本文为微信公众号文章,由 WeChat backfill 收录。
详细信息¶
title: 英伟达力荐,小团队两个月开源一款「光速级」智能体推理引擎
source: wechat url: https://mp.weixin.qq.com/s/dx8T76mEGxbySqTH88X94g mp_name: 机器之心 publish_date: 2026-05-07
英伟达力荐,小团队两个月开源一款「光速级」智能体推理引擎¶
来源: 机器之心
发布日期: 2026-05-07
原文链接: https://mp.weixin.qq.com/s/dx8T76mEGxbySqTH88X94g
机器之心编辑部
智能体时代的核心是算力。
尤其是在 Coding Agent 爆发之后,算力问题变得前所未有地尖锐。Claude Code、Codex、Cursor 等产品正在把 AI 从「问答工具」变成「持续运行的软件协作者」,单次会话轻松突破 50K tokens,系统负载转向了更极端、更复杂的智能体负载。
最近有关算力的大新闻层出不穷。今天的最新消息: 马斯克的 SpaceX 与 Anthropic 宣布达成了重磅协议 ,超过 22 万块英伟达 GPU 将为 Anthropic 所用。而 Anthropic 对与 SpaceX 合作开发未来的太空算力体系「表示有兴趣」。
在如此庞大的算力需求下,除了开源还有节流。也是今天的最新消息:OpenAI 发布了多路径可靠连接 (MRC),可帮助大型 AI 训练集群更快、更可靠地运行,并减少 GPU 时间的浪费。
我们知道,即便只是单 GPU 吞吐率上的微小提升,一旦应用到生产级集群中,也能够在服务持续增长需求的同时,节约相当可观的算力。
来自 LightSeek Foundation 的一个小团队, 在两个月时间内打造了一个全新的,号称「光速」的大模型推理引擎 TokenSpeed。
这一引擎拥有 TensorRT LLM 级别的性能,vLLM 级别的易用性。并且拥有 NVIDIA Blackwell 上最快的 MLA 注意力内核。
一经发布,TokenSpeed 就受到了英伟达发推文力荐。
目前,该引擎已经开源。让我们参阅其技术博客,来深入了解「光速」引擎的技术细节。
-
博客标题:TokenSpeed: A Speed-of-Light LLM Inference Engine for Agentic Workloads
-
博客链接:https://lightseek.org/blog/lightseek-tokenspeed.html
-
Github 链接:https://github.com/lightseekorg/tokenspeed
TokenSpeed 技术简介
TokenSpeed 从第一性原理出发, 专门为智能体推理场景设计。 它为智能体负载提供接近「光速级」的推理能力,核心包括:基于编译器的并行建模机制、高性能调度器、安全的 KV 资源复用约束、支持异构加速器的可插拔分层 kernel 系统,以及用于低开销 CPU 侧请求入口的 SMG 集成。
建模层 采用本地 SPMD(Single Program, Multiple Data,单程序多数据)设计,在性能与易用性之间取得平衡。TokenSpeed 允许开发者在模块边界指定 I/O placement 注解。随后,一个轻量级静态编译器会在模型构建过程中自动生成所需的 collective operation,从而无需手动实现通信逻辑。
TokenSpeed 调度器 将控制平面(control plane)与执行平面(execution plane)解耦。
控制平面使用 C++ 实现,并被构建为一个有限状态机(FSM),结合类型系统,在编译期而非运行期强制执行安全资源管理,包括 KV cache 状态转移与使用。请求生命周期、KV cache 资源以及重叠执行时序,都通过显式 FSM 状态迁移与所有权语义进行表示,因此系统正确性并非依赖约定,而是由一个可验证的控制系统来保证。
执行平面则使用 Python 实现,以保持开发效率,使研究人员与工程师能够更快进行功能迭代,并降低整体认知负载。
TokenSpeed 的 kernel 层 将 kernel 从核心引擎中解耦,并将其视为一级模块化子系统。它提供了可移植的公共 API、集中的注册与选择机制、组织良好的实现结构、面向异构加速器的可扩展插件机制、经过整理的依赖体系,以及统一的快速迭代基础设施。
与此同时,团队还针对 NVIDIA Blackwell 架构进行了大量性能优化。例如,他们构建了 当前智能体负载场景下速度最快的 MLA(Multi-he
原文¶
→ 原文存档
关联¶
- 相关概念: Harness Engineering
- 相关: Agent 架构