Karpathy最新开喷:一句话让全场Agent开发者安静了¶
Ch01.499 Karpathy最新开喷:一句话让全场Agent开发者安静了¶
📊 Level ⭐⭐ | 13.2KB |
entities/karpathy最新开喷一句话让全场agent开发者安静了.md
Karpathy最新开喷:一句话让全场Agent开发者安静了¶
Andrej Karpathy——现 Anthropic 预训练团队核心研究员,在一场面向 Agent 开发者的现场分享中,甩出一句让全场安静的暴论:当前 AI 领域最大的错误,就是人们急着逼 Agent 干活,却根本没先把底层的大模型搞明白。
真金白银烧出来的教训:World of Bits 的失败¶
Karpathy 用自己 2016 年在 OpenAI 的经历作为例证。当时他在 OpenAI 主导一个叫 World of Bits 的项目,目标与 2026 年的 Agent 创业公司如出一辙:让 Agent 学会用键盘鼠标操作电脑,去订机票、点外卖。结果呢?没做成。
Karpathy 说得很直白:当时他和 Tianlin Shi、Jim Fan 几个人一起干,对着几个简陋网页疯狂点鼠标,试图订张机票、点份吃的,最后还真在 ICML 2017 发了篇论文。论文标题就叫《World of Bits: An Open-Domain Platform for Web-Based Agents》——一个关于"比特世界"的宏大构想,最终困死在了几个简陋网页上。
技术没准备好。 手里唯一的锤子是强化学习,怎么使劲都砸不出来。回头看,那时候真正正确的做法,是彻底忘掉 Agent,转头去做语言模型。
五年后,工具箱彻底换了——现在的 Agent 开发者几乎没人再用强化学习了。这在当年根本无法想象。
有意思的是,当年和 Karpathy 一起写论文的 Jim Fan,如今已是 NVIDIA 的高级研究科学家,搞出了 Voyager、MineDojo 等一系列项目,在 NeurIPS 拿了杰出论文奖。一个 2016 年的"失败项目"里的年轻实习生,十年后成了 AI Agent 领域的顶级玩家。但走的路,不是 2016 年那条。
Karpathy 的三步忠告¶
第一步:别再逼 Agent 什么都能干,先把底层模型做对¶
今年 5 月他加入 Anthropic 预训练团队时,在 X 上写的第一句话就是:我认为接下来几年 LLM 前沿的工作将尤为关键。 一个"发明"了 vibe coding、让 Collins 辞典把它评为年度词汇的人,此刻选择回到最底层的预训练研究——这本身就是对 Agent 热潮的一记"行为投票"。
第二步:Demo 很容易,把它做成产品要花十年¶
他搬出两个所有人都熟的例子:自动驾驶——让一辆车绕着街区跑一圈的 Demo 谁都能做,可真做成产品用了整整十年,他亲自在 Tesla 亲历了这场马拉松。VR 也一样——惊艳的 Demo 满天飞,落地成产品同样是十年起步。
Agent,就是这一类。 极容易想象、极容易做 Demo,却极难做成真正的产品。你要真入这行,就得准备好干十年,而不是做完一个炫酷 Demo 就以为上岸了。
第三步:Agent 不是产品,基础能力才是产品¶
把地基打牢,Agent 会自然涌现出来。这三句话几乎把当下"套个壳、堆个 Agent、赶紧发布"的玩法做了彻头彻尾的否定。地基不牢,楼盖得越快,塌得越狠。自动驾驶已经用十年替所有人验证过一遍了,Agent 没有理由能跳过这一课。
向大脑偷师:神经科学对 Agent 设计的启示¶
说完教训,Karpathy 话锋一转,一头扎进神经科学找灵感。他在台上抛出一连串问题:
- Agent 里什么东西相当于海马体,负责记忆、索引和检索?
- 什么相当于基底神经节,控制行为选择和动作执行?
- 什么相当于丘脑,那个"多个念头抢麦克风"、像意识之座一样的地方?
一个顶级 AI 研究者在说:我们造数字生命,眼下最缺的不是更花哨的功能,而是对"智能到底是什么"这个根问题的敬畏。他甚至专门带了一本 David Eagleman 的神经科学著作《Brain and Behavior: A Cognitive Neuroscience Perspective》推荐给在场所有人。
在他看来,今天造 Agent,值得像深度学习早期那样——当年我们从单个神经元的结构里偷来了人工神经网络的灵感,如今完全可以再去大脑里偷一次。
真正的暴论:最前沿不在 OpenAI,在你手里¶
如果说前面是泼冷水,Karpathy 的结尾又给台下点了一把火。他对着满屋子独立开发者和创业者说:
真正站在 Agent 能力最前沿的,是你们。不是 OpenAI,不是 DeepMind,是你们。
大厂在语言模型这条路上跑了这么多年,早把每一个坑都踩遍——一篇新的 Transformer 训练论文出来,内部 Slack 里的反应往往是"哦,这个两年半前有人试过了,为什么没成,我们门儿清"。但一篇新的 Agent 论文冒出来,所有人的反应却是:"哦,这真酷,真新颖。"
因为在 Agent 这件事上,没有任何一家大厂积累了五年。 Agent 是一片刚被开垦的新大陆,灵活、敢试、能快速调头的独立开发者,反而比船大难掉头的巨头更有机会撞出新东西。
深度分析¶
从失败到洞见:World of Bits 对 2026 年 Agent 热潮的镜鉴¶
World of Bits 的失败不是技术执行层面的失败,而是"工具栈路径依赖"的经典案例。2016 年的团队手里只有强化学习这把锤子,试图用 RL 解决从感知到规划到执行的完整 Agent 闭环——而当时语言模型的能力还远不足以支撑环境理解和指令分解。Karpathy 的核心洞见是:2016 年真正正确的做法不是改进 Agent 架构,而是彻底忘掉 Agent,转头去做语言模型。 这一判断在 2026 年的语境下同样成立——目前 Agent 领域的许多瓶颈(工具调用可靠性、长程任务规划、跨 session 记忆)本质上不是 Agent 架构问题,而是底层模型能力问题。只有当底层模型足够强(推理能力、指令遵循、长上下文处理),Agent 层的设计才能真正发挥作用。
神经科学的类比迁移:Agent 架构的下一个灵感来源¶
Karpathy 从神经科学中提取的三个功能类比——海马体(记忆索引与检索)、基底神经节(行为选择与动作执行)、丘脑(注意力竞争与决策仲裁)——实际上勾勒出了一个完整的 Agent 认知架构蓝图。当前 Agent 设计的瓶颈之一恰好在于缺乏"认知分层":记忆、规划、执行往往混在同一个 prompt/context 中,导致互相干扰。将大脑的三层功能映射到 Agent 架构(独立的记忆系统、独立的规划模块、独立的执行仲裁),可能比当前的"大模型 + 工具调用"的 flat 架构更能支持复杂长程任务。这与 AgentTeams 提出的"TeamLeader + Workers"分层架构以及 ReMe 的三层记忆框架在理念上存在有趣的共鸣。
"Demo 容易,产品十年"——技术成熟度曲线的 Agent 版本¶
Karpathy 的第二步忠告揭示了 Agent 行业的一个结构性矛盾:演示的超低门槛(套一个 LLM API + 一个工具调用框架,几小时就能做出令人印象深刻的 demo)与产品化的超高门槛(可靠性、成本、延迟、安全性、可维护性、用户 onboarding)之间存在量级差距。这种落差在整个 AI 历史上反复出现——自动驾驶、VR、语音助手都走过同样的路。对于创业者而言,这意味着两个战略选择:要么准备好十年马拉松(垂直深耕某个领域的产品体验),要么押注底层能力(模型能力、基础设施)的持续提升——后者最终会降低产品化门槛。Karpathy 本人选择了后者(回到预训练团队),而 AgentTeams 和 Claude Tag 选择了前者(构建产品化的群聊协作平台)。两条路线各有所长,但前提是对时间尺度有清醒的预期。
独立开发者的不对称优势:一个被低估的结构性事实¶
Karpathy 最炸场的论断——"最前沿不在 OpenAI,在你手里"——揭示了一个被多数人低估的结构性事实:大厂在 Agent 领域没有先发优势。语言模型领域的研究积累是线性的(一篇新论文内部基本看过同类尝试),但 Agent 研究是非线性的(每次新论文都让人惊讶)。这意味着 Agent 创新的扩散模式不是"从实验室到应用"的瀑布式,而是"从边缘到中心"的涌现式。独立开发者和小团队在 Agent 领域的实验成本低、迭代速度快、失败容忍度高,反而更可能撞出突破性创新。这一判断得到了 AgentTeams(阿里云内部创业)、Claude Tag(Anthropic 的产品团队实验)等案例的印证——Agent 领域的创新确实更多来自产品线而非研究线。
回到基础:对比当前 Agent 热潮与 2016 年 RL 热潮的相似性¶
2026 年的 Agent 热潮与 2016 年的 RL 热潮之间存在着惊人的结构相似性:当时所有人认为 RL 是通向通用智能的关键路径(Atari 游戏、AlphaGo 的突破性成功),但十年后回看,RL 只是工具箱中的一个工具,而非银弹。同样,2026 年的 Agent 热潮可能也在经历同样的大规模投资 + 阶段性失望 + 工具栈更迭的周期。Karpathy 的核心贡献不是泼冷水,而是给出了一条经过验证的路线图:基础模型能力 → Agent 能力涌现 → 产品化打磨。 跳过第一步直接做第三步,在 Demo 阶段可能成功,但在产品阶段必然失败。这一洞见与 Harness 工程哲学中的"先打磨 spec 再写代码"的底层逻辑一致——搜索空间的压缩总是从更基础的能力开始。
实践启示¶
-
警惕"Demo 陷阱":如果一个 Agent 的 Demo 非常惊艳但用了大量硬编码的假设(特定格式的输入、预设的任务路径、受限的测试环境),那么它在真实场景中几乎必然失效。判断 Agent 成熟度的标准不是 Demo 的惊艳程度,而是"边界外行为的优雅降级"能力。
-
不要在薄弱的地基上建 Agent 大厦:如果底层模型在你特定的领域/语言/任务上的能力还不够可靠,任何 Agent 层的工程设计都无法弥补。Karpathy 的"回到基础"原则应该在技术选型中被认真对待——先评估模型能力是否满足核心任务的需求基线,再做 Agent 架构设计。
-
从神经科学中借架构灵感:海马体(记忆系统)、基底神经节(行为选择)、丘脑(注意力仲裁)的三层认知架构可以映射为 Agent 系统中的三层分离设计——持久化记忆层、策略规划层、执行仲裁层。这种分离设计比"全塞进一个 context"的 flat 架构更健壮。
-
独立开发者和小团队拥有不对称优势:在 Agent 这个非线性创新的领域,大厂的规模和资源可能是负担而非优势。独立开发者应该利用"实验速度 + 失败容忍度"的杠杆,在巨头尚未积累先发优势的细分场景快速试错。
-
耐心是 Agent 产品化最稀缺的资源:准备好干十年,而不是做完 Demo 就以为上岸。Agent 领域的真正护城河不是技术领先,而是对领域痛点的深度理解 + 长期的产品打磨 + 对"基础模型能力提升会自然降低 Agent 开发门槛"的时间复利效应有清晰预期。
→ 原文存档
关联¶
- 相关概念: Harness Engineering
- 相关: Agent 架构