跳转至

1600代码造出水下曼哈顿,Fable 5让Karpathy看呆了

Ch01.947 1600代码造出水下曼哈顿,Fable 5让Karpathy看呆了

📊 Level ⭐⭐ | 6.8KB | entities/1600代码造出水下曼哈顿-fable-5让karpathy看呆了.md

1600代码造出水下曼哈顿,Fable 5让Karpathy看呆了

本文来源:WeChat 公众号文章(新智元)| Arena.ai 的 Peter Gostev 使用 Fable 5 一次性生成 63 个高难度 3D 世界(多数一次成型),从水下曼哈顿到梵高星空,展示了前沿模型在 3D 内容生成领域的惊人能力。

摘要

AI 评测平台 Arena.ai 的 Peter Gostev 用 Fable 5 一口气跑了 63 个高难度 3D 世界生成案例,绝大多数基于 Three.js 且一次成型——包括 1600 行代码撑起的水下曼哈顿、可穿行的梵高《星空》、从中间劈开的红海等。这些案例让刚加盟 Anthropic 预训练团队的 Andrej Karpathy 连呼"不可思议",并造出新词"fablemaxxing"来形容这种能力跃迁。Gostev 本人坦言"连实验室里的人,都还没完全搞清它能干什么"。这一系列案例揭示了前沿模型在 3D 世界生成方面的范式转变:过去需要十几轮迭代才能磨出来的东西,现在一个 HTML 文件多数一次就跑出来了。

核心要点

  • 一次成型能力:63 个 3D 世界覆盖 6 大主题(巨型 3D 世界、可玩游戏、名画重绘、非常规视角、自然奇观、元素与宇宙),绝大多数通过详细的规格文档一次性生成,仅少数需要 1-2 轮微调
  • 水下曼哈顿:1600 行代码生成的完整曼哈顿岛沉入水底,从 Battery 到 Inwood 涵盖数万栋楼,是 Fable 5 代码生成能力的最典型代表
  • 名画"打开"为 3D 世界:梵高《星空》被拆成一根根独立的线条在三维空间里重拼,莫奈睡莲、葛饰北斋浪花同样被"打开"为可漫游的世界——这要求模型真正"理解"绘画内容而非简单的像素级复刻
  • 短板仍在:游戏场景"玩 30 秒就腻",有时模型会"偷懒"藏着实力,生成的案例中约 20% 有 bug 被剔除
  • Arena.ai Agent 榜登顶:Fable 5 上线时就在 Arena.ai 的 Agent Arena 榜上以史上最大优势登顶,衡量的是模型在数百万次真实任务中的实际能力

深度分析

"fablemaxxing"——模型能力涌现的证据

Karpathy 发明的 "fablemaxxing" 一词捕捉了一个关键现象:当模型的能力达到某个临界点后,全新的、质的飞跃会出现。Fable 5 在 3D 代码生成上的表现——一个不到半年前还近乎天方夜谭的任务——突然变得可靠且高质量。更重要的是,Gostev 发现"连实验室里的人都还没完全搞清它能干什么",这说明模型的能力边界在发布后仍然在持续被发现和探索,而非局限于训练时的评估指标。这种"能力涌现后的二次探索"是新范式模型的重要特征。

从"像素复制"到"世界理解"

Fable 5 在 3D 世界生成中最令人印象深刻的不是"造得像",而是"理解了再创造"。把梵高的《星空》——一幅满是厚颜料堆叠、笔触卷成漩涡的油画——拆成三维空间的线条再重组,所需要的不是图像复制能力,而是对画作空间结构和笔触语义的深层理解。"你没法照抄一幅画,它得先看懂。"同样,Karpathy 惊讶于熊吃鲑鱼场景中"鱼被咬住会挣扎"这个细节——一个没人要求的、模型从互联网学习到的物理世界知识——被准确翻译成了 xyz 坐标、网格、变换和动画。这个问题"已经越过了'AI 画得好不好',落到了'它到底懂了多少'"。

3D 生成的范式转变:从迭代到一次成型

Gostev 指出了一个关键的分水岭:"过去要十几轮才磨得出的东西,现在一个 HTML 文件,多数一次就跑出来了。"弱一点的模型往往前 80% 做得像模像样,最后 20% 全线崩掉,剩下的 debug 时间反而更长。Fable 5 的突破在于"多数一次成型"——这是从"迭代生成"到"规格化生成"的范式切换。当模型能够从详细规格直接产生可工作的 3D 世界时,创作流程就从"反复试错"变成了"精确描述",大幅降低了 3D 内容创作的门槛。

能力边界的不确定性——连创造者都未完全掌握

Gostev 的视频中最引人深思的一句话是:"连实验室里的人,都还没完全搞清它能干什么。"这揭示了前沿模型研究中的一种新常态:模型的能力不仅在训练时超出预期,而且在发布后还会被第三方用户不断发现新的应用场景。63 个案例中约 20% 的失败率、游戏场景的"30 秒就腻"、以及模型偶尔"偷懒"的行为,都说明我们距离完全控制这些模型的能力还有距离——但这恰恰也是探索空间的全部魅力所在。

实践启示

  1. 模型能力边界远超训练时的评估: Fable 5 的 3D 能力可能不是训练时的重点优化目标,而是通用代码能力和创造力涌现的副产品。评估一个模型时,测试集之外的"探索式评估"同样重要。

  2. 3D 内容创作的门槛正在急剧下降: 从一个详细的规格文档到一个可交互的 3D 世界,现在可以在一次推理中完成。这对游戏开发、建筑设计、VR/AR 内容创作等领域意味着范式级的变革。

  3. "非最优"输出需要接受: 20% 的案例需要筛除带 bug 的结果,说明"一次成型"不等于"次次成型"。在依赖 AI 生成内容的工作流中,需要设计合理的人工筛选或自动验证环节。

  4. 细节知识是模型能力深度的试金石: 熊吃鲑鱼场景中"鱼会挣扎"这个细节,揭示了模型对物理世界的理解深度。评估模型能力时,不仅要看它能否完成任务,还要看它是否理解了任务背后的世界知识。

  5. "连造它的人都不知道它能干什么"意味着巨大的探索空间: 对于开发者和创业者,当前最重要的策略可能不是在已知的能力上优化,而是在模型还没被充分探索的领域寻找"意外能力"。

相关实体

原文存档