AI 写完代码谁来验?Karpathy 指出短板,OpenAI 让 Claude 去查
即便模型能凭空构建出完整的 3D 虚拟世界,却无法亲自涉足其中去检验质量。对此,OpenAI 的对策竟是——借力打力,让对手的 Claude Code 来进行审查。
8月2日,Andrej Karpathy 在社交平台 X 上发布了一则动态,短短时间内浏览量便突破了 300 万大关。
他将《指环王》开篇的文字输入 Claude Opus 5,并投入了 100 万 token 的推理额度(约合 10 美元),指令是利用 Three.js 将文字转化为 3D 场景。
经过两个多小时的运算,Opus 5 输出了近 5500 行代码。
最终效果如何?Karpathy 评价为“虽有瑕疵,但颇具趣味”。在一段 93 秒的视频中,河流蜿蜒、丘陵起伏、树木林立——一个程序化生成的中土世界在浏览器中生动呈现。
然而,令他更为震撼的并非成品的精细程度,而是这一成果背后的性质:
一个语言模型不仅要在三维坐标空间中部署和调度各类多边形资源,还得编写驱动动画的代码——而它竟然成功完成了。
这绝非简单的“文本绘图”。Opus 5 采用了更贴近传统游戏开发的路径:通过代码构建几何体、材质、光照、摄像机及动画,搭建出一个真实的 3D 场景。在此体系中,树木不再是屏幕上的一团绿色像素,而是场景对象树中的具体实例。
无需团队、预算或数月筹备。仅用 10 美元、一人之力,一段文字便完成了这一切。
随后,Karpathy 说了一句让我陷入深思的话:
这揭示了 LLM 的一个致命短板——它们无法高效地自我审查。原因在于,既无法原生识别视频内容,也无法亲自进入其生成的场景中进行交互体验。
Opus 5 构建了中土世界,却无法亲自踏入其中,去体验这个由它亲手缔造的领域。
整整两小时,它只能采用最原始的手段来复核:在不同坐标截取屏幕截图,仅凭几张静态图去推测对错。期间屡次出错——那些粗糙之处和 Bug 便由此产生。
这恰似一位蒙眼装修的工匠,手艺精湛、效率极高,却无法退后一步审视整面墙壁是否平整。
细想之下,这着实荒诞:模型虽能凭空构建 3D 世界,却丧失了沉浸式体验的能力。
这不仅仅是 3D 渲染的局限,更是所有前沿模型共有的顽疾:
一边是近乎无限的耐心与产出,另一边却是无法体验自身成果的缺憾。
Karpathy 展开了更天马行空的设想:未来能否将玩家投入这种实时生成的世界,以旁观 NPC 的身份参与《魔戒》剧情,甚至直接扮演某一角色?他将其称为“按需生成的临时 GTA”。
技术上完全可行——Opus 5 已证明了这一点。但瓶颈恰恰在于:AI 无法进入其生成的世界。
就在同月,OpenAI 提出了一种解决方案——而该方案本身便极具深意。
名为 `codex-plugin-cc`,这是 OpenAI 官方维护的一个 Claude Code 插件,在 GitHub 上收获了 30k+ 的点赞。
请允许我重申:OpenAI 为 Anthropic 的 Claude Code 开发了官方插件。这两家在 Coding Agent 领域正面交锋的 AI 巨头,竟选择了“互操作”。
该插件具备哪些功能?包含几个关键指令:
其中最值得深究的是 `/codex:adversarial-review` 命令。
常规代码审查仅回答“是否存在 Bug”——而对抗式审查则追问“方向是否正确?该设计三个月后是否会演变成技术债务?”
它挑战设计决策、质疑权衡取舍、探测底层假设并识别失败模式。且具备定向能力:
`/codex:adversarial-review` 关注我们的错误处理假设
`/codex:adversarial-review` 质疑该抽象是否过早
这就是答案所在。
Karpathy 的实验揭示了问题:AI 的生成能力远超其验证能力。
OpenAI 的方案暗示了答案:非让单一模型自我审查,而是促使不同模型间进行相互验证。
其背后的逻辑链条值得剖析:
这体现了一种高度“工程化”的思维:不强求单体突破,而是通过系统架构来弥补单体的短板。
回到 Karpathy 帖子的结尾——他表示 LLM 目前既无法高效感知视频,也无法在生成场景中直接“游玩”。
但我认为这并非“缺陷”,而是一个发展方向。
生成能力已飞跃,验证能力仍原地踏步——这一缺口便是下一个产品机遇。谁能填补它?
OpenAI 让 Codex 审查 Claude Code 的举措,不仅是工程技巧,更是一个信号:AI 不会止步于单一模型,Agent 间的协作才是未来。
无需挑选“最强”模型,你需要的是一个“会写代码”的 Agent 和一个“会查代码”的 Agent——二者配合,远比自我审查可靠。
Karpathy 用 10 美元构建了中土世界,却发现 AI 无法踏入其亲手建造的领域。
OpenAI 回应:无妨,让另一款 AI 去进入检查。
这便是 AI 时代最有趣的悖论:最需人类判断的环节(代码审查),竟最先被 AI 间的对抗式协作所取代。