过去,测试大模型能力的经典题目往往是“生成一张鹈鹕骑自行车的矢量图”。这类任务要求模型理解物体结构、空间关系及坐标逻辑,其输出质量直观反映了模型的空间推理能力。
如今,Andrej Karpathy 认为评测前沿模型的标准需再次升级。8 月 2 日,他在 X 平台公布了一项实验:将《指环王》开篇文字输入 Claude Opus 5,设定 100 万 Token(约 10 美元)的推理预算,要求模型利用 Three.js 将其渲染为可交互的三维场景。
该帖子浏览量已超 280 万。Opus 5 耗时约两小时,生成了约 5500 行代码。尽管成品略显粗糙,但其核心价值在于:模型自主决策了场景中的角色、建筑、植被等元素,构建了三维坐标系,并编写了动画、镜头及时间轴逻辑,最终在浏览器中成功运行。
这并非简单的文生视频,而是接近传统游戏开发的流程:通过代码显式创建几何体、材质、灯光与摄像机。在此系统中,每个对象均有明确坐标,镜头运动与剧情推进均由程序控制。
Anthropic 在 Opus 5 发布公告中强调,该模型擅长长程多步骤任务,具备自我检查与迭代能力。Karpathy 的实验进一步验证了这一点:在无预设资源与坐标的情况下,模型独立完成了从小说文本到可运行 3D 叙事的转化。
Karpathy 更关注此举背后的经济性变革。传统 3D 动画制作涉及编剧、美术与程序的高昂成本,导致大量个性化需求无法落地。而 LLM 降低了启动门槛,使得“按需生成的临时版 GTA"成为可能——用户可指定任意设定,即时生成包含场景、交互规则与故事进程的专属世界。
用游戏测试模型,网友早就玩嗨了
Karpathy 的实验并非孤例。Opus 5 发布后,开发者社区迅速将其应用于三维游戏与物理模拟的压力测试中。
开发者 Matt Shumer 展示了全代码生成的第一人称射击游戏"Claude of Duty",未使用任何外部美术资产;Alex Ermolov 则利用该模型制作了物理反馈自然的滑雪板体验,指出 Opus 5 在首版生成中即无明显视觉故障。
用户 ChrisGPT 对比了一年前的 Claude 4 Opus 与新版 Opus 5。在生成行驶汽车的场景中,旧版本仅能呈现简单色块,而 Opus 5 已能自动添加车辙、植被、阴影及分层光照。
更极端的测试来自 Pankaj Kumar,他指令 Opus 5 重建《我的世界》,生成了包含 15 种生物群系及多种模式的程序化世界。不过,该任务消耗了约 2500 万 Token,表明随着世界规模扩大,成本与复杂度仍呈指数级增长。
这些测试的共同点在于摆脱了对传统资产库的依赖,直接通过代码构建几何、纹理与物理交互。评测维度也从单张图片延伸至长时间运行的系统稳定性,包括角色移动、碰撞检测及状态一致性。
很强,但不是真正意义上的“世界模型”
尽管效果惊艳,Karpathy 的实验与谷歌 DeepMind 的 Genie 等“世界模型”存在本质区别。
Opus 5 生成的是显式程序代码,对象与规则由 Three.js 定义,具备可编辑、可调试的优势,但受限于模型对程序表达的理解能力。相比之下,Genie 3 采用生成式视频路线,根据玩家操作实时预测下一帧画面,无需显式建模,视觉效果更丰富但缺乏明确的对象状态与规则。
未来产品或融合两者:LLM 负责规划与代码生成,世界模型负责画面渲染与物理反馈。
此次实验也暴露了当前大模型的短板:视频理解与连续状态感知能力不足。模型无法像人类一样“进入”游戏进行持续测试,只能通过截取静态画面来修正代码。这种循环缓慢且易遗漏动态问题(如穿模、镜头突变),导致成品仍存在错位与粗糙之处。
Karpathy 指出,模型生成内容的能力正快于其验证内容的能力。对于动画、游戏等复杂系统,正确性分布在连续时间与交互反馈中,若模型无法亲身体验,便难以形成完整的“生成—执行—观察—修正”闭环。
从鹈鹕骑车到《指环王》3D 世界,大模型评测标准正在转变:从能否生成可运行代码,转向能否长时间组织数千行代码保持一致性,并主动发现非日志类的隐性错误。
虽然 Opus 5 生成的并非商业级游戏,且 10 美元仅为 Token 估算成本,但该实验标志着一个重要转折:以往因成本过高而被搁置的个性化软件与内容,现在仅需一句描述与微量预算即可实现。模型已具备建造临时世界的耐力,下一步的关键在于何时能真正看见并理解自己构建的世界。
参考链接:
https://simonwillison.net/2025/Jun/6/six-months-in-llms/
https://x.com/ChrisGPT/status/2082265122949542149
https://karpathy.ai/lotr-movie/
声明:本文为 AI 前线整理,不代表平台观点,也不构成投资建议,未经许可禁止转载。


