Claude Opus 5 发货两天后,AI 投资者、HyperWrite 前首席执行官 Matt Shumer 发布了一段视频,展示了该模型完全自行构建的完全可玩的第一人称射击游戏。
“Claude Opus 5 一次性完成了这款游戏,”他写道,并补充说没有任何外部资产进入构建。

现在,您可能认为如此优质的输出需要长时间、详细且仔细的提示来指导人工智能模型完成构建精美的第一人称射击游戏的复杂性。
再想一想。
克劳德·欧普斯 5 本场比赛一击即中。
您在此演示中看到的所有内容都是自定义代码...没有使用任何外部资源。
人工智能游戏将会非常精彩。
(声音打开)pic.twitter.com/zc7C61kgv1
— 马特·舒默 (@mattshumer_) 2026 年 7 月 25 日
其背后的提示由三个简短的段落组成,全文发布在 GitHub 上。它要求 Opus 5 打造一款达到最新《使命召唤》游戏水平的射击游戏,将子代理(每个人都有自己独立的记忆和狭窄的工作)分散开来,分别处理各个片段,并用一个单独的、严厉的评论家不断循环播放每个片段,直到它与盲人并排的真实《使命召唤》镜头相媲美。根据提示,结果应该是“完全完美”。
这与工程师教导人们如何快速工作的方式截然相反。振动编码热潮中的建议是指定标准而不是形容词:说出“好”的含义,而不是仅仅要求它。代码应该考虑什么而不是说“AAA”。
Shumer 的版本几乎相反,要求自己的子代理“完全惊叹”,并将实际定义留给为自己构建的评论家 Opus 5。
这接近整个简报。舒默后来写道,他从未指定渲染器、列出游戏系统或定义“AAA 品质”需要包含哪些内容。他开始将这种方法称为“挑战循环”:向代理提供一个真实的、可检查的条形图,而不是模糊的指令,让它将工作分成小块,然后将每个块通过批评家,而批评家永远不会看到建造者自己对其选择的推理。
两个克劳德代码特征承载了该循环。子代理在独立的上下文窗口中旋转,具有自己的指令和工具访问权限,因此对武器模型进行评分的评论家不会继承构建者对其外观的借口。 Ultracode 是一种 Claude Code 设置,可将模型推向最高推理水平,并让它编写自己的编排计划,同时将工作分散到多达 16 个代理上,每次运行上限为 1,000 个代理。
Anthropic 的内置/循环技能是为重复的修复-测试-调整循环而构建的,这使得运行在游戏看起来不错时不会停止。舒默从未指定回合数。他让批评者不断地命名一个新的差距,并让建造者在他自己结束会议之前追了几个小时。
完成的构建在 Three.js 和普通 WebGL2 上运行,大约 55,000 行代码分布在 11 个子系统中。每个纹理、网格、动画和声音都是在加载时在浏览器内部生成的,无需下载模型、HDRI、图像文件或音频文件。 Shumer 自己发表的评论日志显示,分数从 3.59 分(满分 10 分)攀升至略高于 5 分,但每一轮仍然落后于真实游戏。
怀疑论者假设隐藏了数小时的手动编码,因此 Shumer 发布了整个提示和代码库。就在那时,模仿者开始了。
同样的技巧,三个不同的构建者
前对冲基金经理兼播客 James Altucher 运行了相同的提示,并报告说花了“十多个小时”并在 Opus 5 上花费了大约 130 万枚代币才到达那里。他的作品“Operation Blackout”可以在浏览器中免费玩,而且看起来棒极了。
你可以在这里玩那个游戏。
Prompt Silo 的开发者对 OpenAI 的竞争对手旗舰产品提出了同样的要求,并发布了“具有相同提示的 Sol 5.6 Ultra”——Sol 是 OpenAI 于 7 月 9 日全面上市的三款 GPT-5.6 系列中的顶级产品,同时还有更便宜的 Terra 和 Luna 版本。
Sol 5.6 Ultra 具有相同的提示。 https://t.co/89EhfiCvg0 pic.twitter.com/1xwBQw5nRh
— Rich·Atom Tan 工作室 (@atomtanstudio) 2026 年 7 月 26 日
开发人员 Leon Lin 尝试了相反的做法,按照通常的详细提示进行操作。他没有复制 Shumer 的简短版本,而是着手“对这款游戏的提示进行逆向工程”,生成了一份大约 20 个部分的文档,详细说明了从布娃娃物理到级联阴影贴图的所有内容。他使用普通的 Opus 5 将其输入到 Cursor 中,没有使用子代理,也没有超级代码,结果是一款名为《Dust Corridor》的市场街头射击游戏,也可以在浏览器中运行,而且看起来也很棒。
后续版本都没有面临 Shumer 在他自己的项目上进行的盲目测试。他的评论日志仍然显示真正的《使命召唤》在他记录的每一轮中都获胜——Altucher 和 Atom Tan Studio 正在用他精确的三段提示来追逐,而 Leon Lin 则用他自己的大约 20 段来追逐。
其中有多少实际上是新的?
像 Claude Code 这样的代理编码工具以受监督的初级工程师的方式编写软件:它们读取文件、运行代码、查看生成的屏幕截图,并将工作的各个部分交给子代理和评论家,根据既定目标检查结果。这个循环是真实的,而 Shumer 的 Gauntlet Loop 是构建它的真正方法。就其本身而言,这些都不能证明该模型是根据想象设计游戏的,而不是重新组合它已经吸收的代码模式。
Three.js 提供了自己的指针锁定相机控件作为官方示例,并且该基本模式(鼠标外观、WASD 移动、枪声光线投射)已在 GitHub、gists 和开发论坛上进行了分叉和教程十多年。在公共存储库上训练的编码模型在阅读 Shumer 的提示之前,几乎肯定已经看到了数百甚至数千个几乎相同的射手。
这并不意味着《使命召唤》是假的,但它让“从头开始构建”变得更难得到完全的认可,所以对这些结果持保留态度。
研究代码生成模型的研究人员对更广泛的问题有一个名称:数据污染,当模型在某项任务上表现良好时,主要是因为其训练数据中已经存在几乎相同的示例,而不是因为它推理出了新的东西。
没有任何第一人称射击游戏发布过针对此类污染的检查。 Shumer 自己的存储库确实包含了 Claude 自己的创造力(如果这样称呼公平的话)。这就是将“一击 AAA 游戏”视为一名在编程中记录最多的类型之一中工作的有能力的代理人的原因,而不是作为人工智能设计了一款没有现有技术可依赖的射击游戏的证据。