什么是‘指环王基准’测试?
大神卡帕西宣布,‘我们’Anthropic 已开始用一种全新方式给大模型上强度——《指环王》。这套‘指环王基准’正在接替过去风靡一时的‘鹈鹕骑自行车’SVG 测试。卡帕西直接把《指环王》的开头丢给 Opus 5,让模型用 Three.js 现场搓出一整个‘中土世界’。最终效果类似上世纪 90 年代末、21 世纪初的国产 3D 动画片,很粗糙、抽象,但熟悉《指环王》取景地霍比屯的人,仔细看能看出一丝味道。不过,这个不太精致的玩意花掉了 Opus 5 100 万 token、2 个小时以及 5500 行代码。
‘指环王’测试是如何进行的?
按照卡帕西推文,输入给 Opus 5 的主要提示词是《指环王》正文第一章《期待已久的宴会》的开头,还指定了 Three.js 这个用代码搭建 3D 场景的 JavaScript 库。Opus 5 要先读懂《指环王》开头文字,再将其翻译成能在浏览器中实时运行的 3D 世界,过程中需用多边形拼出人物、建筑和道具,放进 x、y、z 坐标系,安排好摄像机、灯光和动画,用代码定义人物移动、镜头转动、灯光变化和物体互动等。虽然画面不精致,常有穿模、漂浮等问题,但场景好歹搭建起来了。这和视频模型直接生成一帧帧像素不同,Three.js 需先建立三维对象,再实时计算位置、角度和运动状态,所以看到的 Demo 是 3D 网页场景运行时的录屏。卡帕西在评论区提到,程序化 3D 和视频生成并非二选一,有网友提议把粗糙录屏交给 Seedance 作参考视频,让视频模型重新渲染,卡帕西表示赞同。他设想程序化代码负责分镜和控制,敲定骨架后交给 Video - to - Video 模型补纹理、光影和细节。音频方面,卡帕西因个人对音质要求,最终使用了 ElevenLabs,《指环王》Demo 由此诞生,且项目已开源。
网友的测试成果如何?
卡帕西放出 Demo 后,网友赶来测试,表现得比卡帕西更有想象力。有人用 Claude 启动「Earth Online」项目,靠 AI Agent 搭建地球,目前只搭出低多边形风格的旧金山滨水区,画面建筑比例、人物尺度和整体风格统一,类似乐高世界动画片,简单画风的动画和轻量游戏有了 AI 原生雏形。还有网友用 Fable 5 和 GPT - 5.6 Sol 搭出纽约市 3D 数字模型并接入实时数据,作者提出生成虚拟世界的任务或成新的空间推理 Benchmark。更有网友用 AI 在浏览器给自己补办 Kanye West 的演唱会,项目由 Three.js 搭建,仅一个 HTML 文件,舞台、人物和灯光全由代码生成,准备了 14 首歌,有独立灯光设计和专属球形舞台视觉,普通用户可试听片段,连接 Spotify Premium 能播放完整曲目和整场演出。卡帕西畅想给 3D 世界加入玩法,网友已做出游戏版本,使用 Opus 5 和 Three.js,能运行、交互且配有音频。更多 3D 设计案例不断出现,Opus 5 能在较大项目里维持相对稳定的一致性,但这些作品距成熟游戏仍有距离,玩法趣味性、运行稳定性以及玩家参与意愿都有待验证,不过实时 3D 内容和可玩原型的制作门槛降低了。
为何用《指环王》测试大模型?
这要从前几年爆火的‘鹈鹕骑自行车’测试说起。该测试由开发者 Simon Willison 提出,要求生成一张鹈鹕骑自行车的 SVG 图片,虽题目简单,但很考验模型。因为 SVG 底层是代码,模型需知道鹈鹕和自行车样子,拆成线条、圆形和多边形,用坐标安排部件位置关系,且要处理好两者不般配的组合,通过轮子、脚的位置和鸟的姿态判断模型是否理解空间关系。‘鹈鹕骑自行车’曾是观察大模型空间理解、物体组合和代码生成能力的经典测试,但随着模型变强,它快失去测试价值,且一张 SVG 只能考察一次性输出,测不出模型规划复杂项目、连续工作和修正错误的能力。于是,卡帕西将测试换成‘搭个世界’的‘指环王’测试。
新测试引发了哪些争议?
卡帕西准备换题的消息传开后,引发不同观点。Hacker News 高赞评论认为,Demo 画面质量一般,说明需要比生成单张图片更难的新测试,新基准应考察模型对世界的理解,因为‘鹈鹕骑自行车’用太久,模型刷榜使差距难看出,而生成完整 3D 世界需模型理解空间关系、处理场景变化,非简单调用视频生成模型。但也有人反对,认为鹈鹕测试简洁、成本低、结果易比较,生成 3D 世界消耗大量 Token 是浪费算力,且 Three.js 能否衡量大模型综合能力遭质疑,有人觉得这类 Demo 只能证明 Anthropic 在 Three.js 代码训练不错,不能说明模型理解空间和物理世界。不过网友反驳,把文学文本转化成 3D 动画,模型需处理多种问题,低估 5500 行代码不合理。此外,还有网友提出‘空间推理’是否与大模型处理文字、代码的推理不同的问题,一种观点认为画面取决于模型对空间关系的理解,另一种观点认为模型处理文字和空间可能是同一推理过程。从画鹈鹕到搭中土世界,测试的或许是模型将对世界的理解转化为运行结构的能力。最后,还有个问题:如果通用大模型能搭建 3D 世界,用户还有多少必要用专门视频生成产品输入 Prompt?