AI觉醒星球
Awakening is here
Knowledge File / 全球热点解读
2026-08-02 3 浏览 公开

Karpathy 用《指环王》测试 Opus 5 长程生成

Karpathy提出用《指环王》首段测试LLM长程生成,Opus 5在100万token预算下生成5500行Three.js代码,耗时2小时,但暴露无法感知视频反馈的短板。

SOURCE / 全球热点解读 MIN / 4 ACCESS / 公开 POST / 2026-08-02 16:17:15

原贴

查看原文
作者:X:Kim (@kimmonismus) 来源站点:x.com 原贴时间:
Karpathy 用《指环王》测试 Opus 5 长程生成

原文

Karpathy 提出用《指环王》首段测试 LLM 长程生成能力:给 Opus 5 100 万 token 预算(约 $10),它耗时约 2 小时写出 5500 行 Three.js 代码,程序化渲染整个故事。该测试考验模型跨数千行代码的连贯性与自我审查能力,但暴露了 LLM 无法高效感知视频或游戏内反馈的短板。 AIHOT 分类:tip

中文翻译

Karpathy 提出用《指环王》首段测试 LLM 长程生成能力:给 Opus 5 100 万 token 预算(约 $10),它耗时约 2 小时写出 5500 行 Three.js 代码,程序化渲染整个故事。该测试考验模型跨数千行代码的连贯性与自我审查能力,但暴露了 LLM 无法高效感知视频或游戏内反馈的短板。

核心信息

Karpathy提出用《指环王》首段测试LLM长程生成,Opus 5在100万token预算下生成5500行Three.js代码,耗时2小时,但暴露无法感知视频反馈的短板。

  • Karpathy提出用《指环王》首段测试LLM长程生成,Opus 5在100万token预算下生成5500行Three.js代码,耗时2小时,但暴露无法感知视频反馈的短板。
  • 原贴提到:Karpathy 提出用《指环王》首段测试 LLM 长程生成能力:给 Opus 5 100 万 token 预算(约 $10),它耗时约 2 小
  • 来源:x.com

详细解读

这条信号来自 AI 领域知名人物 Karpathy 的一次实验设计。他提出用《指环王》小说的开头段落作为测试基准,给 Opus 5 模型 100 万 token 的预算(约 10 美元),模型耗时约 2 小时生成了 5500 行 Three.js 代码,以程序化方式渲染整个故事。这个测试的核心是考察模型在超长上下文中是否能够保持代码的连贯性,以及是否具备类似人类的自我审查能力。

为什么重要?因为长程生成能力是当前 LLM 从“短文本助手”走向“复杂任务执行者”的关键门槛。无论是生成一部小说、构建一个完整 3D 场景,还是编写一个大型软件项目,都需要模型在数千行输出中维持逻辑一致性和可维护性。Karpathy 选择的《指环王》首段,是对语言理解和空间想象力的双重考验,而 Opus 5 的表现为我们提供了一个可量化的观测样本。

对谁有价值?首先是 AI 开发者,他们可以复用这种测试方法来评估自家模型的长程能力;其次是内容创作者和游戏开发者,这预示着 AI 可能直接生成可交互的视觉内容;最后是 AI 投资人,这能帮助他们判断模型能力的真实边界。

可以怎么行动?如果你在评估模型,不妨尝试构建类似的长程编码任务,并设置明确的预算与时间限制。如果你在开发产品,可以思考如何将这种长程生成能力接入工作流,但一定要为人工审核留出空间,因为模型对视频或游戏内反馈的感知仍然很弱。

风险或限制:首先是成本问题,100 万 token 花费 10 美元并非所有团队都能承受;其次是模型无法高效感知视觉输出,生成的代码是否真实可运行、渲染效果是否符合预期,仍然需要人来验证;最后,单一测试样本可能不足以全面衡量模型能力,需警惕“测试集过拟合”式的营销。

信息差价值

这条内容的真正价值,不只是“有人发布了一个新功能”,而是它揭示了 x.com 背后的产品方向、工作流变化或竞争信号。对 OPC 来说,这种信息可以转化成持续追踪的栏目选题。

如果把《Karpathy 用《指环王》测试 Opus 5 长程生成》放到你的内容系统里,它最大的价值在于帮助读者更快看懂“为什么值得关注”,而不是只看到一条碎片化动态。

参考来源

上一篇 AI发现大量安全漏洞,但几乎没有一个被利用 下一篇 Snap 和 LinkedIn 正在反击大量低质量 AI 内容