AI觉醒星球
Awakening is here
Knowledge File / 全球热点解读
2026-08-02 3 浏览 公开

LLM测试正在脱离“画鹈鹕”时代

Karpathy指出,测试LLM的方式正从简单指令生成转向复杂长上下文任务,如百万token预算处理长文本,这标志着模型评估进入新阶段。

SOURCE / 全球热点解读 MIN / 4 ACCESS / 公开 POST / 2026-08-02 11:00:09

原贴

查看原文
作者:@karpathy 来源站点:x.com 原贴时间:
LLM测试正在脱离“画鹈鹕”时代

原文

We're starting to leave the territory where you'd test an LLM by e.g. "create an svg of pelican on a bicycle". As one idea to generalize it, I was interested what Opus 5 would do if I gave it the first paragraph of the Lord of the Rings, a 1M token budget (~$10) and asked for

中文翻译

我们开始离开那种用“画一个骑自行车的鹈鹕的SVG”来测试LLM的领域。作为一个泛化思路,我感兴趣的是,如果给Opus 5《指环王》的第一段,100万token预算(约10美元),并要求它…

核心信息

Karpathy指出,测试LLM的方式正从简单指令生成转向复杂长上下文任务,如百万token预算处理长文本,这标志着模型评估进入新阶段。

  • Karpathy指出,测试LLM的方式正从简单指令生成转向复杂长上下文任务,如百万token预算处理长文本,这标志着模型评估进入新阶段。
  • 原贴提到:We're starting to leave the territory where you'd test an LLM by e.g. "c
  • 来源:x.com

详细解读

信号解读:这条来自AI领域顶尖人物Karpathy的推文,揭示了LLM评估范式的转变。过去,我们通过零样本生成任务(如“画一只骑自行车的鹈鹕”)来测试模型的基础能力,这类任务关注指令遵循和创造力的“火花”。现在,随着模型上下文窗口和推理能力的大幅提升,测试正转向更长、更复杂的“结构化任务”——例如将整部小说作为上下文,在百万token预算内完成某种深度处理(如摘要、分析或续写)。这表明行业焦点正从“单点能力”转向“端到端复杂任务的可靠性”。

为什么重要:这种转变意味着:1)模型的竞争力不再取决于单次指令的灵光一现,而在于对超长文本的持续理解、推理和生成能力;2)评估成本上升(百万token约10美元),催生新的评估服务;3)对于企业而言,选用模型的标准从“能画鹈鹕”变为“能否处理真实业务中的长文档、代码库或客户对话”。

谁有价值:AI开发者(需关注长上下文推理的调优)、企业AI采购方(重新定义测试基准)、以及依赖LLM做内容处理的内容从业者(如小说分析、报告生成)。

行动建议:1)将你的业务场景拆解为“长上下文任务”,用真实数据设计评估集;2)跟踪Opus 5等新模型的百万token能力,预算上留出测试成本;3)关注模型在长文档中的“迷失中间”问题,建立质量抽检机制。

风险与限制:目前大多数模型的长上下文能力仍不稳定,可能“记住开头忘记结尾”;且百万token的推理成本高,不适合所有场景;另外,这种测试方式可能过度关注“长度”而忽略“深度”,需要避免唯token论。

信息差价值

这条内容的真正价值,不只是“有人发布了一个新功能”,而是它揭示了 x.com 背后的产品方向、工作流变化或竞争信号。对 OPC 来说,这种信息可以转化成持续追踪的栏目选题。

如果把《LLM测试正在脱离“画鹈鹕”时代》放到你的内容系统里,它最大的价值在于帮助读者更快看懂“为什么值得关注”,而不是只看到一条碎片化动态。

参考来源

上一篇 Snap 和 LinkedIn 正在反击大量低质量 AI 内容 下一篇 OpenAI CEO 奥尔特曼提出用 AI 打造亲子晨间播客,遭网友批评