觉
AI觉醒星球
Awakening is here
Knowledge File / AI小生意项目库
2026-07-05 5 浏览 免费阅读

更好的模型:更差的工具

Armin报告了一个奇怪问题:新版的Claude模型(Opus 4.8和Sonnet 5)在调用Pi的编辑工具时,会在嵌套的edits[]数组中添加额外的虚构字段,导致工具调用被拒绝,而旧模型没有这个问题。作者猜测是因为Anthropic最新模型被训练为更好地使用Claude Code内置的编辑工具,反而使第三方工具使用错误。

SOURCE / AI小生意项目库 MIN / 4 ACCESS / 免费阅读 POST / 2026-07-05 06:53:52

原贴

查看原文
作者:Simon Willison 来源站点:simonwillison.net 原贴时间:

原文

Better Models: Worse Tools Armin reports on a weird problem he ran into while hacking on Pi: The short version is that newer Claude models sometimes call Pi’s edit tool with extra, invented fields in the nested edits[] array. And not Haiku or some small model: Opus 4.8. The edit itself is usually correct but the arguments do not match the schema as the model invents made-up keys and Pi thus rejects the tool call and asks to try again. That alone is not too surprising as models emit malformed tool calls sometimes. Particularly small ones. What surprised me is that this is getting worse with newer Anthropic models as both Opus 4.8 and Sonnet 5 show it but none of the older models. In other words, the SOTA models of the family are worse at this specific tool schema than their older siblings. Armin theorizes that this is because more recent Anthropic models have been specifically trained (presumably via Reinforcement Learning) to better use the edit tools that are baked into Claude Code. This has the unfortunate effect that other coding harnesses, such as Pi, may find that their own custom edit tools are more likely to be used incorrectly. Claude's edit tool uses search and replace . OpenAI's Codex uses an apply_patch mechanism instead , and OpenAI have talked in the past about how their models are trained to use that tool effectively. Does this mean third-party coding harnesses like Pi should implement multiple edit tools just so they can use the one with the best performance for the underlying model the user has selected? Tags: armin-ronacher , ai , openai , generative-ai , llms , anthropic , llm-tool-use , coding-agents , pi

中文翻译

Armin 报告了他在开发 Pi 时遇到的一个奇怪问题:简而言之,较新的 Claude 模型有时会在嵌套的 edits[] 数组中调用 Pi 的编辑工具,并带有额外的、虚构的字段。而且不是 Haiku 或某个小模型:是 Opus 4.8。编辑本身通常是正确的,但参数不符合模式,因为模型发明了伪造的键,Pi 因此拒绝工具调用并要求重试。这本身并不太令人惊讶,因为模型有时会发出格式错误的工具调用。特别是小模型。令我惊讶的是,随着新 Anthropic 模型的推出,这种情况变得更糟,Opus 4.8 和 Sonnet 5 都表现出这种情况,但旧模型都没有。换句话说,该系列中最先进的模型在特定工具模式上比它们的旧版本更差。Armin 推测,这是因为较新的 Anthropic 模型经过专门训练(大概是通过强化学习)以更好地使用 Claude Code 中内置的编辑工具。这带来了不幸的后果,即其他编码工具(如 Pi)可能会发现它们自己的自定义编辑工具更可能被错误使用。Claude 的编辑工具使用搜索替换。OpenAI 的 Codex 使用 apply_patch 机制,OpenAI 过去曾谈论过他们的模型如何被训练以有效使用该工具。这是否意味着像 Pi 这样的第三方编码工具应该实现多种编辑工具,以便它们能够为用户选择的底层模型使用性能最佳的编辑工具?

核心信息

Armin报告了一个奇怪问题:新版的Claude模型(Opus 4.8和Sonnet 5)在调用Pi的编辑工具时,会在嵌套的edits[]数组中添加额外的虚构字段,导致工具调用被拒绝,而旧模型没有这个问题。作者猜测是因为Anthropic最新模型被训练为更好地使用Claude Code内置的编辑工具,反而使第三方工具使用错误。

  • Armin报告了一个奇怪问题:新版的Claude模型(Opus 4.8和Sonnet 5)在调用Pi的编辑工具时,会在嵌套的edits[]数组中添加额外的虚构字段,导致工具调用被拒绝,而旧模型没有这个问题。作者猜测是因为Anthropic最新模型被训练为更好地使用Claude Code内置的编辑工具,反而使第三方工具使用错误。
  • 原贴提到:Better Models: Worse Tools Armin reports on a weird problem he ran into
  • 来源:simonwillison.net

详细解读

这是一个值得关注的信号:大型语言模型在工具调用能力上的变化并非总是线性提升。具体表现为,Anthropic最新发布的Claude Opus 4.8和Sonnet 5模型在调用外部编辑工具时,会随意添加模式中不存在的字段,导致工具调用失败。而旧版本模型反而表现正常。这打破了“新模型必然更好”的直觉。

为什么重要?这表明模型厂商在强化训练特定工具(如Claude Code内置的编辑工具)时,可能会损害模型对其他自定义工具的泛化能力。对于依赖模型工具调用的第三方应用(如Pi、Cursor等编码助手),这意味着即使模型自身能力提升,其与外部工具的兼容性却可能恶化。这直接影响了AI应用的可靠性和用户体验。

对谁有价值?AI工具开发者、编码助手平台(如Pi、Continue等)、以及使用模型进行自动化编码的团队。他们需要意识到,模型升级可能带来工具调用侧的回归问题。

可以怎么行动?1)开发者应在模型升级时全面测试自定义工具调用,不能假设新模型兼容旧模式;2)考虑为不同模型提供多个工具实现(如搜索替换、apply_patch等),动态选择最适配的版本;3)关注模型厂商的公开文档和社区反馈,了解模型训练侧重点的变化。

风险或限制:本文仅针对Anthropic模型在编辑工具场景下的表现,不代表其他模型或任务。且问题可能随模型更新而修复,但暴露的“训练目标冲突”是结构性问题,需要长期关注。

信息差价值

这条内容的真正价值,不只是“有人发布了一个新功能”,而是它揭示了 simonwillison.net 背后的产品方向、工作流变化或竞争信号。对 OPC 来说,这种信息可以转化成持续追踪的栏目选题。

如果把《更好的模型:更差的工具》放到你的内容系统里,它最大的价值在于帮助读者更快看懂“为什么值得关注”,而不是只看到一条碎片化动态。

参考来源

AI SUMMARY

这篇文章回答了什么

更好的模型:更差的工具主要讲什么?

Armin报告了一个奇怪问题:新版的Claude模型(Opus 4.8和Sonnet 5)在调用Pi的编辑工具时,会在嵌套的edits[]数组中添加额外的虚构字段,导致工具调用被拒绝,而旧模型没有这个问题。作者猜测是因为Anthropic最新模型被训练为更好地使用Claude Code内置的编辑工具,反而使第三方工具使用错误。

这篇文章最值得关注的要点是什么?

Armin报告了一个奇怪问题:新版的Claude模型(Opus 4.8和Sonnet 5)在调用Pi的编辑工具时,会在嵌套的edits[]数组中添加额外的虚构字段,导致工具调用被拒绝,而旧模型没有这个问题。作者猜测是因为Anthropic…;原贴提到:Better Models: Worse Tools Armin reports on a weird problem he ran into;来源:simonwillison.net

这篇文章和哪些AI专题相关?

它适合放在Agent工作流、AI副业、AI工具专题里阅读。 关联原因:这篇内容命中「Agent、Claude Code」等主题信号。;这篇内容命中「项目、小生意、变现」等主题信号。;这篇内容命中「工具、模型、Claude」等主题信号。

阅读这篇文章建议先理解哪些关键词?

建议先理解AI工具、工具、自动化、模型、Cursor这些关键词,再结合正文判断工具、机会或风险是否值得进入自己的工作流。

上一篇 AI搜索代理的失败不在于搜索,而在于查询模糊时不会提出正确问题 下一篇 谷歌新广告想象在AI帮助下起草独立宣言
北竹游乐场 免费玩小游戏 免费玩