Simon Willison's Weblog

Better Models: Worse Tools

6.7内容质量

TL;DR · AI 摘要

Better Models: Worse Tools Simon Willison’s Weblog Subscribe smallhead Sponsored by: Sonar — Gartner just named Sonar a...

核心要点

  • 主题聚焦:Better Models: Worse Tools
  • 来源:Simon Willison's Weblog,建议结合原文判断细节。
  • AI 分析暂不可用,本条为保底评分与摘要。
#AI#编程
打开原文

更优的模型:更差的工具

Simon Willison 的博客

订阅

#smallhead

由以下公司赞助:

Sonar — Gartner 最近将 Sonar 评为 2026 年 Gartner 技术债务管理工具魔力象限™ 的领导者。阅读报告,了解如何衡量和解决代码库中的技术债务。

获取报告

2026 年 7 月 4 日 - 链接博客

Better Models: Worse Tools。Armin 报告了他在使用 Pi 进行开发时遇到的一个奇怪问题:

简短来说,较新的 Claude 模型有时会在嵌套的 edits[] 数组中调用 Pi 的编辑工具时添加额外的虚构字段。而且不是 Haiku 或某个小型模型:Opus 4.8。编辑本身通常是正确的,但参数与模式不匹配,因为模型发明了虚构的键,导致 Pi 拒绝调用工具并要求重试。这本身并不太令人意外,因为模型有时会发出格式错误的工具调用,尤其是小型模型。让我惊讶的是,随着更新的 Anthropic 模型,这种情况变得更糟,因为 Opus 4.8 和 Sonnet 5 都表现出这一问题,而旧模型则没有。换句话说,该系列最先进的模型在特定工具模式上的表现比它们的旧版本更差。

Armin 猜测这是因为最近的 Anthropic 模型经过了特定训练(可能是通过强化学习),以更好地使用内置在 Claude Code 中的编辑工具。这不幸导致其他编码框架(如 Pi)发现自己的自定义编辑工具更可能被错误使用。

Claude 的编辑工具使用搜索和替换,而 OpenAI 的 Codex 使用的是 apply_patch 机制,OpenAI 曾经提到过他们的模型是如何训练以有效使用该工具的。

这意味着像 Pi 这样的第三方编码框架是否应该实现多个编辑工具,以便根据用户选择的基础模型使用性能最佳的那个?

发布于

2026 年 7 月 4 日

晚上 10:53

最新文章

  • sqlite-utils 4.0rc2,主要由 Claude Fable 编写(约花费 149.25 美元)- 2026 年 7 月 5 日
  • 让你的代理使用 shot-scraper 视频录制其工作过程的视频演示 - 2026 年 6 月 30 日
  • 将 Moebius 0.2B 图像修复模型移植到浏览器中使用 Claude Code - 2026 年 6 月 22 日

#primary

这是 Simon Willison 于 2026 年 7 月 4 日发布的链接文章。

armin-ronacher

24

ai

2,102

openai

426

generative-ai

1,859

llms

1,826

anthropic

305

llm-tool-use

72

coding-agents

219

pi

5

月度简报

每月赞助 10 美元,获取精选的本月最重要的 LLM 发展摘要电子邮件。

少给我发点邮件,多给我点赞助!

赞助并订阅

.metabox

#secondary

#wrapper

  • 披露信息
  • 制作团队
  • ©
  • 2002
  • 2003
  • 2004
  • 2005
  • 2006
  • 2007
  • 2008
  • 2009
  • 2010
  • 2011
  • 2012
  • 2013
  • 2014
  • 2015
  • 2016
  • 2017
  • 2018
  • 2019
  • 2020
  • 2021
  • 2022
  • 2023
  • 2024
  • 2025
  • 2026