Better Models: Worse Tools
TL;DR · AI 摘要
Better Models: Worse Tools Simon Willison’s Weblog Subscribe smallhead Sponsored by: Sonar — Gartner just named Sonar a...
核心要点
- 主题聚焦:Better Models: Worse Tools
- 来源:Simon Willison's Weblog,建议结合原文判断细节。
- AI 分析暂不可用,本条为保底评分与摘要。
更优的模型:更差的工具
Simon Willison 的博客
订阅
#smallhead
由以下公司赞助:
Sonar — Gartner 最近将 Sonar 评为 2026 年 Gartner 技术债务管理工具魔力象限™ 的领导者。阅读报告,了解如何衡量和解决代码库中的技术债务。
获取报告
2026 年 7 月 4 日 - 链接博客
Better Models: Worse Tools。Armin 报告了他在使用 Pi 进行开发时遇到的一个奇怪问题:
简短来说,较新的 Claude 模型有时会在嵌套的 edits[] 数组中调用 Pi 的编辑工具时添加额外的虚构字段。而且不是 Haiku 或某个小型模型:Opus 4.8。编辑本身通常是正确的,但参数与模式不匹配,因为模型发明了虚构的键,导致 Pi 拒绝调用工具并要求重试。这本身并不太令人意外,因为模型有时会发出格式错误的工具调用,尤其是小型模型。让我惊讶的是,随着更新的 Anthropic 模型,这种情况变得更糟,因为 Opus 4.8 和 Sonnet 5 都表现出这一问题,而旧模型则没有。换句话说,该系列最先进的模型在特定工具模式上的表现比它们的旧版本更差。
Armin 猜测这是因为最近的 Anthropic 模型经过了特定训练(可能是通过强化学习),以更好地使用内置在 Claude Code 中的编辑工具。这不幸导致其他编码框架(如 Pi)发现自己的自定义编辑工具更可能被错误使用。
Claude 的编辑工具使用搜索和替换,而 OpenAI 的 Codex 使用的是 apply_patch 机制,OpenAI 曾经提到过他们的模型是如何训练以有效使用该工具的。
这意味着像 Pi 这样的第三方编码框架是否应该实现多个编辑工具,以便根据用户选择的基础模型使用性能最佳的那个?
发布于
2026 年 7 月 4 日
晚上 10:53
最新文章
- sqlite-utils 4.0rc2,主要由 Claude Fable 编写(约花费 149.25 美元)- 2026 年 7 月 5 日
- 让你的代理使用 shot-scraper 视频录制其工作过程的视频演示 - 2026 年 6 月 30 日
- 将 Moebius 0.2B 图像修复模型移植到浏览器中使用 Claude Code - 2026 年 6 月 22 日
#primary
这是 Simon Willison 于 2026 年 7 月 4 日发布的链接文章。
armin-ronacher
24
ai
2,102
openai
426
generative-ai
1,859
llms
1,826
anthropic
305
llm-tool-use
72
coding-agents
219
pi
5
月度简报
每月赞助 10 美元,获取精选的本月最重要的 LLM 发展摘要电子邮件。
少给我发点邮件,多给我点赞助!
赞助并订阅
.metabox
#secondary
#wrapper
- 披露信息
- 制作团队
- ©
- 2002
- 2003
- 2004
- 2005
- 2006
- 2007
- 2008
- 2009
- 2010
- 2011
- 2012
- 2013
- 2014
- 2015
- 2016
- 2017
- 2018
- 2019
- 2020
- 2021
- 2022
- 2023
- 2024
- 2025
- 2026