🎙️ How I AI: Sonnet 5 review & How to run autonomous coding agents from your phone

TL;DR · AI 摘要
🎙️ How I AI: INSERT TITLE S - by Lenny Rachitsky How I AI 🎙️ How I AI: Sonnet 5 review & How to run autonomous coding ag...
核心要点
- 主题聚焦:🎙️ How I AI: Sonnet 5 review & How to run autono
- 来源:Lenny's Newsletter,建议结合原文判断细节。
- AI 分析暂不可用,本条为保底评分与摘要。
🎙️ How I AI:INSERT标题 - 作者:Lenny Rachitsky
How I AI
🎙️ How I AI:Sonnet 5评测与如何从手机运行自主编码代理
您每周的收听内容:How I AI,属于Lenny’s Podcast Network的一部分
Lenny Rachitsky
2026年7月6日
Sonnet 5评测:我进行了64代测试,探究其是否值得
立即收听:YouTube • Spotify • Apple Podcasts
由以下平台支持:Runway —面向图像、视频等的创意AI平台 Hyperagent —部署可处理实际任务的代理舰队
Claire对Anthropic新推出的Sonnet 5进行了真实基准测试。她使用Claude Code实时构建了How I AI Bench,随后对Sonnet 5与Sonnet 4.6、Opus 4.8、GPT-5.5和Gemini 3 Pro在PRD、原型、代理任务和代理个性方面进行盲测。她分析了哪些模型表现优异、哪些失败,以及开发者如何创建可复现的基准测试,以确保在信任下个模型版本前验证其效果。
#### 最重要发现:
- Sonnet 5的定价更接近之前的Sonnet模型而非Opus,但它并不能自动取代两者。在夏季结束前,Sonnet 5的输入令牌费用为每百万2美元,输出令牌费用为每百万10美元,这使其处于一个有趣的中间价位。在Claire的基准测试中,它的表现接近她个人偏好排名的底部,这意味着只有在质量符合特定使用场景时,成本优势才成立。
- 单次体验检查虽然有用,但无法复现——而可复现性才是基准测试真正重要的核心。Claire此前通过这种方式测试过GPT-5.5、GLM-5.2等开源模型,但始终无法跨时间对比结果。How I AI Bench通过冻结输入、固定评分标准以及每次新模型发布时使用相同任务,解决了这一问题。
- Claude Code可以读取历史会话记录,并据此生成与用户实际工作相关的定制化基准测试方案。Claire仅给Claude Code一个简单提示,要求其根据共同完成的工作内容进行评估任务头脑风暴,它便从她的桌面存储会话中提取了相关内容。开发者也可以用Codex实现类似功能,但大多数人并未利用这一上下文信息。
- 使用Claude Code构建一个基于直觉评分并导出JSON的HTML评分页面可能只需45分钟,Claire认为每分钟都值得。她手动对5个模型的64代输出进行了评分,为每个模型分配1-5分的直觉评分并添加了简要注释,发现人工评分结果最终成为整个基准测试中最有价值的部分。
- LLM作为评审的评估方式过于宽松,评分集中在中间区间。Claire让GPT-5.5和Opus 4.8对输出进行评审,但两者评分波动都不够明显。它们错过了Claire通过视觉检查立即发现的问题,例如原型损坏和未遵守线框图约束。目前模型仍无法像人类一样在第一眼截图中捕捉到这些细节。
- Claire的个人偏好与自动化基准测试结果几乎完全相反,她认为自己的判断至少部分正确。LLM评审将Gemini 3 Pro评为最高,Sonnet 4.6评为最低。Claire的排名几乎完全相反。当她使用70/30的Claire权重与LLM权重组合指数时,Sonnet 4.6跃居第一。这种差异表明,在信任自动化评分前,评估标准需要更准确反映她的实际关注点。
- Sonnet 4.6 仍然是 Claire 每日代理工作的首选,原因在于其个性,而非基准测试成绩。她特意购买 API 信用额度在 Sonnet 4.6 上运行 OpenClaw,正是因为喜欢它与她对话的方式。在语音评估环节中,其他模型均无法达到 Sonnet 4.6 的表现水平,该测试会提出类似“啊,部署又失败了”这样的问题,并观察模型如何回应。
- 对于开发者,Claire 建议使用 GPT-5.5 编写 PRD 文档,使用 Sonnet 4.6 进行原型开发和日常交流,使用 Opus 4.8 或 Sonnet 5 进行代码库导航。这些是基于 Claire 加权指数得出的任务级推荐。在处理复杂且密集的用户界面工作时,Opus 4.8 仍然能证明其溢价价值;对于更简单的任务,Sonnet 4.6 的表现依然稳定。
- How I AI Bench 仅是初版,许多方面仍需优化。代理式漏洞查找任务的难度被低估:所有模型都轻松通过,这意味着该测试无法区分优秀与卓越。Claire 计划淘汰该任务,将更多个人偏好纳入评分标准,并在每次新模型发布时继续盲测基准测试。目标是打造一个真正被实验室重视的基准测试。
#### 本期博客及详细工作流程解析:
为 Sonnet 5 构建定制基准测试,以及结果为何让我意外:https://www.chatprd.ai/how-i-ai/sonnet-5-review-and-custom-benchmark
↳ 如何通过“氛围检查”盲测评估 AI 模型质量:https://www.chatprd.ai/how-i-ai/workflows/how-to-conduct-a-blind-vibe-check-to-evaluate-ai-model-quality
↳ 使用 Claude 代码构建定制 AI 模型基准测试:https://www.chatprd.ai/how-i-ai/workflows/how-to-build-a-custom-ai-model-benchmark-using-claude-code
↳ 如何为 AI 模型基准测试结果创建加权指数:https://www.chatprd.ai/how-i-ai/workflows/how-to-create-a-weighted-index-for-ai-model-benchmark-results
我如何通过 OpenAI Symphony + Linear 在手机上运行自主编码代理 | Alessio Fanelli(Kernel Labs)
由 Firecrawl 提供支持 —— 通过干净的网络数据赋能 AI 代理 Jira 产品发现 —— 通过洞察优先级,自信构建
Kernel Labs 创始人兼 Latent Space 播客联合主持人 Alessio Fanelli 向 Claire 展示了他如何通过 OpenAI Symphony、Linear 和云 VPS 从手机管理自主编码代理。他演示了从“代理提示者”向“代理管理者”的转变,解释了为何 Linear 适合作为异步代理工作的状态机,并分享了追踪令牌成本、清理技能文件、为代理增强感知能力的经验。他还演示了一个截然不同的用例:通过浏览器访问 Codex 在 eBay 上寻找价格低估的 Pokémon 卡片。
- 从“代理提示者”向“代理管理者”的转变是大多数人尚未掌握的关键。Alessio 描述了早期代理工作流程在第二次或第三次干预时如何因本地运行时的摩擦和笨拙的界面而失去动力。转向配备多个通信渠道(Linear、shell、移动设备)的云 VPS,才真正实现了实际的异步管理。
- Symphony 并非魔法,而是一个非常有偏见的 Markdown 规范,告诉模型应该如何行为。Claire 在本期节目中明确指出这一点,这也是对“复杂代理编排”这一令人望而生畏的表述最重要的修正。整个框架只是一个 Markdown 文件,目前模型的成熟度已足以忠实地遵循该规范。
- 每个任务的令牌成本跟踪是大多数代理设置中缺失的基础功能,这应该是行业标准。亚历西奥展示了从1500万到2.21亿个令牌的任务,而那个2.21亿令牌的任务(使应用能够在Vercel上部署)在事后看来完全合理。没有这样的账本,你就无法建立改进规格或工具的反馈循环。
- 每隔几个月就要清理技能文件,否则它们会成为负担。模型有很强的倾向性,会添加指令而不是替换已有指令,因此随时间增长的技能文件最终会产生自相矛盾。亚历西奥的建议是保持文件简短、紧凑,并明确说明代理需要询问的内容,而不是列出所有可能行为的详尽清单。
- 人工智能最大的未开发机会是基于异构数据的商业应用。亚历西奥描述的类别——如交易卡、古董服装和鱼类库存——由于数据不一致、视觉化和依赖上下文,一直难以规模化。大型语言模型(LLMs)是首个足够灵活的处理技术,能够应对这种混乱而无需大量预处理。
- 为代理增加更好的感知能力(如截图、视觉差异、视频)能显著延长自主运行时间。Kernel Labs开发了Glimpse,这是一个为编码代理设计的Playwright扩展,专门针对瓶颈问题——代理在UI中遇到歧义时需要求助,而非编排问题。感知层的工具改进能让运行持续进行。
- 上下文卸载是被低估的人工智能应用场景,值得专门构建。亚历西奥的电子邮件监控设置让他确信没有重要信息被遗漏,这消除了低级别的背景焦虑。同样的逻辑适用于个人理财、库存管理,以及任何需要持续关注信息的领域,这些信息处理消耗的认知资源是你更希望用在其他地方的。
- 《宝可梦卡》演示最清晰地证明了人工智能正在压缩规模曾经带来的信息优势。过去,以1万美元以上的价格找到低估的PSA评级卡,需要比竞争对手投入更多时间、更多人力和更多领域专业知识。拥有浏览器访问权限和自定义定价技能的Codex,将这种优势压缩为一个精心撰写的提示。
- 小型企业是人工智能领域最有趣的故事,但被低估了。亚历西奥在日本的观察表明,小型两到三人团队正在快乐且盈利地运营,这指出了与企业叙事不同的AI机会。人工智能给予单人团队的杠杆作用是不对称的,这种优势大公司无法以相同成本复制。
Alessio Fanelli如何使用Open AI Symphony实现自主编码和宝可梦卡交易工作流:https://www.chatprd.ai/how-i-ai/alessio-fanelli-uses-open-ai-symphony-for-autonomous-coding-and-pokemon-card-trading
↳ 构建AI代理寻找低估的宝可梦卡进行套利:https://www.chatprd.ai/how-i-ai/workflows/build-an-ai-agent-to-find-underpriced-pok-mon-cards-for-arbitrage
↳ 使用OpenAI Symphony和Linear通过AI代理管理器自动化软件开发:https://www.chatprd.ai/how-i-ai/workflows/automate-software-development-with-an-ai-agent-manager-using-openai-symphony-and-linear
如果你喜欢这些内容,请回复告诉我你最想深入了解的内容:AI工作流、招聘、增长、产品策略——任何主题都可以。
下周见,Lenny
附注:想要在新剧集一上线时立即获取吗?点击您最喜欢的播客应用中的“关注”按钮。
上一页 下一页