Lenny's Newsletter

🎙️ How I AI: GPT-5.6 review, How a solo builder runs 24/7 local AI, and What an agent harness is and how to build one

7.1内容质量
🎙️ How I AI: GPT-5.6 review, How a solo builder runs 24/7 local AI, and What an agent harness is and how to build one

TL;DR · AI 摘要

🎙️ How I AI: GPT-5.6 review, How a solo builder runs 24/7 local AI, and What an agent harness is and how to build one Ho...

核心要点

  • 主题聚焦:🎙️ How I AI: GPT-5.6 review, How a solo builder
  • 来源:Lenny's Newsletter,建议结合原文判断细节。
  • AI 分析暂不可用,本条为保底评分与摘要。
#AI#编程#后端#云计算#安全
打开原文

🎙️ 我如何使用AI:GPT-5.6评测、独行开发者如何运行24/7本地AI,以及什么是代理夹具及如何构建

我如何使用AI

来自《我如何使用AI》的每周精选内容,属于Lenny's Podcast Network的一部分

Lenny Rachitsky

2026年7月13日

什么是夹具以及如何使用Claude Agent SDK构建一个

现在在YouTube • Spotify • Apple Podcasts收听

由Bolt.new提供支持 ——将你的想法转化为真实产品;Customer.io ——通过单个提示构建客户参与活动

Claire解释了为什么夹具很重要,以及在什么情况下它们比Claude Code或Codex等通用工具更优越,并逐步演示了她为ChatPRD构建的自定义Claude Agent SDK夹具,用于自动化Sentry错误分类。你将看到她如何构建工作流程、编码权限、连接Sentry和Linear等工具,并将重复的工程任务转化为代理可以更稳定执行的流程。

#### 最重要结论:

  • 所谓夹具,不过是围绕AI代理的代码而已,没有其他神秘之处。在工程领域,这个词几乎带有神话色彩,但在这期节目中我将其简化:夹具就是你编写的代码,用于让AI代理在特定任务上更高效。Cursor是一个复杂的夹具,Claude Code也是一个复杂的夹具,你的夹具可能只有8个文件和一个终端UI。
  • 当相同的工作流需要每次相同的设置和相同的结果时,就需要构建夹具。触发点是识别出一个部分确定性(定义步骤、定义工具)和部分非确定性(AI找出根本原因并生成报告)的任务。Sentry错误分类符合这个条件,因为每次调查都遵循相同的证据收集流程,并最终生成相同的产物包。
  • 有偏见的工具适配器比通用MCP访问更适合专用工作流。与其让代理拥有广泛的Sentry MCP访问权限并自行探索追踪记录,我构建了一个自定义的Sentry适配器,仅提取错误报告所需的关键信息。这种精确性使代理运行更快、成本更低,且更不容易偏离脚本。
  • 在夹具中编码权限可以消除每次都需要提示的需要。在通用编码工具中,你必须记住要说明“仅调查,不要编写代码”。在我的夹具中,这只是一个界面中的标志。我点击“调查”,粘贴Sentry链接,代理已经知道自己的约束条件,无需额外说明。
  • 结构化产物是区分单次调查和团队资源的关键。每次我的夹具运行时,都会输出任务日志、Sentry问题摘要、相关日志、工作者报告和HTML总结文件。这个产物包意味着工程团队可以获取所有错误调查的一致、可扫描记录,无需任何人手动编写。
  • 夹具让你能够以单个通用工具永远无法实现的方式进行多模型路由。Claude Code是Claude,Codex是GPT。使用Claude Agent SDK构建的自定义夹具,可以按步骤选择合适的模型,对每次调用实施不同的工具策略,并随时间更换模型而无需改变接口功能。这种灵活性是拥有夹具层的最强有力论据之一。
  • 开放聊天字段曾经足够好,直到它不再足够好。在本期中,我承认仅通过在Claude Code中输入内容就产生了实际的工作成果。但这标志着我思维方式的转变:通用型代理现在更适合用于协调专用工具,而不是亲自完成所有工作。为受约束的代理提供特定工具,比为强大代理提供开放提示能获得更一致的输出。

#### 本期博客:

如何使用Claude Agent SDK构建自定义AI工具进行错误分类:https://www.chatprd.ai/how-i-ai/how-i-built-a-custom-ai-harness

这位独行开发者在自己的硬件上全天候运行本地AI | Alex Finn

由以下平台提供支持:Runway —面向图像、视频等的创意AI平台 Jira Product Discovery —通过洞察优先,自信构建

Claire与Alex Finn讨论了他如何使用Mac Studios、DGX Spark、RTX 5090和自定义仪表板构建全天候本地AI舰队,以确保代理持续运行。Alex详细介绍了每台机器的实际用途,如何在GLM、Qwen和Ornith等本地模型之间分配工作,以及为什么“无限推理”会彻底改变AI工作流程的经济性。他们还讨论了他使用Claude Code构建和审查的循环流程、他的OpenClaw和Hermes设置,以及运行自己的持续软件工厂时令人惊讶的实用操作手册。

  • 本地AI的论据不是投资回报率,而是无限推理能力。价值1万美元的Mac Studio与价值20美元的ChatGPT订阅的数学对比,直到你全天候运行代理时才显得疯狂。在这样的规模下,云API会迅速变得昂贵,而持续运行的本地模型则能开启其他情况下经济上不可行的用例。Alex持续运行安全扫描、代码审查和社会信号监控,这些在云平台上每月可能耗费数千美元的信用额度。
  • 每个硬件层级都有其特定任务。Mac Studio虽然处理大型模型速度较慢,但能实现Opus级别的智能(Alex在单台Mac Studio上运行GLM 5.2,他称之为相当于Opus 4.8的性能)。DGX Spark是最佳选择:128GB的Nvidia统一内存加上CUDA速度,足以让Qwen 3.6等模型快速运行。RTX 5090仅有32GB的VRAM,但具有云平台级别的速度。购买时应根据任务需求而非规格表选择。
  • Tailscale是多机设置的连接纽带。一旦所有机器连接到同一Tailscale网络,一个代理(OpenClaw或Hermes)就可以跨机器跳转,检查硬件,加载合适的模型并启动运行,无需任何手动配置。Alex表示,一旦安装了Tailscale,实际上不需要任何技术知识,即使只有一台机器,他也推荐使用,因为它还能让你通过手机测试本地应用。
  • 本地模型是BDR(基础防御者),Claude Code是最终决策者。Alex的安全扫描循环是一个实际有效的混合模型示例。本地模型(GLM 5.2)每20分钟扫描一次代码,并将结果输出到Markdown文件中。Claude Code每天检查一次该报告,并决定哪些问题需要修复。本地模型以低成本处理大量工作,而前沿模型则精确地进行判断。如果改为每20分钟运行一次Claude Code,每月将耗费数千美元。
  • 软件工厂依赖于两个循环和一个火箭表情符号。每天早上,Alex 会使用 Claude 进行规划会议,通过“晨间构建”提示生成 SaaS 的任务列表。构建循环会接管这些任务并开始交付。审查循环会检查工作成果。当某项工作通过审查时,Alex 会收到 Slack 的通知,若在通知中添加火箭表情符号,就会触发自动合并。他从早间简报直接进入代码审查和合并流程,直到进行批准轮次前都不需要再次触碰键盘。
  • OpenClaw 和 Hermes 满足不同的需求,通常需要同时使用。Alex 更倾向于使用 OpenClaw 来实现“重大突破”时刻的情感连接(他本人的表述)。但 Hermes 在多次更新后表现更稳定。他的解决方案是冗余设计:同时运行三个 Hermes 代理和两个 OpenClaw 代理,这样当五个代理中有三个出现故障(这确实会发生)时,剩下的两个可以进行修复。故障转移是刻意设计的,而非偶然发生。
  • 通过模型智能进行任务分配,是让舰队真正发挥作用的关键技能。GLM 5.2 的智能程度达到 Opus 级别,但速度极慢,因此负责需要深度处理且能容忍延迟的任务。Qwen 3.6 足够快速,能够胜任从 Twitter 中提取产品信号的工作。Ornith 1.0 是经过强化学习微调的 Qwen 版本,专门用于编码,在 Alex 进行的每项评估中都超越了 Qwen,且在 DGX Spark 上运行流畅。关键洞察在于:“让最智能的模型无处不在”是一种浪费;将模型智能与任务复杂度相匹配,才是让环境智能在经济上成立的核心。
  • GPT-5.6 Sol 是我测试过的最实用有效的模型,即使 Fable 在理论上更智能。我在 PRD、原型、线框图、调试和代理语音五个类别上进行了基准测试,在 70% Claire/30% 机器的组合中,Sol 在品味评分上大幅领先。"超智能"与"真正落地"之间的差距是真实存在的,对于产品工作,Sol 赢了。
  • Sol 生成的全保真原型比其他任何测试过的工具都更实用且更有主见。在文档计划器、开发工具事件分类网站和消费者习惯追踪应用的测试中,Sol 一直能产出视觉层次更清晰、语义配色更合理、交互功能更完善的界面设计。Fable 的输出很普通;而 Sol 的设计是我愿意向利益相关者展示的。
  • Sol 的写作方式更容易协作。Fable 的写作风格仿佛从未接触过人类,极其教条且难以理解,尤其在需要协作时。Sol 的写作方式更像普通人,这种差异在迭代 PRD 或整天与代理对话时会迅速累积。
  • 针对 PRD 编写,GPT-5.6 Terra 可能是更好的选择。我让 Sol 为 2026 年重新构建我的 PRD 方法论,虽然 Sol 的输出非常优秀,但 Terra 简洁直接的商业写作风格让我觉得,当需要快速清晰的文档而不需要额外修饰时,Terra 是更合适的选择。
  • Fable 过于固守自己的框架;Sol 更愿意重新考虑。我在原型产品中有一个固化的工具调用循环,只有 GPT-5.5 能运行。Fable 坚称这是模型问题并拒绝妥协。当我切换到 Codex 并告诉它只需修复时,Sol 一次就让 Sonnet 5 运行起来。这种实际的灵活性正是构建真实产品时需要的。
  • Sonnet 5 仍然是我在 Open Claw 中代理语音的最爱。即使经过这次基准测试,我仍给 Sonnet 5 的语音表现打满分:除了破折号外,它听起来最像人类。我用 Sonnet 运行 OpenClaw 并且不会改变这个选择。Sol 在代理语音整体表现上更差,我仍然无法让 GPT 模型在我的 OpenClaw 配置中良好运行。
  • GPT-5.6 通过 Codex 进行视频编辑是我最喜欢的新工作流程之一。我上传了我在 Cursor 活动上演讲的完整录像,要求生成五个宣传视频片段,对节奏和方向给出反馈,然后在极短时间内就得到了可分享的社交视频片段,可以直接导入 CapCut。仅这个用例就足以证明尝试 GPT-5.6 的价值。
  • 使用 Codex 加上 GPT-5.6 和 @Chrome 的浏览器操作是我找到的最佳代理工作流程。我打开 LinkedIn,让它回复高管和 ChatPRD 粉丝的高价值消息,它处理了大约 500 条消息。我也用它来测试网页应用和填写表格。当我临时降级到 GPT-5.5 时,我的工作效率明显下降。学习 @Chrome 并放手让它运行吧。
  • "森林绿"的特征是真实的,所以在提示中要明确说明。Sol 在系统中似乎硬编码了某种森林主题的调色板,对类似自然风格的配色有强烈的审美偏好。你会看到很多绿色。我已经告诉 OpenAI 团队,我在此记录,当需要不同审美方向时,我已在提示中针对这一点进行调整。

如何使用 AI:我的 GPT-5.6 Sol 基准测试 & 4 个颠覆性工作流程(对比 Fable):https://www.chatprd.ai/how-i-ai/my-gpt-56-sol-benchmark-game-changing-workflows

↳ 如何使用 AI 浏览器控制自动化 LinkedIn 消息发送:https://www.chatprd.ai/how-i-ai/workflows/how-to-automate-linkedin-messaging-with-ai-browser-control

↳ 如何快速使用 AI 创建社交媒体视频片段:https://www.chatprd.ai/how-i-ai/workflows/how-to-quickly-create-social-media-video-clips-using-ai

↳ 如何一键使用 AI 构建游戏化作业应用:https://www.chatprd.ai/how-i-ai/workflows/how-to-build-a-gamified-homework-app-with-ai-in-a-single-shot

如果你喜欢这些内容,回复告诉我你最想深入了解的主题:AI 工作流、招聘、增长、产品策略——任何方向都可以。

下周同一时间再见,Lenny

附注:想要第一时间获取新内容?在你最喜欢的播客应用上点击“关注”即可。