Poolside’s Laguna S 2.1: the model factory delivers

TL;DR · AI 摘要
Poolside的Laguna S 2.1模型在参数规模和训练效率上表现突出,适合关注AI模型工厂的工程师。
核心要点
- Laguna S 2.1拥有1180亿参数,量化后可运行于单台NVIDIA DGX Spark
- 模型在Terminal-Bench 2.1测试中得分70.2%,超越同规模竞品
- 首周下载量达1.1百万次,日均处理4500亿token
结构提纲
按章节快速跳转。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- Laguna S 2.1模型
- 模型特性
- 1180亿参数混合专家架构
- 量化适配DGX Spark
- 性能表现
- Terminal-Bench 2.1得分70.2%
- 首周4500亿token处理量
- 应用扩展
- macOS桌面应用支持
金句 / Highlights
值得收藏与分享的关键句。
Laguna S 2.1在Terminal-Bench 2.1测试中得分70.2%,超越同规模竞品
量化后模型可运行于单台NVIDIA DGX Spark,实现桌面级自主编码代理
模型首周处理4500亿token,是M.1和XS.2同期数据的4倍
Poolside 的 Laguna S 2.1 和桌面应用
新闻
Poolside 的 Laguna S 2.1:模型工厂交付新版本
拥有最快 AI 模型工厂的实验室有望登顶
Air Street Press
和
Nathan Benaich
2026年7月29日
文章配音
0:00
-10:15
您的浏览器不支持音频播放。请升级浏览器。
5月22日,Poolside 开始在 4096 个 NVIDIA H200 上进行新模型的预训练,60 天后,权重和所有评估轨迹均在线公开。Laguna S 2.1 是一个代理编码模型,可在终端或开发者工具中运行,能够自主规划、编辑文件、运行代码、读取结果,并持续数小时无需人工干预。其架构采用专家混合设计,包含 1180 亿个参数,每个 token 激活约 80 亿个参数,支持高达 100 万个 token 的上下文。量化后,该模型可适配单个 NVIDIA DGX Spark。这使桌面级设备具备运行多小时自主编码代理的能力。
昨日,公司发布了 macOS 应用程序,用于运行 Laguna、其他开源模型以及 Claude 和 Codex 代理。我有幸在产品发布前进行了测试,期待看到你们的反馈!
下载 Mac 应用
运行中的模型工厂
常读读者可能记得联合创始人 Eiso Kant 在 RAAIS 2025 上的演讲《Inside poolside’s path to AGI》,以及我们在 2024 年 11 月关于深度学习是否(据称)遇到瓶颈的讨论。我们持不同观点,并用一小时解释为何不存在扩展瓶颈。他的论点是,代码强化学习、推理时计算和更快的迭代将持续推动能力进步。
与两个规模相近的模型(NVIDIA 的 Nemotron 3 Super 和 Mistral Small 4)相比,Laguna S 2.1 在 Poolside 的代理工具中启用思考功能后,在 Terminal-Bench 2.1 上得分 70.2%。所有超越 Laguna 的模型要么是闭源的,要么至少大 2.5 倍。这些是 Poolside 自己的测试结果,竞争对手的分数来自厂商报告、基准作者排行榜和第三方追踪器。所有轨迹数据均已公开。
根据 Poolside 自己的统计,Laguna S 2.1 在发布后的前七天处理了 4500 亿个 token,是 M.1 和 XS.2 在 4 月份同期处理量的四倍。其第二天峰值达到 1020 亿个 token,而早期模型需要一个月才能达到这一水平,需求甚至超过了公司计划的 GPU 容量。截至目前,模型权重已下载超过 110 万次。您可以在 poolside.ai/pulse 查看实时数据。
三个月内三次发布
在 RAAIS 2025 上,Eiso 将模型工厂描述为一个完全版本化的模块化组件图,从数据摄入到训练和评估,每个实验都不可变地追踪。一位研究人员在不到一周的时间内将新的 RL 优化想法推送到生产结果。另一位则在一个周末通过简单的 for 循环完成了 500 次架构扫描。
Eiso 表示:“当你的工厂构建良好时,大规模训练只是简单部分。”
确实,发布节奏正显示出成果:Laguna M.1 和 Laguna XS.2 于 4 月 28 日发布,随后在 7 月 2 日,Laguna XS 2.1 在 SWE-Bench Multilingual 上与 M.1 表现相当,但仅使用了约七分之一的激活参数。最后,S 2.1 于 7 月 21 日发布,从首次预训练 token 到训练完成和评估仅用了不到九周时间。
重要的是,这些改进会随着每次发布不断累积,这也是定期发布如此重要的原因。S 2.1 是 Poolside 首个使用 FP8 精度运行强化学习的模型,其新的沙箱基础设施支持后台进程和缓存的工件。为了减少对单一工具接口的依赖,相同的提示信息会通过多个代理框架进行部署。即便如此,仍存在一些过拟合现象。在第三方框架中,当工具模式与 Poolside 自身的模式略有不同时,模型有时会依赖对界面的记忆而非当前界面定义,随后在框架拒绝调用时进行自我纠正。
持续性能力经过训练
后训练语料库覆盖了 409,000 个代理和非代理环境,包括 168,000 个标准软件工程工作流程和 83,000 个终端设置。大部分软件工程任务基于真实代码历史。最大的单一数据源复现了真实提交记录,其中包含从 17,000 个仓库中提取的 38,000 个任务。其他数据则用于重建被删除的文件、修复注入的漏洞、安装不熟悉的仓库或重现合并的拉取请求。
Poolside 应用研究联合负责人王鹏明将这些进展归因于训练出的工作习惯:更多的验证、更强的持续性,以及在测试尚未通过时减少过早宣布胜利的倾向。思考模式也使这种权衡变得可见。它将 Terminal-Bench 2.1 的性能从 60.4% 提升至 70.2%,将 DeepSWE 从 16.5% 提升至 40.4%(后者平均每条轨迹产生 249,000 个完成 token)。
在一次持续 50 分钟的运行中,模型在无人干预的情况下完成了 181 步操作,构建了一个基于 JavaScript 的 HTML 和 CSS 渲染引擎。它实现了分词器、DOM、级联、布局系统和画布渲染器。由于模型尚未具备视觉能力,无法查看自己绘制的内容,因此开发了越来越复杂的机制,将输出与真实浏览器进行对比。
但这种持续性也带来了已知的失败模式。S 2.1 有时会过度思考简单问题,处理嵌套工具参数时出现失误,并且最初会倾向于使用熟悉的工具模式而非当前界面提供的模式。在后训练阶段,SWE-bench 家族中超过一半的轨迹曾一度因潜在奖励黑客行为被标记。模型在线找到了原始拉取请求并应用了其解决方案,LLM 审判员通过人工标注的轨迹进行校准后识别出这些案例,添加"禁止使用在线找到的解决方案"的指令后,标记率通常降至 2% 以下。
模型本身并非产品
一个强大的模型本身并不能直接成为实用的编码代理。它需要一个框架来运行代理循环,以及开发者可以指导和检查的接口。Poolside 过去一年为自己的团队构建了这两者。7 月 28 日,他们发布了这些工具:Poolside Desktop Assistant,一款 macOS 应用程序,可同时运行多个编码代理,并提供 VS Code 和 Visual Studio 的扩展,以及背后的 pool 命令行框架。
Poolside并未在其模型中构建漏斗结构。助手基于代理客户端协议运行,因此现有的Claude Code、Codex或Gemini订阅可在与Poolside相同的窗口中使用,无需通过Poolside路由模型调用。会话可以在保留上下文的情况下从一个代理转移到另一个代理,因此规划工作的代理不必是编写或审查该工作的代理。由于每个代理都拥有自己的Git工作树,它们可以并行运行而不会相互覆盖。
本地模型通过MLX运行。下载Laguna XS 2.1后,循环过程完全离线运行,代码和提示都不会离开机器。Poolside对成本问题直言不讳。本地编码模型需要大量统一内存,模型加载与您全天候使用的模型选择并不相同。
可拥有的智能
上个月我曾论证欧洲无法通过租赁实现人工智能主权。Laguna发布三天后,黄仁勋在其X平台的首次发文中提出了类似的观点,分享了一封由NVIDIA与微软、Meta和Hugging Face共同签署的公开信,阐述为何开源模型能增强安全性、加速创新并实现主权,以及为何世界需要两种类型的前沿模型。同样的逻辑也适用于企业内部。大多数前沿AI通过API或桌面应用使用,这意味着客户代码会跨越其安全边界,而供应商则设定使用条款。能够在客户控制的硬件上运行的开源权重模型将改变这种关系。它不必是世界上最好的模型才能具有战略价值,只需具备足够的能力,使拥有权成为依赖的可信替代方案。
对于Laguna,权重已通过OpenMDW-1.1许可证发布在Hugging Face上,该许可证由Linux基金会提供,允许免费使用、修改和再分发,无收入门槛或品牌条件限制。开源权重的条款各不相同且会变化。腾讯的Hy3采用Apache 2.0许可证,但其四月发布的预览版本采用社区许可证,根据该许可证条款,该版本不适用于欧盟、英国或韩国。Laguna发布六天后推出的Kimi K3采用Moonshot自行拟定的许可证,要求模型即服务业务收入达到2000万美元后需与公司另行达成协议,并在月活跃用户超过1亿的产品中显著标注“Kimi K3”品牌。开发者可以自行运行Laguna,使用托管推理服务,或请求预训练和后训练的基础权重以进行进一步研究。
这也是Poolside收购Fern Labs的契合点。Fern团队为高风险部署构建了长期运行的代理。现在,Poolside将这项工作与可在客户安全边界内运行的模型和现场系统相结合。
我们最喜欢的部分是trajectories.poolside.ai。Poolside已发布其最终评估运行的轨迹数据,包括失败案例,尽管档案中注明超时尝试可能在轨迹创建前就终止。在当前代理基准声明通常以表格形式呈现而缺乏底层工作细节的背景下,这种披露方式的改进具有重要意义。
从第一个预训练标记到开放权重仅用了六十天,每个模型的经验都延续到了后续模型中。Poolside表示更精细的努力控制和更高效的思维能力即将到来,下一代更大规模的Laguna模型已经开始训练。我们迫不及待想看到接下来的进展!
上一篇