Claude 4.8炸场!部分能力超过Mythos,支持数百子智能体并行
Claude Opus 4.8发布,代码缺陷漏报率降至4.7版的1/4,硬编答案概率降为1/10;新增动态工作流支持数百子智能体并行执行任务,Bun项目实测产出75万行Rust代码、99.8%测试通过。
入选理由:Opus 4.8代码缺陷漏报率仅为Opus 4.7的25%,硬编答案行为概率下降至1/10
产品
别名:Devin AI
Cognition实验室开发的AI辅助编程工具
已跟踪 30 条高相关材料
最近变化
2026-08-26 · 聊天加载速度提升 55%,INP 指标下降 36%。
为什么值得关注
Devin 被反复提及时,通常意味着它正在影响产品路线、开发者工作流或 AI 产业判断。这个页面把分散材料合并成一个可持续更新的观察入口。
Claude 4.8炸场!部分能力超过Mythos,支持数百子智能体并行
量子位 · 8.7 分
Claude Opus 4.8发布,代码缺陷漏报率降至4.7版的1/4,硬编答案概率降为1/10;新增动态工作流支持数百子智能体并行执行任务,Bun项目实测产出75万行Rust代码、99.8%测试通过。
Grok 4.6 is now available in Devin. Grok 4.6 marks a significant improvement over Grok 4.5, surpass...
Cognition(@cognition_labs) · 8.5 分
Grok 4.6在Devin中发布,性能超越GPT-5.6 Sol,但落后于Opus 5和Fable 5。
Incredible price/performance by the GPT-5.6 series on FrontierCode. All Devin users should see the ...
Scott Wu(@ScottWu46) · 8.5 分
GPT-5.6系列在FrontierCode平台实现价格性能突破,成本下降已自动同步至Devin用户。
已收录 30 条与 Devin 相关的内容,按评分排序。
Claude Opus 4.8发布,代码缺陷漏报率降至4.7版的1/4,硬编答案概率降为1/10;新增动态工作流支持数百子智能体并行执行任务,Bun项目实测产出75万行Rust代码、99.8%测试通过。
入选理由:Opus 4.8代码缺陷漏报率仅为Opus 4.7的25%,硬编答案行为概率下降至1/10
Grok 4.6在Devin中发布,性能超越GPT-5.6 Sol,但落后于Opus 5和Fable 5。
入选理由:Grok 4.6性能超过GPT-5.6 Sol,但落后于Opus 5和Fable 5
GPT-5.6系列在FrontierCode平台实现价格性能突破,成本下降已自动同步至Devin用户。
入选理由:GPT-5.6 Terra/Luna模型在FrontierCode 1.1更新后成本降低30%
Kimi K3在Devin平台实现接近前沿性能,基准测试得分58.2%且环境管理能力突出。
入选理由:Kimi K3在FrontierCode 1.1测试中得分58.2%,通过率63.6%
Kimi K3在FrontierCode 1.1基准测试中展现接近前沿水平的工程能力,63.6%通过率与58.2%得分验证其实际应用潜力。
入选理由:Kimi K3在FrontierCode 1.1基准中获得58.2%得分与63.6%通过率
Devin 现在在每次代码审查中自动进行安全审查,能发现扫描工具遗漏的漏洞并提供修复建议。
入选理由:Devin 现在在每次代码审查中自动进行安全审查。
Cognition 公司推出 AI 生产力保证计划,投入 1000 万美元证明 Devin 能够提升工程产出。
入选理由:Cognition 投入 1000 万美元作为 AI 生产力保证,证明 Devin 的工程产出价值。
LangSmith Sandboxes通过隔离执行环境安全运行不受信任的代理代码,有效防止如'sci-holude'供应链攻击等风险,适用于AI代理在软件工程、数据分析等场景。
入选理由:75% of Google code is AI-generated, 41% of GitHub commits from AI, 需LangSmith Sandboxes防止安全风险。
文章探讨了异步代理技术如何推动工程实践变革,包括80%的AI提交和7倍PR增长的具体案例。
入选理由:Devin通过异步代理技术将Cognition仓库的提交比例从16%提升至80%。
Sonnet 5模型在Devin Desktop/CLI中将临时减少30%配额消耗,8月31日后恢复原配额标准。
入选理由:Sonnet 5在2026年8月31日前消耗配额比Sonnet 4.6减少30%
Cognition推出AI生产力保障计划,承诺若Devin提供的工程价值低于费用,将资助用户直至达标,上限1000万美元,推动行业从Token消耗转向实际产出。
入选理由:Cognition为Devin提供最高1000万美元的AI生产力保障,覆盖价值不足时的使用成本。
Cognition推出AI生产力保证计划,以Devin任务节省的有效工程工时替代Token消耗量作为价值衡量标准,若交付价值低于付费金额则由官方补贴最高1000万美元,推动行业从活动指标转向产出指标。
入选理由:Cognition发布AI生产力保证,若Devin产出价值低于费用,官方补贴使用费直至达标,上限1000万美元。
文章探讨了在大规模代理开发中验证端到端测试能力的实践经验,强调了虚拟机技术的重要性。
入选理由:文章分享了在Devin虚拟机中构建端到端测试能力的经验。
Cognition Labs宣布Devin现在可以在Windows虚拟机中本地运行,从而能够构建、运行和测试原生Windows应用程序。
入选理由:Devin现在支持在Windows虚拟机中本地运行。
Cognition Labs 宣布 Devin 现在支持 Windows 原生工具链,包括 MSBuild、IIS、PowerShell 和 SQL Server 等,并且在这些系统实际依赖的环境中运行。Devin for Windows 提供了企业级的安全和治理控制,如隔离会话、不使用客户代码进行训练,以及符合 SOC 2 Type II 和 ISO 27001 标准,支持单点登录和基于角色的访问控制。
入选理由:Devin now supports Windows-native toolchains such as MSBuild, IIS, PowerShell, and SQL Server.
Cognition 宣布推出 Devin for Security,将 AI 工程师能力引入安全修复场景,应对 AI 加速漏洞利用与防御工具滞后之间的矛盾。
入选理由:安全修复本质是工程产能问题,而非单纯工具或流程问题。
Cognition 的 Devin 工具可自动识别安全漏洞并生成修复代码,提升开发效率与安全性。
入选理由:每个安全漏洞都会被标记为 CWE ID 并按严重程度排序。
Devin Review 现在在 PR 审查过程中自动扫描安全漏洞,提供修复建议。
入选理由:Devin Review 现在支持在 PR 审查过程中自动扫描安全漏洞。
Cognition与OpenAI合作,在Devin平台以五折优惠提供GPT-5.5,优惠持续至5月14日。GPT-5.5提升了Devin的自主运行能力,能发现并修复其他模型难以捕捉的生产问题。
入选理由:Cognition与OpenAI合作推广GPT-5.5。
Cognition 通过重建 Devin 的渲染器,实现了聊天加载速度提升 55% 和 INP 下降 36%。
入选理由:聊天加载速度提升 55%,INP 指标下降 36%。
Grok 4.6在Devin中发布,性能超越GPT-5.6 Sol但落后于Opus 5和Fable 5,适用于代码分析场景。
入选理由:Grok 4.6在代码探索和根因分析能力上优于Grok 4.5
AI将在未来两年内主导80%的代码编写,但人类仍负责决策和审查。
入选理由:Devin当前负责41%的PRs,显示AI已参与核心开发工作
Cognition 获得 10 亿美元融资,估值达 250 亿美元,其产品 Devin 在 AI 编程领域表现突出。
入选理由:Cognition 获得 10 亿美元融资,估值达 250 亿美元。
Cognition分享了Devin虚拟机的端到端测试能力,强调了大规模验证的实施细节。
入选理由:Cognition在Devin虚拟机中实现了端到端测试。
Scott Wu分享了他在77秒内完成Expert级别的Minesweeper游戏,并宣布Devin现在支持Windows虚拟机。这可能意味着Devin平台增加了对Windows环境的支持,使得用户可以在该平台上运行Windows应用程序和游戏。
入选理由:Scott Wu在77秒内完成了Expert级别的Minesweeper游戏。
GPT-5.6 Sol在FrontierCode 1.1基准测试中实现70%性能优化,但未披露具体技术细节。
入选理由:GPT-5.6 Sol在FrontierCode 1.1测试中实现70%性能提升
Cognition公司强调在权衡中选择最大化野心的方向,其产品Devin经过改进后已达到可用状态。
入选理由:Cognition的Devin产品在2024年推出后经过改进,现已达到可用状态。
Grok 4.6在Devin平台发布,性能超越GPT-5.6 Sol但落后于Opus 5和Fable 5。
入选理由:Grok 4.6性能超越GPT-5.6 Sol但落后于Opus 5和Fable 5
Cognition为初创企业提供65,000美元Devin积分,声称可提升工程效率。
入选理由:初创企业可申请最高65,000美元Devin积分
Kimi K3现已集成到Devin Desktop和CLI,其在FrontierCode 1.1测试中表现接近前沿水平。
入选理由:Kimi K3在FrontierCode 1.1测试中达到接近前沿的性能