Incredible price/performance by the GPT-5.6 series on FrontierCode. All Devin users should see the ...
GPT-5.6系列在FrontierCode平台实现价格性能突破,成本下降已自动同步至Devin用户。
入选理由:GPT-5.6 Terra/Luna模型在FrontierCode 1.1更新后成本降低30%
公司
别名:cognition_labs
推文发布者,技术内容平台
已跟踪 30 条高相关材料
最近变化
2026-08-26 · 聊天加载速度提升 55%,INP 指标下降 36%。
为什么值得关注
Cognition 被反复提及时,通常意味着它正在影响产品路线、开发者工作流或 AI 产业判断。这个页面把分散材料合并成一个可持续更新的观察入口。
The State of Model Routing — NVIDIA, Cognition, OpenRouter
AI Engineer · 8.5 分
模型路由在多模型部署中至关重要,NVIDIA、Cognition等公司正推动更智能的模型选择策略。
Incredible price/performance by the GPT-5.6 series on FrontierCode. All Devin users should see the ...
Scott Wu(@ScottWu46) · 8.5 分
GPT-5.6系列在FrontierCode平台实现价格性能突破,成本下降已自动同步至Devin用户。
Read more about our trustworthiness eval, which tests whether models repeat propaganda, comply with ...
Cognition(@cognition_labs) · 8.5 分
模型安全风险可通过后训练显著缓解,开源模型风险并非固有属性,行业协作推动AI安全工具创新。
已收录 30 条与 Cognition 相关的内容,按评分排序。
GPT-5.6系列在FrontierCode平台实现价格性能突破,成本下降已自动同步至Devin用户。
入选理由:GPT-5.6 Terra/Luna模型在FrontierCode 1.1更新后成本降低30%
模型路由在多模型部署中至关重要,NVIDIA、Cognition等公司正推动更智能的模型选择策略。
入选理由:NVIDIA通过NeMo Triton模型提供完整定制化方案
Kimi K3在Devin平台实现接近前沿性能,基准测试得分58.2%且环境管理能力突出。
入选理由:Kimi K3在FrontierCode 1.1测试中得分58.2%,通过率63.6%
Kimi K3在FrontierCode 1.1基准测试中展现接近前沿水平的工程能力,63.6%通过率与58.2%得分验证其实际应用潜力。
入选理由:Kimi K3在FrontierCode 1.1基准中获得58.2%得分与63.6%通过率
模型安全风险可通过后训练显著缓解,开源模型风险并非固有属性,行业协作推动AI安全工具创新。
入选理由:后训练可使模型安全风险降低70%以上(基于Cognition实验数据)
构建生产级AI代理需聚焦上下文控制、确定性流程、状态管理和范围控制,基于Twelve-Factor Agents原则并结合多家公司实践。
入选理由:上下文控制需明确模型可见范围,避免信息过载或缺失
Devin Desktop和CLI现已支持Inkling和Grok 4.5模型,并推出FrontierCode排行榜跟踪代码生成质量。
入选理由:Devin Desktop和CLI新增支持Inkling及Grok 4.5模型
Cognition推出的FrontierCode排行榜现已上线,实时追踪能生成实际可合并代码的模型表现,包含Grok 4.5和Inkling等模型的评分及方法论。
入选理由:FrontierCode排行榜包含Grok 4.5和Inkling等模型的代码生成能力评分
Devin 现在在每次代码审查中自动进行安全审查,能发现扫描工具遗漏的漏洞并提供修复建议。
入选理由:Devin 现在在每次代码审查中自动进行安全审查。
Cognition 公司推出 AI 生产力保证计划,投入 1000 万美元证明 Devin 能够提升工程产出。
入选理由:Cognition 投入 1000 万美元作为 AI 生产力保证,证明 Devin 的工程产出价值。
Cognition公司在收购Windsurf满一年后,将其彻底整合到Devin Desktop中,形成统一的Agent管理和开发平台。
入选理由:Windsurf已停止服务,由全新Devin Desktop替代
异步代理时代正在重新定义软件开发,强调代理编排和端到端开发,而非单纯依赖开发者本地工作流。
入选理由:异步代理通过代理编排实现端到端开发,显著提升效率。
文章探讨了异步代理技术如何推动工程实践变革,包括80%的AI提交和7倍PR增长的具体案例。
入选理由:Devin通过异步代理技术将Cognition仓库的提交比例从16%提升至80%。
Vlad Feinberg的指南指出,掌握LLM内核级调优和MoE架构优化是进入前沿实验室的关键,同时Agent自动化和可观测性成为基础设施新趋势。
入选理由:掌握LLM内核调优(如JAX/Pallas)是进入前沿实验室的最直接路径,需能手写代码实现MoE层优化
人类与AI Agent的最佳协作方式尚未被发明,当前基于session和prompt的交互模式存在根本缺陷,Paperboy团队正在探索更自然的AI协作体验。
入选理由:现有AI Agent产品基于session和prompt的交互模式存在根本性缺陷,无法提供连续协作体验
OpenAI宣布弃用其微调API,标志着微调时代的结束。尽管如此,顶级AI公司仍在增加开放模型的微调和使用。研究基准测试难度不断增加,代理系统在科学和数学领域取得突破,检索和搜索基准测试奖励小型专业化模型。
入选理由:OpenAI弃用微调API,标志着微调时代的结束。
Cognition以260亿美元估值完成10亿美元D轮融资,成为最大独立AI智能体实验室;ARR预计年底超10亿美元;推理优化转向架构级改进,EAGLE 3.1、vLLM等显著提升长上下文稳定性与吞吐效率。
入选理由:Cognition D轮融资10亿美元,估值达260亿美元, 成为最大独立AI智能体实验室(2026年5月)
Sonnet 5模型在Devin Desktop/CLI中将临时减少30%配额消耗,8月31日后恢复原配额标准。
入选理由:Sonnet 5在2026年8月31日前消耗配额比Sonnet 4.6减少30%
Cognition推出AI生产力保障计划,承诺若Devin提供的工程价值低于费用,将资助用户直至达标,上限1000万美元,推动行业从Token消耗转向实际产出。
入选理由:Cognition为Devin提供最高1000万美元的AI生产力保障,覆盖价值不足时的使用成本。
Cognition推出AI生产力保证计划,以Devin任务节省的有效工程工时替代Token消耗量作为价值衡量标准,若交付价值低于付费金额则由官方补贴最高1000万美元,推动行业从活动指标转向产出指标。
入选理由:Cognition发布AI生产力保证,若Devin产出价值低于费用,官方补贴使用费直至达标,上限1000万美元。
文章探讨了在大规模代理开发中验证端到端测试能力的实践经验,强调了虚拟机技术的重要性。
入选理由:文章分享了在Devin虚拟机中构建端到端测试能力的经验。
Harvey工程团队将内部后台Agent Spectre集成至Devin Desktop,实现组织上下文在工程师本地设备驻留并跨AI Agent流转。
入选理由:Harvey将内部Agent Spectre集成到Devin Desktop,打通工具链上下文。
Cognition 宣布推出 Devin for Security,将 AI 工程师能力引入安全修复场景,应对 AI 加速漏洞利用与防御工具滞后之间的矛盾。
入选理由:安全修复本质是工程产能问题,而非单纯工具或流程问题。
3月31日,恶意篡改的 axios 包悄然发布,隐藏依赖 impersonator;Cognition 的 Devin Review 在公开披露前一小时内即检测并告警客户。
入选理由:恶意 axios 版本通过隐藏依赖 impersonator 实施供应链攻击
Cognition 的 Devin 工具可自动识别安全漏洞并生成修复代码,提升开发效率与安全性。
入选理由:每个安全漏洞都会被标记为 CWE ID 并按严重程度排序。
/handoff 是 Devin CLI 的强大功能,允许用户关闭笔记本电脑后,代理继续在云端工作。Cognition 现已开源该功能。
入选理由:/handoff 功能允许用户关闭笔记本电脑后,代理继续在云端工作。
Cognition与OpenAI合作,在Devin平台以五折优惠提供GPT-5.5,优惠持续至5月14日。GPT-5.5提升了Devin的自主运行能力,能发现并修复其他模型难以捕捉的生产问题。
入选理由:Cognition与OpenAI合作推广GPT-5.5。
Cognition 通过重建 Devin 的渲染器,实现了聊天加载速度提升 55% 和 INP 下降 36%。
入选理由:聊天加载速度提升 55%,INP 指标下降 36%。
Devin Desktop 现支持 Gemini 3.7 Flash,性能达 Claude Sonnet 5 级且成本降低 50%。
入选理由:Gemini 3.7 Flash 在 FrontierCode 1.1 上性能达 Claude Sonnet 5 级
Grok 4.6在Devin中发布,性能超越GPT-5.6 Sol但落后于Opus 5和Fable 5,适用于代码分析场景。
入选理由:Grok 4.6在代码探索和根因分析能力上优于Grok 4.5