Claude 通过率不到4%,SaaS-Bench撕碎了Computer-Use的「全自动办公」幻想
SaaS-Bench评测显示主流大模型在真实办公任务中完全通过率不足4%,揭示AI全自动办公仍面临巨大挑战。
入选理由:Claude Opus 4.7在106个真实办公任务中仅完全通过3.8%(4个)
公司
别名:月之暗面
提供AI相关服务的企业
已跟踪 30 条高相关材料
最近变化
2026-09-02 · Jeff Dean等核心成员创办Discovery Loop专注科学发现
为什么值得关注
Kimi 被反复提及时,通常意味着它正在影响产品路线、开发者工作流或 AI 产业判断。这个页面把分散材料合并成一个可持续更新的观察入口。
Claude 通过率不到4%,SaaS-Bench撕碎了Computer-Use的「全自动办公」幻想
量子位 · 9.2 分
SaaS-Bench评测显示主流大模型在真实办公任务中完全通过率不足4%,揭示AI全自动办公仍面临巨大挑战。
AI 做 PPT 我的一些心得体会,仅供参考。 用 AI 操作 PowerPoint 去做 PPT 的思路本身不 AI Native,不是说不能操作 PowerPoint,而是做出来不好看,因为目前...
宝玉(@dotey) · 8.5 分
AI生成PPT需结合HTML与Design System,避免依赖模板。当前AI操作PowerPoint效果不佳,最佳实践是用HTML生成网页PPT再转PPTX。
#680.OpenRouter CEO Alex Atallah:为什么中国开源模型正在碾压美国
跨国串门儿计划 · 8.5 分
中国开源模型在技术进展和企业应用上对美国形成显著优势,但存在国内限制。中美差距源于中国模型的快速迭代与美国开放权重模型的落后。
已收录 30 条与 Kimi 相关的内容,按评分排序。
SaaS-Bench评测显示主流大模型在真实办公任务中完全通过率不足4%,揭示AI全自动办公仍面临巨大挑战。
入选理由:Claude Opus 4.7在106个真实办公任务中仅完全通过3.8%(4个)
AI生成PPT需结合HTML与Design System,避免依赖模板。当前AI操作PowerPoint效果不佳,最佳实践是用HTML生成网页PPT再转PPTX。
入选理由:Claude Design采用HTML生成PPT,保证美观且可二次编辑
中国开源模型在技术进展和企业应用上对美国形成显著优势,但存在国内限制。中美差距源于中国模型的快速迭代与美国开放权重模型的落后。
入选理由:GLM 5.2 是开放权重模型的重大突破,中国模型海外能力远超国内版本
引入AI员工需付出调试磨合、数据结构化和模型可靠性三重代价,实际落地仍需人类主导。
入选理由:调试和磨合阶段占AI员工部署成本的60%以上
真正的AI护城河在于数据、工程和基础设施,而非架构创新。卡内基梅隆大学教授Russ Salakhutdinov预测AGI短期内难以实现,模型竞争将转向产品化,预测系统可能取代传统咨询。
入选理由:AGI短期内无法实现,核心突破在数据和工程而非架构
Kimi模型团队在GTC keynote中展示了万亿参数模型、线性注意力机制和注意力残差技术,显著提升效率和性能。
入选理由:Kimi Linear线性注意力机制全面超越传统注意力机制
大模型参数规模突破T级得益于新型架构如Gated Delta Networks和Mamba的创新,英伟达、Kimi、Qwen等均采用混合架构优化性能。
入选理由:Gated Delta Networks基于Mamba思想,提升模型效率。
Dify平台推出Qubrid AI插件,通过单一API密钥集成DeepSeek、Kimi等多模型,解决AI应用开发中频繁切换模型的痛点。
入选理由:Qubrid AI插件支持DeepSeek、Kimi、Qwen等6大模型的一站式接入
小鹏汽车借助亚马逊云科技构建AI研发平台,实现代码覆盖率超70%,缺陷修复时间压缩至10分钟。
入选理由:小鹏汽车使用亚马逊云科技的Kiro、Bedrock等服务,实现AI代码覆盖率超过70%。
今年最值得升级的生产力工具,可能是一整张 AI 工位。文章推荐了五款 AI 工具,包括 Gemini 深度研究、Kimi、飞书 + Obsidian、Plaud、GPT-Image-2 + TapNow、Claude Code、Codex、清闲 OC1 Pro。这些工具在搜索、知识管理、会议记录、视觉表达、需求表达等方面提供了高效解决方案,帮助用户节省时间,提高工作效率。
入选理由:Gemini 深度研究和 Kimi 在搜索和中文资料处理方面表现出色,帮助用户快速整理信息和资料。
Databricks 提供了一个可靠的 LLM 推理平台,支持大规模多租户系统,通过先进的硬件和软件优化实现高可用性和低延迟。
入选理由:Databricks 平台支持多种前沿模型,包括开源和专有模型。
马斯克与 Anthropic 结盟后,Cursor 公司通过开发自己的 coding agent 产品来提升编程模型的质量。
入选理由:模型厂商应开发自己的 coding agent 产品以获得高质量的强化学习数据。
Tasklet 通过重构技术栈,打造多模型中立平台,未来软件将分为横向平台、Headless API 和解决方案公司三类。
入选理由:Tasklet 六个月推翻所有代码,转向通用 AI Agent 平台。
Kimi WebBridge让AI Agent像真人一样操作浏览器,挑战Codex封闭生态。
入选理由:Kimi WebBridge实现AI Agent与浏览器的深度交互
Hermes 支持配置多个国内外 AI 模型,包括 GPT-5.5、Grok-4.3、Gemini 等。
入选理由:订阅 ChatGPT Plus 可配置 gpt-5.5 模型
Kimi K2.6通过TiDB Cloud实现“人手一个数据库”,解决AI Agent建站的成本、规模与性能难题。
入选理由:TiDB Cloud的Serverless Cluster支持百万级独立数据库实例,单位经济可行。
Google DeepMind因人才流失和Gemini模型延迟面临挑战,中国开源模型崛起成为竞争焦点。
入选理由:Jeff Dean等核心成员创办Discovery Loop专注科学发现
无问芯穹作为中立AI基础设施服务商,支撑国产大模型Token爆发,日均调用量两年增20倍,获近22亿融资,成AGI时代核心枢纽。
入选理由:Agent时代推动单次任务Token消耗飙升至十万甚至百万级,倒逼AI底层架构升级。
通过集成AI模型和中文优化,Obsidian可升级为强大的Epub阅读器,支持本地模型调用和多模型配置。
入选理由:支持Codex、Claude、Grok CLI及DeepSeek等7个主流AI模型
作者预测2026年将是AI发展的关键一年,开放模型将面临更多挑战和机遇。
入选理由:2026年将是AI发展的关键一年,开放模型将面临更多挑战和机遇。
Cursor发布Composer 2.5模型,以Kimi为基础并投入85%总算力进行自研训练,性能接近Claude Opus 4.7但成本仅为十分之一,通过定向反馈RL和25倍合成数据实现技术突破。
入选理由:Composer 2.5在SWE-Bench等基准测试中表现接近Claude Opus 4.7,但价格仅为后者的1/10。
GPT-5.5 在推理能力与简洁性上实现显著突破,开发者 Greg Brockman 和 DHH 均表示其性能优于 GPT-4、Kimi 等模型,且在低推理模式下仍保持高效。
入选理由:GPT-5.5 在低推理模式下表现优异,无需切换至 Opus 模型即可满足需求
文章强调开放权重模型对防止AGI被少数公司垄断的重要性,但信息密度较低,缺乏技术细节。
入选理由:开放权重模型是避免AGI被少数实体控制的关键手段
OpenAI试图通过中国官方干预推动开源转向闭源以遏制竞争,但DeepSeek的开源立场可能成为行业定海神针。
入选理由:OpenAI希望中国官方干预将开源转向闭源以遏制Kimi等竞争者
AIEC大会聚焦AI开源、Agent、组织变革等议题,探讨AI对产业与个体的影响。
入选理由:Agent成为当前业界最大共识之一,产品形态趋同后需寻找差异化。
本文汇总了近期AI和科技行业动态,但缺乏技术深度,更多是新闻资讯性质。
入选理由:Codex推出重置套餐,DeepSeek采用峰谷调价策略
AI模型在生成丘吉尔讽刺语任务中表现差异显著,GPT 5.6 Sol Pro胜出,Kimi与Gemini表现欠佳。
入选理由:GPT 5.6 Sol Pro在生成任务中表现最优,Fable次之
Dean Ball警告开源模型可能导致‘AI共产主义’,但文章缺乏技术细节和论证。
入选理由:开源模型可能引发‘AI共产主义’风险,但未提供具体机制说明
Kimi模型在代理编码会话中表现接近2026年Q1最佳公开模型,但文章信息密度低,缺乏深度技术细节。
入选理由:Kimi模型在代理编码场景表现与2026年Q1最佳模型相当
Fable在世界杯预测中表现优于其他主流LLM,但文章缺乏技术细节。
入选理由:Fable准确预测法国队出局及决赛双方,而ChatGPT/Qwen/Kimi仅猜对一方