DeepSeek-V4-Flash-Vision-Exp is now live on the DeepSeek API Platform! 🚀 🔹 This experimental mult...
DeepSeek发布实验性多模态模型V4-Flash-Vision-Exp,性能接近Opus-4.8。
入选理由:V4-Flash-Vision-Exp在多模态代理基准上超越V4-Flash,接近Opus-4.8性能
模型
别名:Opus
用于代码质量评估的模型
已跟踪 30 条高相关材料
最近变化
2026-08-31 · DeepSeek-V4-Flash-Vision-Exp 支持 JPEG/PNG/GIF/WebP 四种图片格式输入
为什么值得关注
Opus 4.8 被反复提及时,通常意味着它正在影响产品路线、开发者工作流或 AI 产业判断。这个页面把分散材料合并成一个可持续更新的观察入口。
DeepSeek-V4-Flash-Vision-Exp 模型已开源,多模态 Agent 能力接近 Opus-4.8
AI HOT 精选 · 8.5 分
DeepSeek 开源多模态模型 V4-Flash-Vision-Exp,支持图片输入且能力接近 Opus-4.8,采用 MIT 许可证。
DeepSeek-V4-Flash-Vision-Exp is now live on the DeepSeek API Platform! 🚀 🔹 This experimental mult...
DeepSeek(@deepseek_ai) · 8.5 分
DeepSeek发布实验性多模态模型V4-Flash-Vision-Exp,性能接近Opus-4.8。
TDD inside the agent loop - theater or actual value?
Martin Fowler · 8.5 分
TDD在AI代理循环中未显著提升代码质量,非TDD方案在测试质量上表现更优。
已收录 30 条与 Opus 4.8 相关的内容,按评分排序。
DeepSeek发布实验性多模态模型V4-Flash-Vision-Exp,性能接近Opus-4.8。
入选理由:V4-Flash-Vision-Exp在多模态代理基准上超越V4-Flash,接近Opus-4.8性能
DeepSeek 开源多模态模型 V4-Flash-Vision-Exp,支持图片输入且能力接近 Opus-4.8,采用 MIT 许可证。
入选理由:DeepSeek-V4-Flash-Vision-Exp 支持 JPEG/PNG/GIF/WebP 四种图片格式输入
TDD在AI代理循环中未显著提升代码质量,非TDD方案在测试质量上表现更优。
入选理由:Sonnet 4.6评估显示TDD流程未带来明显质量提升
Kimi K3通过后训练和多领域专家模型显著提升性能,接近Opus 4.8水平,采用创新的推理分层和策略蒸馏技术。
入选理由:Kimi K3后训练阶段结合SFT与RL,构建9个领域专家模型(3领域×3推理层级)
Perplexity Computer的新orchestrator模型性能接近前沿,成本仅为Opus的0.344倍,现为第二受欢迎模型。
入选理由:新模型基于GLM 5.2微调,成本仅为Opus的0.344倍
开源模型将主导AI支出增长,专有模型面临经济模型与竞争格局的双重挑战。
入选理由:开源模型在安全领域已达到专有模型水平(如Zhipu GLM 5.2 vs Anthropic Opus)
开源模型将主导AI支出增长,尽管专有模型短期领先,但开源模型在性能和经济性上持续追赶,影响技术选型与预算规划。
入选理由:Zhipu的GLM 5.2在网络安全领域已匹敌Anthropic的Opus 4.8
通过结合Fable 5和Sonnet 5模型,可节省35%的token成本并提升效率。
入选理由:使用Fable 5作为协调器+Sonnet 5工作模型可降低35%成本
Impossible Research发布的新代理框架[schema]在ARC-AGI-3基准测试中表现优异,达到99% RHAE和95.35%得分。
入选理由:框架[schema]使LLM能像物理学家一样推理,达到99% RHAE性能
模型组合策略可显著降低成本,同时保持性能稳定。Fable+Sidekick组合使成本降低54%,Fusion架构优化模型协同效果。
入选理由:Fable+Sidekick组合使成本降低54%且评分几乎不变
Claude Fable 5 分批重新上线,但性能不如 Opus 4.8,同时 GPT-5.6 紧随其后发布。
入选理由:Claude Fable 5 已经在手机端和 AWS 上线,但输出质量不如 Opus 4.8。
结合前沿封闭模型与开源模型可显著提升性能并降低成本,Fireworks AI 的研究验证了这一结论。
入选理由:结合封闭模型与开源模型可提升性能并降低 40-67% 的成本。
Zai_org 的 GLM 系列模型在前端编码能力上迅速接近前沿水平,GLM-5.2 (Max) 已经超越 Opus 4.8 并接近 Claude Fable 5。
入选理由:GLM-5.2 (Max) 的代码能力达到 1595,超越 Opus 4.8。
Claude Tag 让 Claude 以同事身份常驻 Slack,支持任务分配、多人协作和主动工作,适用于企业团队。
入选理由:Claude Tag 支持在 Slack 频道中 @Claude 分配任务,Claude 会拆解任务并逐步完成。
GLM 5.2 是 Z.ai 发布的开源模型,性能接近 Opus 4.8 和 GPT 5.5,且成本更低。
入选理由:GLM 5.2 的性能接近 Opus 4.8 和 GPT 5.5,但成本更低。
GLM 5.2 在性能和效率上表现优异,接近甚至超越 GPT 5.5 和 Opus 4.8。
入选理由:GLM 5.2 在处理长上下文和复杂任务时表现出色。
GLM-5.2 成为全球顶尖前端编码模型,凭借高效推理和 MIT 开源授权引发广泛关注。
入选理由:GLM-5.2 是目前参数量为 744B 的开源模型,性能接近 Opus 4.8。
GLM-5.2 是 Z.AI 推出的最新模型,支持 1M 上下文长度,显著提升长周期任务处理能力,并在多个基准测试中表现优异。
入选理由:GLM-5.2 支持 1M 上下文长度,显著提升长周期任务处理能力。
开源模型在性能和成本上显著优于闭源模型,成为AI领域的优选。
入选理由:GLM 5.2 比 Opus 4.8 快且更高效,成本低 6 倍以上。
Claude Fable 5 在多项基准测试中表现优异,但其高昂成本和部分任务表现不佳可能影响实际应用。
入选理由:Fable 5 在 SWBench Pro 基准测试中达到 80%,显著优于 Opus 4.8、GPT-4.5 和 Gemini 3.1 Pro。
Z AI 发布 GLM-5.2,支持 1M token 上下文窗口,性能超越 GPT-5.5 和 Opus 4.8。
入选理由:GLM-5.2 在长程编程任务中得分为 74.4,优于 GPT-5.5 的 72.6。
GLM 5.2 在 SWE 领域表现强劲,排名第三,仅次于 Fable 5 和 Opus 4.8,且优于 GPT-5.5。
入选理由:GLM 5.2 在 FrontierSWE 排名第三,仅落后于 Fable 5 和 Opus 4.8。
Anthropic 推出 Claude Fable 5,这是其最强大的模型,具备安全机制,适用于广泛场景。
入选理由:Claude Fable 5 是 Mythos 级模型,具备高级安全机制。
OpenRouter Fusion API通过模型融合技术实现接近Fable 5的性能,成本仅为一半。
入选理由:OpenRouter Fusion API使用多模型融合技术,性能接近Fable 5但成本降低50%。
组合多个低价模型可达到接近 Claude Fable 5 的性能,同时成本降低一半。
入选理由:Gemini 3 Flash、Kimi K2.6 和 DeepSeek V4 Pro 组合性能接近 Claude Fable 5。
Anthropic 发布了 Mythos 模型,其能力远超以往所有公开模型,且分为带安全限制的 Fable 和无限制的 Mythos。
入选理由:Mythos 模型能力远超 Anthropic 以往所有公开模型。
Claude Fable 5 显著提升了 AI 能力,但存在使用限制和内容过滤机制。
入选理由:Claude Fable 5 在性能和功能上都有显著提升。
Fable 5模型内置反蒸馏机制,检测到潜在训练行为时会自动降智,误触率远超官方宣称的5%。
入选理由:Fable 5的反蒸馏机制会自动降低回答质量,且不通知用户。
Claude Fable 5在低档位下表现优于Opus 4.8,且在复杂任务中更省成本。
入选理由:Fable 5低档位下表现优于Opus 4.8
Anthropic 发布 Claude Fable 5 和 Mythos 5,前者面向所有用户开放并内置安全机制,后者专供网络安全合作伙伴使用。
入选理由:Fable 5 通过降级机制保障安全,95% 的对话不会触发降级。