新开源模型:MiniMax M3 已上线 Arena!
MiniMax M3 是首个开源权重模型,同时支持文本、视觉、文档和代码任务,在 SWE-Bench Pro 等基准测试中表现优异,上下文长度达 1M tokens。
入选理由:MiniMax M3 在 SWE-Bench Pro 达到 59.0%,Terminal Bench 2.1 达 66.0%,是当前开源模型中编程能力最强之一。
公司
别名:lmarena_ai
发布Agent Arena相关研究的AI公司
已跟踪 5 条高相关材料
最近变化
2026-07-20 · 文章未提供可执行的技术方案
为什么值得关注
lmarena.ai 被反复提及时,通常意味着它正在影响产品路线、开发者工作流或 AI 产业判断。这个页面把分散材料合并成一个可持续更新的观察入口。
New open model: MiniMax M3 by @MiniMax_AI is live in the Arena! Find it across Text, Vision, Docume...
lmarena.ai(@lmarena_ai) · 7.5 分
MiniMax M3 是首个开源权重模型,同时支持文本、视觉、文档和代码任务,在 SWE-Bench Pro 等基准测试中表现优异,上下文长度达 1M tokens。
Asked Gemini 3.5 Flash to render the Petra Treasury. It built the entire stone canyon around it - so...
lmarena.ai(@lmarena_ai) · 7 分
Gemini 3.5 Flash在渲染Petra Treasury时自主构建了周围石峡谷并添加环境音效,展现了超越其他前沿模型的能动性行为。
GLM-5.2 (Max) also moves the Pareto Frontier for Code Arena: Frontend.
lmarena.ai(@lmarena_ai) · 6 分
GLM-5.2 (Max)在前端代码生成领域取得进展,但信息密度较低,缺乏具体机制和数据支撑。
已收录 5 条与 lmarena.ai 相关的内容,按评分排序。
MiniMax M3 是首个开源权重模型,同时支持文本、视觉、文档和代码任务,在 SWE-Bench Pro 等基准测试中表现优异,上下文长度达 1M tokens。
入选理由:MiniMax M3 在 SWE-Bench Pro 达到 59.0%,Terminal Bench 2.1 达 66.0%,是当前开源模型中编程能力最强之一。
Gemini 3.5 Flash在渲染佩特拉宝库时自主构建了周围石峡谷并添加环境音效,展现了超越其他前沿模型的能动性行为。
入选理由:Gemini 3.5 Flash在渲染任务中自主构建了周围石峡谷,而其他模型未做到这点
GLM-5.2 (Max)在前端代码生成领域取得进展,但信息密度较低,缺乏具体机制和数据支撑。
入选理由:GLM-5.2 (Max)在前端代码生成领域取得进展。
文章介绍了当前前端开发领域AI模型的排名情况,但信息密度较低,缺乏深度分析。
入选理由:前端AI模型排名信息有限,缺乏具体数据支持。
文章仅提供博客链接,未披露因果追踪方法的具体技术细节,信息价值有限。
入选理由:文章未提供可执行的技术方案