香蕉和GPT Image之外的第3条路:华人15人团队造出AI生图黑马
华人15人团队Luma AI发布AI生图模型Uni-1.1,以推理生成一体化架构、价格腰斩和广告级落地能力,冲入全球前三,成为OpenAI与Google之外的最优解,重新定义品牌视觉生产的可控性与效率。
入选理由:Uni-1.1将推理与生成融合于单一模型,实现品牌一致性、多参考图约束和按句编辑,解决传统AI生图不可控痛点。
公司
别名:arena
提供AI模型评估服务的公司
已跟踪 30 条高相关材料
最近变化
2026-09-02 · Qwen3.8-Max-0902在WebDev赛道获得1,691分,位列Code Arena总榜第一
为什么值得关注
Arena.ai 被反复提及时,通常意味着它正在影响产品路线、开发者工作流或 AI 产业判断。这个页面把分散材料合并成一个可持续更新的观察入口。
香蕉和GPT Image之外的第3条路:华人15人团队造出AI生图黑马
量子位 · 9.2 分
华人15人团队Luma AI发布AI生图模型Uni-1.1,以推理生成一体化架构、价格腰斩和广告级落地能力,冲入全球前三,成为OpenAI与Google之外的最优解,重新定义品牌视觉生产的可控性与效率。
In Agent Arena, we measure models on millions of real-world, long-horizon agentic tasks from a globa...
lmarena.ai(@lmarena_ai) · 8.5 分
Agent Arena平台通过真实任务评估模型性能,Inkling-Small在性价比上表现突出。
Qwen-Image-3.0-Pro is #5 overall in the Text-to-Image Arena (1263 pts), compared to Qwen-Image-2.0-P...
lmarena.ai(@lmarena_ai) · 8.5 分
Qwen-Image-3.0-Pro在文本到图像生成领域排名跃升至第五,得分1263分,显著优于前代模型。
已收录 30 条与 Arena.ai 相关的内容,按评分排序。
华人15人团队Luma AI发布AI生图模型Uni-1.1,以推理生成一体化架构、价格腰斩和广告级落地能力,冲入全球前三,成为OpenAI与Google之外的最优解,重新定义品牌视觉生产的可控性与效率。
入选理由:Uni-1.1将推理与生成融合于单一模型,实现品牌一致性、多参考图约束和按句编辑,解决传统AI生图不可控痛点。
Agent Arena平台通过真实任务评估模型性能,Inkling-Small在性价比上表现突出。
入选理由:Inkling-Small参数量276B,价格仅为Inkling的1/2.2
通义千问Qwen-Image-3.0-Pro在文本生成图像领域排名全球第五,性能较前代提升显著。
入选理由:Qwen-Image-3.0-Pro在Text-to-Image Arena获得1263分,排名全球第五。
通义万相3.0-Pro在文本到图像生成榜单排名第五,得分1263分,较前代模型提升显著。
入选理由:Qwen-Image-3.0-Pro在Text-to-Image Arena榜单排名第五,得分1263分
Qwen-Image-3.0-Pro在文本到图像生成领域排名跃升至第五,得分1263分,显著优于前代模型。
入选理由:Qwen-Image-3.0-Pro在Text-to-Image Arena排名从第15跃升至第5,得分提升72分。
腾讯Hy3模型在Agent Arena和前端代码领域排名前列,展现工具使用优势。
入选理由:Hy3在Agent Arena开放权重模型中排名第2,整体排名第25
Kimi K3在前端开发基准测试中超越Fable 5和GPT 5.6,成为当前最佳开源模型。
入选理由:Kimi K3拥有2.8万亿参数,是目前最大的开源模型
Agent Arena 是一个用于评估智能体在现实世界中因果效应的框架,其方法论基于真实场景的实验设计。
入选理由:Agent Arena 使用真实场景进行因果评估,而非仅依赖模拟。
Qwen3.7-Max-Preview 和 Qwen3.7-Plus-Preview 已上线,Alibaba 此前在 Text 领域为 #6,Vision 领域为 #5。
入选理由:Qwen3.7 series models are now available for testing on Arena.
微软MAI-Image-2.6-Preview在单图编辑中排名第三,得分1420分,较前一版本提升19分。
入选理由:MAI-Image-2.6-Preview在单图编辑中获得1420分,排名第三。
Reve 2.0 相比 v1.5 在所有子类别提升 +125 分,尤其在文本渲染、卡通/动漫/奇幻、写实与电影风格图像及肖像方面表现最佳,并在图像编辑榜单中位列第 7。
入选理由:Reve 2.0 相比 v1.5 在所有子类别提升 +125 分,整体性能显著增强。
Arena.ai 面临大规模数据存储挑战,分享了 CDC 复制、临时存储权衡等最佳实践。
入选理由:大规模数据存储需要 CDC 复制等技术来优化性能。
Mustafa Suleyman 提及 MAI-Image-2.5 已上线 Arena.ai 并将在 MAI Playground 和 Microsoft Foundry 推出。
入选理由:MAI-Image-2.5 已上线 Arena.ai
通义千问Qwen3.8-Max-0902在Code Arena中排名第一,且在Pareto前沿以$5/MToken的经济效率领先。
入选理由:Qwen3.8-Max-0902在WebDev赛道获得1,691分,位列Code Arena总榜第一
MAI-Image-2.6模型在文本到图像生成领域排名全球第二,超越多个竞争对手。
入选理由:MAI-Image-2.6在Arena.ai榜单中位列第二,得分为1336分。
Arena.ai与微软等企业联合倡导开放权重模型,认为其对美国AI生态和国家安全至关重要。
入选理由:开放权重模型是美国AI生态系统竞争力的关键
Arena.ai 的 3D 生成测试显示 GPT 5.6 Sol 在复杂场景下表现优于 Fable,但具体技术细节需参考视频内容。
入选理由:GPT 5.6 Sol 在 3D 生成测试中处理复杂提示的准确率比 Fable 高 23%
Arena.ai通过Agent Arena工具实现AI代理评估商业化,8个月达成1亿美元年收入跑率,但技术细节披露有限。
入选理由:AI代理评估工具Agent Arena实现8个月1亿美元营收
MiniMax M3 在文档分析与长文本推理的 Document Arena 中排名第 14,其性价比显著提升该领域的帕累托前沿。
入选理由:MiniMax M3 在 Document Arena 排名第 14,评估维度为文档分析与长文本推理能力。
Google DeepMind发布的Gemini 3.5 Flash在Code Arena前端编码评估中取得突破性成绩,得分1507分,较3 Flash提升70分,并超越3.1 Pro版本,同时输出速度提升2倍以上。
入选理由:Gemini 3.5 Flash在Code Arena: Frontend评估中得分1507分,较Gemini-3 Flash提升70点
文章介绍了Arena.ai平台每周收集数百万用户投票的机制。
入选理由:Arena.ai每周收集数百万用户投票
中美AI差距从278%缩小至2.7%,美国仍保持领先。
入选理由:中美AI差距从278%缩小至2.7%
Anthropic发布Fable 5.1模型并邀请Arena平台测试,但文章缺乏技术细节和工程实践指导。
入选理由:Fable 5.1和Mythos 5.1是Anthropic最新发布的代码与知识工作模型
Arena.ai宣布2026年秋季学术合作计划,资助AI评估领域研究,单个项目最高5万美元。
入选理由:美国大学终身教职教授可申请最高5万美元研究资助
Arena.ai 宣布 Agent Arena 新增分类功能,但文章缺乏技术细节,实用性有限。
入选理由:缓存失效可能导致每秒百万token成本,需优化上下文管理
AnthropicAI的Claude Fable 5在Arena平台进行了60+复杂测试,展示其3D生成和世界构建能力,但缺乏技术细节。
入选理由:Claude Fable 5通过60+复杂测试验证能力
文章介绍了Arena.ai工程团队处理海量数据的最佳实践,但内容信息密度低,缺乏具体技术细节。
入选理由:AI聊天数据在48小时内被废弃的比例很高。
Wan-2.7 I2V在图像到视频生成领域排名第五,得分为1,434,表现优于多个竞品模型。
入选理由:Wan-2.7 I2V在图像到视频生成领域排名第五,得分为1,434。
文章内容信息密度低,缺乏具体技术细节和深度分析,仅提供了一个图像到视频模型的排行榜链接。
入选理由:文章未提供具体技术细节或分析。
文章介绍了Agent Arena的因果追踪方法,但内容过于简略,缺乏深度和具体信息。
入选理由:文章提及因果追踪方法,但未提供具体实现细节。