AI HOT 精选

八天四款前沿模型发布,Kimi K3 跻身第三

6.7内容质量

TL;DR · AI 摘要

八天四款前沿模型发布,Kimi K3 跻身第三 · AI HOT Artificial Analysis @ ArtificialAnlys · X 精选 76 导出 Markdown 2026-07-18 01:11 · 9小时前 在 X...

核心要点

  • 主题聚焦:八天四款前沿模型发布,Kimi K3 跻身第三
  • 来源:AI HOT 精选,建议结合原文判断细节。
  • AI 分析暂不可用,本条为保底评分与摘要。
#AI#产品
打开原文

八天四款前沿模型发布,Kimi K3 跻身第三 · AI HOT

Artificial Analysis

@

ArtificialAnlys

· X

精选

76

导出 Markdown

2026-07-18 01:11

·

9小时前

在 X 看原推

x.com

精选理由

八天四个前沿模型,Frontier 从两家实验室变成六家,前三名分差仅三分,而且价格正在暴跌,模型选型的逻辑从「谁第一」变成了「够用且便宜」——对产品经理来说是真正的转折点。

AI 摘要

过去八天内,Grok 4.5、GPT-5.6、Muse Spark 1.1 与 Kimi K3 四款前沿模型相继发布,使 Artificial Analysis Intelligence Index 得分超 50 的实验室从 6 月初的 2 家增至 6 家。

正文 · AI 翻译

中文

原文

前沿已经打开:八天内四次前沿发布——Grok 4.5、GPT-5.6、Muse Spark 1.1,以及昨天的Kimi K3;目前有六家实验室的模型在Artificial Analysis智能指数上得分超过50,而六月初只有两家。

@SpaceXAI的Grok 4.5(高,Artificial Analysis智能指数得分:54)于7月8日发布,@OpenAI的GPT-5.6 Sol、Terra和Luna(最高分:59、55、51)以及@AIatMeta的Muse Spark 1.1(极高,51)紧随其后于一天后发布,而@Kimi_Moonshot的Kimi K3于昨天发布,得分57——总体排名第三,领先于Claude Opus 4.8(最高分,56)。

该指数上排名前三的模型现在来自三家不同的实验室,且得分仅相差三分。自7月8日以来发布的模型占据了得分前十中的四个席位,自六月初以来则占据了六个席位。

唯一没有变化的是第一名:Claude Fable 5(最高分,60)自6月9日以来一直保持榜首,但其领先优势已从四分缩小到一分,并且其背后的智能价格已经暴跌。

祝贺@elonmusk、@sama、@finkd以及所有四家实验室的团队,度过了非凡的八天。

关键要点:

➤ 前沿领域在六周内从两家实验室扩展到六家。直到六月,只有Anthropic和OpenAI部署了得分在51或以上的模型。GLM-5.2(最高分)在六月中旬将Z AI带入这一行列;上周新增了SpaceXAI和Meta;今天Kimi K3以57分的成绩使Moonshot AI成为第六家

➤ Kimi K3以第三名的成绩首次亮相,其智能体和知识工作得分仅次于前两名。K3在GDPval-AA v2上获得1668 Elo,排名第三,仅次于Claude Fable 5(最高分,1760)和GPT-5.6 Sol(最高分,1748)。在AA-Briefcase(我们的长周期知识工作基准测试)上,它以1547 Elo进入第二名——仅次于Claude Fable 5(最高分,1583),领先于GPT-5.6 Sol(最高分,1495)——其分析质量Elo(1760)与Fable 5(1764)基本持平。在其$3/$15的定价下,每个智能指数任务成本为$0.94,它提供了与Claude Opus 4.8(最高分,$1.80)相当的智能,每个任务的成本大约减半

➤ 近前沿智能在八天内便宜了2-3倍。GPT-5.6 Sol(最高分)的智能指数得分比Claude Fable 5(最高分)低一分,每个任务成本为$1.04,而后者为$2.75。Grok 4.5(高)以$0.31的成本提供54分,不到GPT-5.5(极高,$0.99)的三分之一。在51分这一档,GPT-5.6 Luna(最高分,$0.21)和Muse Spark 1.1(极高,$0.26)的价格低于GLM-5.2(最高分,$0.32),而后者在一周前还是该水平上最便宜的模型。