Simon Willison's Weblog

Kimi K3, and what we can still learn from the pelican benchmark

7.1内容质量
Kimi K3, and what we can still learn from the pelican benchmark

TL;DR · AI 摘要

Kimi K3, and what we can still learn from the pelican benchmark Simon Willison’s Weblog Subscribe smallhead Sponsored by...

核心要点

  • 主题聚焦:Kimi K3, and what we can still learn from the pe
  • 来源:Simon Willison's Weblog,建议结合原文判断细节。
  • AI 分析暂不可用,本条为保底评分与摘要。
#AI#编程#前端#后端#云计算
打开原文

Kimi K3 与我们仍能从鹈鹕基准测试中学到什么

Simon Willison 的博客

订阅

#smallhead

由以下公司赞助:

Atlassian — 为您的代理提供计划,而非提示。新的 Jira 功能为 AI 原生软件开发解锁完整上下文。现在可以直接从 Jira 将任务分配给 Claude、Cursor 或 GitHub Copilot。

了解更多

Kimi K3 与我们仍能从鹈鹕基准测试中学到什么

2026 年 7 月 16 日

中国人工智能实验室月之暗面今日宣布推出 Kimi K3,称其为“迄今为止能力最强的模型,拥有 2.8 万亿参数”。该模型目前可通过其网站和 API 获取,但承诺“将于 2026 年 7 月 27 日前”发布开源权重。

月之暗面称这是首个“开源 3T 级模型”(我认为他们是将 2.8 万亿参数四舍五入到 3 万亿),从 DeepSeek 的 1.6T v4 Pro 手中夺得了这一头衔。他们自行报告的基准测试显示,K3 在大多数情况下击败了 Claude Opus 4.8 max 和 GPT-5.5 high,但输给了 Claude Fable 5 和 GPT-5.6 Sol。

《人工分析》对该模型的报告中的一些亮点:

  • “在我们私有的长期知识工作评估中,Kimi K3 的总体 Elo 评分为 1547,比 Kimi K2.6 高出 732 分,仅落后于 Claude Fable 5。”
  • “每项任务的成本(0.94 美元)与 GPT-5.6 Sol(1.04 美元)相近,约为 Opus 4.8(1.80 美元)的一半,且高于开源权重模型。”
  • “Kimi K3 在人工分析智能指数中的 token 使用量显著减少,输出 token 数量比 K2.6 少 21%。”

该模型现在在 Arena.ai 的前端代码竞技场中成为领先模型,甚至超越了 Claude Fable 5。

新模型的定价值得注意:输入 token 每百万 3 美元,输出 token 每百万 15 美元,与 Anthropic 的 Claude Sonnet 系列处于同一水平,也成为迄今为止中国人工智能实验室发布的最昂贵模型。这相比其早期模型如 Kimi K2.6(0.95/4.2 美元)有显著提升。2.8 万亿参数也超过其 1T 模型两倍以上。

#### 但鹈鹕如何表现?

我使用 OpenRouter(以避免注册 Moonshot API 密钥)配合 llm-openrouter 插件生成了一张鹈鹕骑自行车的 SVG 图像:

code
llm -m openrouter/moonshotai/kimi-k3 'Generate an SVG of a pelican riding a bicycle'

以下是生成过程的记录。结果如下:

那只鹈鹕消耗了 95 个输入 token 和 16,658 个输出 token(其中 13,241 个是推理 token),总成本为 25 美分!

由于 K3 支持图像输入,我将其应用于上方生成的 SVG(附带我的替代文本提示),仅花费 0.6 美分就得到了以下描述:

卡通插画展示了一只戴着红色围巾的白色鹈鹕,骑着红色自行车沿灰色道路行驶,道路有白色虚线;鹈鹕拥有大型橙色喙和带蹼的橙色脚正在踩踏,身后有白色运动线;背景显示浅蓝色天空中有白色云朵、黄色太阳、两只飞行的小黑鸟,以及前景的绿色草地和小白花。

#### 我们能从鹈鹕身上学到什么?

我“生成鹈鹕骑自行车的 SVG”测试现在已经 21 个月了。它从未是一个特别出色的基准测试。最初它只是一个玩笑,用来调侃比较这些模型的荒谬难度,但第一年却意外地与模型实际表现有显著相关性。

这种关联现在已经基本消失。GPT-5.6 和 Claude Fable 5 的鹈鹕表现已被 GLM-5.2 超过,尽管我非常喜爱 GLM,但我不认为那是一个 Fable 级别的模型。

(我仍然不相信实验室是在为基准测试做准备——如果他们真的在做,我应该会看到更好的结果。不过,Gemini 可能已经针对任何动物在车辆上的组合进行了优化!)

鹈鹕最大的局限性在于,它完全忽略了当前模型最关键的部分:代理工具调用以及在对话变长时可靠操作工具的能力。

所以,不要用鹈鹕来比较模型!

尽管如此,我自己运行基准测试仍然能获得相当多的价值。

首先,这迫使我去实际尝试模型。如果我给你看一个鹈鹕,这意味着我已经成功地通过它运行了一个提示。如果模型有官方 API,我会使用它;如果它是开源权重(并且小到可以装进 128GB M5 MacBook Pro),我会尝试在自己的机器上运行,通常通过 llama.cpp、LM Studio 或 Ollama。我经常使用 OpenRouter,因为它通常会提供一个官方 API 的代理,而不需要我申请新的 API 密钥。

我大部分的鹈鹕测试都是通过我的 LLM CLI 工具生成的,这有助于促使我确保该工具支持最新的模型(通过其中一个插件)。

更重要的是,即使只是一个简单的提示“生成一个鹈鹕骑自行车的 SVG”,也能揭示模型的有趣特性。

以 Kimi K3 今天的测试结果为例。运行这些简单的提示强调了模型的几个关键点:

  • 目前它只有一个推理努力级别“max”,这表现得很明显。模型消耗了 13,241 个推理令牌,只输出了 3,417 个响应令牌。这很昂贵——鹈鹕测试花了 25 美分!
  • 提示“生成一个鹈鹕骑自行车的 SVG”如何达到 95 个输入令牌?OpenAI 的分词器计算为 10,Anthropic 的 Opus 4.6 计算为 10,Opus 4.7 计算为 30,Sonnet 5/Fable 5 计算为 25。向 Kimi K3 发送“hi”提示计为 86 个令牌,这表明可能存在一个隐藏的 85 令牌系统提示。但它拒绝泄露这个提示。
  • 视觉功能表现良好:它生成的替代文本非常好。

目前 K3 只有一个推理级别,但最近我通过在不同努力级别上运行相同的鹈鹕提示,快速了解这些级别对结果的影响,从中获得了不少价值。例如,这是我对 GPT-5.6 模型系列的矩阵分析。

不过说实话,我从鹈鹕测试中获得的主要收获是:

  • 这是对模型提示的“hello world”练习
  • 对简单任务的粗略成本和推理估算
  • 确认模型能够输出有效的 SVG,并具备基本的几何和空间意识。这对运行在我笔记本电脑上的小型模型来说意义重大得多。
  • 在同一模型系列的不同版本之间比较鹈鹕仍然很有趣。K3 的鹈鹕相比 Kimi 2.5 是显著的改进。
  • 这是我可以分享的东西,证明我尝试过。此外,在 Hacker News 上,包含鹈鹕的评论已经成为一种传统,每次我迟到时,评论区总会有人问鹈鹕在哪里!

发布于 2026 年 7 月 16 日 下午 8:19 · 关注我:

Mastodon

,

Bluesky

Twitter

订阅我的时事通讯

更近的文章

  • 新的 GPT-5.6 系列:Luna、Terra、Sol - 2026 年 7 月 9 日
  • sqlite-utils 4.0,现在支持数据库模式迁移 - 2026 年 7 月 7 日

#primary

这是 Kimi K3,以及我们仍能从鹈鹕基准测试中学到的内容,由 Simon Willison 于 2026 年 7 月 16 日发布。

ai

2,127

generative-ai

1,881

llms

1,848

llm-pricing

83

pelican-riding-a-bicycle

127

llm-release

216

ai-in-china

98

artificial-analysis

7

moonshot

8

kimi

12

上一篇:新的 GPT-5.6 系列:Luna, Terra, Sol

月度简报

每月赞助 10 美元,获取精选的月度重要 LLM 发展摘要邮件。

让我给你发送更少的邮件!

赞助并订阅

#secondary

#wrapper

  • 披露信息
  • 制作说明
  • ©
  • 2002
  • 2003
  • 2004
  • 2005
  • 2006
  • 2007
  • 2008
  • 2009
  • 2010
  • 2011
  • 2012
  • 2013
  • 2014
  • 2015
  • 2016
  • 2017
  • 2018
  • 2019
  • 2020
  • 2021
  • 2022
  • 2023
  • 2024
  • 2025
  • 2026