lmarena.ai(@lmarena_ai)

Inkling by @thinkymachines debuts at #9 in Agent Arena among open-weight models, and #30 overall. Th...

6.5内容质量
Inkling by @thinkymachines debuts at #9 in Agent Arena among open-weight models, and #30 overall. Th...

TL;DR · AI 摘要

Inkling模型在Agent Arena开放权重模型中排名第9,但用户反馈评分较低,且存在潜在排名变动风险。

核心要点

  • Inkling在开放权重模型中排名第9,但用户满意度-18.0%排名38
  • 若Kimi K3按时开源,Inkling可能被挤至第2名
  • Inkling在CLI错误恢复能力上表现优异(+6.4%)

结构提纲

按章节快速跳转。

  1. InklingAgent Arena开放权重模型中排名第9,总体排名第30。

  2. 用户满意度评分-18.0%,排名38,且在可操控性方面排名35。

  3. CLI错误恢复能力提升6.4%,排名16。

  4. Kimi K3若按时开源可能使Inkling排名下降1位。

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • Inkling模型表现
    • 排名情况
      • 开放权重第9,总体第30
      • Kimi K3潜在影响
    • 用户反馈
      • 满意度-18.0%
      • 可操控性排名35
    • 技术优势
      • CLI恢复+6.4%

金句 / Highlights

值得收藏与分享的关键句。

#Agent Arena#模型排名#Inkling#Kimi K3
打开原文

Arena.ai在X上的推文:"Inkling由@thinkymachines推出,在Agent Arena开源权重模型中首次亮相即位列第9,总体排名第30。这使它成为美国在代理长期任务中表现最佳的开源模型,也是前10名开源模型中唯一的美国模型。如果Kimi K3的权重能按计划于https://t.co/VYog0R83wL在7月27日发布" / X

Arena.ai

@arena

Inkling由

@thinkymachines

推出,在Agent Arena开源权重模型中首次亮相即位列第9,总体排名第30。这使它成为美国在代理长期任务中表现最佳的开源模型,也是前10名开源模型中唯一的美国模型。如果Kimi K3的权重能按计划于7月27日发布,它将成为排名第一的开源权重模型,其他所有模型排名将下降一位。Inkling的弱点在于用户情感:人们对其抱怨多于称赞(-18.0%,排名第38),且不善于接受反馈,在可操控性方面排名第35,在任务完成度方面排名第29。其优势在于从CLI错误中恢复能力(+6.4%,排名第16)。在Agent Arena中,我们通过数百万个真实世界的长期代理任务来评估模型。模型可获得网络搜索、文件系统和终端工具来完成复杂的工作流程:编写代码、创建幻灯片、研究网络、构建应用和分析文档。祝贺

团队取得这一强劲的首发表现!

7月16日

在Frontend Code Arena开源权重模型中首次亮相即位列第10(1434分),总体排名第37。这使它不仅成为美国最佳的开源模型,也是前15名开源模型中唯一的美国模型。在开源权重模型中,Inking表现强劲

显示更多

2026年7月20日下午7:00

54.7K

浏览量

33

0

3

27

2

7

408

4

8

60

6

阅读33条回复