Introducing the Kotlin Benchmark for AI Coding Agents

TL;DR · AI 摘要
Introducing the Kotlin Benchmark for AI Coding Agents - The JetBrains Blog Kotlin A concise multiplatform language devel...
核心要点
- 主题聚焦:Introducing the Kotlin Benchmark for AI Coding A
- 来源:The JetBrains Blog,建议结合原文判断细节。
- AI 分析暂不可用,本条为保底评分与摘要。
介绍用于 AI 编码代理的 Kotlin Benchmark - JetBrains 博客
Kotlin
由 JetBrains 开发的简洁多平台语言
关注
- 关注:
- X X
- RSS RSS
访问 Kotlin 官网
AI
介绍用于 AI 编码代理的 Kotlin Benchmark
Alyona Chernyaeva
智能编码基准测试正逐步接近实际软件开发。对于 Kotlin 团队而言,最关键的问题是 AI 代理能否可靠地完成端到端的 Kotlin 任务,从阅读问题到生成通过验证的解决方案。
我们通过发布 Kotlin Benchmark(JetBrains 官方用于评估 AI 编码代理在 Kotlin 软件工程任务上的基准测试)迈出了填补这一差距的第一步。我们的目标是为开发者提供一个可信且公开的途径,评估不同代理在 Kotlin 上的表现,并通过更贴近日常开发工作的任务进行代理配置对比。
随同基准测试发布,我们将在 GitHub 上公开基准测试资源,并启动官方排行榜以跟踪评估结果。
在 GitHub 上探索基准测试
查看排行榜上的首批结果
Kotlin Benchmark 的工作原理
Kotlin Benchmark 的首次公开迭代基于 SWE-bench 方法论,专注于仓库级别的 Kotlin 软件工程任务。
Kotlin 已经拥有强大的模型导向评估资源,包括 Kotlin_HumanEval 和 Kotlin_QA,这些资源有助于衡量模型对语言语法和核心概念的理解。Kotlin Benchmark 则关注另一个层面:AI 编码代理在现有 Kotlin 项目中完成验证软件工程任务的能力。
该数据集包含来自活跃开源仓库的 105 个工程任务。每个任务要求 AI 代理解读真实的问题描述,导航项目上下文,并生成功能补丁。解决方案在容器化环境中严格验证,只有当生成的解决方案通过所需测试验证时,任务才会被标记为已解决。
您可以在方法论页面上了解更多关于我们的环境设置和数据收集的信息。
首次结果
首次评估显示,领先的编码代理可以完成当前 Kotlin Benchmark 任务的大部分。这些结果反映了基准测试的首次公开迭代,尚未包含最新模型版本。我们已经在进行第二次迭代,并将在添加新评估时更新排行榜。
在此次运行中,最佳结果来自使用 Opus 4.7 xhigh 的 Claude Code,解决了 105 个任务中的 90 个,解决率为 85.71%。JetBrains Junie 使用 Opus 4.7 max(81.9%)和 Codex 使用 GPT 5.5 xhigh(81.9%)紧随其后。
完整的排行榜可在 kotlinlang.org/benchmark 上查看,您可以详细比较代理和配置。
此处显示的结果反映了 Kotlin Benchmark 的首次公开迭代。随着新模型评估的增加,排行榜将不断更新。
对于正在评估编码代理的团队,该基准测试提供了比较 Kotlin 任务设置的共享参考框架,而不仅仅依赖于供应商声明。这些分数旨在作为信号,而非对每个代码库的保证。实际结果取决于您的架构、内部 API、编码标准、工具和验证流程。
我们重视开放的方法,因此我们基于开源的 Multi-SWE-bench 基础设施构建了这个基准测试,并公开了所有数据集和测试框架。
我们将基准测试视为持续的质量测量管道。未来,我们计划在这些领域扩展框架:
- 更广泛的 Kotlin 生态系统覆盖:我们希望任务组合能更真实地反映 Kotlin 的实际使用场景,包括 Android 和 Kotlin Multiplatform 等领域,并覆盖更广泛的任务难度等级。
- 更多的评估指标:通过测试是衡量正确性的重要信号,但只是代理评估的一部分。后续迭代将关注成本、性能、可维护性和代码质量。
- 更多代理和模型配置:我们计划评估更多商业代理、代理-模型配置和开源权重模型,使团队能够比较更广泛的方案。
该基准是开放的,您可以检查任务、比较结果,并告诉我们接下来应该覆盖哪些 Kotlin 场景。
- 分享
上一篇
与代理像原始人一样交流真的能节省65%的token吗?我们进行了测试