AK(@_akhaliq)

SWE-Bench ProMax Benchmarking Agents on Large-Scale Multilingual Code Refactoring paper: https://t...

7.0内容质量
SWE-Bench ProMax

Benchmarking Agents on Large-Scale Multilingual Code Refactoring

paper: https://t...

TL;DR · AI 摘要

SWE-Bench ProMax 是一个用于评估代码重构代理在多语言环境下的新基准测试。

核心要点

  • 基准测试覆盖 Python、Java、JavaScript 等 12 种编程语言
  • 基于真实世界代码库的 50,000+ 个重构任务
  • 引入代码质量、重构效率双重评估指标

结构提纲

按章节快速跳转。

  1. 介绍代码重构代理评估的迫切需求与现有基准的局限性

  2. 提出覆盖 12 种语言的多维度评估框架

  3. 基于 GitHub 200 个开源项目的 50,000+ 重构样本

  4. 定义代码质量(正确性/可读性)与重构效率(耗时/资源)双维度指标

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • SWE-Bench ProMax
    • 多语言支持
      • Python/Java/JavaScript 等 12 种
    • 评估维度
      • 代码质量
      • 重构效率
    • 数据来源
      • GitHub 200 个开源项目

金句 / Highlights

值得收藏与分享的关键句。

#AI代理#基准测试#代码重构#多语言#Hugging Face
打开原文

AK on X: "SWE-Bench ProMax Benchmarking Agents on Large-Scale Multilingual Code Refactoring paper: https://t.co/2DO56pDC95" / X

AK

@_akhaliq

SWE-Bench ProMax Benchmarking Agents on Large-Scale Multilingual Code Refactoring paper:

huggingface.co/papers/2608.09…

4:02 AM · Aug 11, 2026

23.5K

Views

10

84

29