T
traeai
Sign in

论文

DeepSWE v1.1

别名:DeepSWE

软件工程基准测试框架

已跟踪 5 条高相关材料

TraeAI 观察

相关材料

已收录 5 条与 DeepSWE v1.1 相关的内容,按评分排序。

Bring near-Astra intelligence to everyday work with GPT-6.1 Sol on Amazon Bedrock

Bring near-Astra intelligence to everyday work with GPT-6.1 Sol on Amazon Bedrock

AWS Machine Learning Blog863 字 (约 4 分钟)
85

GPT-6.1 Sol在Amazon Bedrock上发布,提供更高效的推理能力,成本降低至GPT-6 Astra的五分之一,性能提升6.4%。

入选理由:GPT-6.1 Sol成本为GPT-6 Astra的20%,推理效率提升6.4%

FeaturedArticle#AWS#GPT#AI#Bedrock#Codex英文
Google DeepMind Blog 图标

Introducing Gemini 3.8 Flash and 3.8 Flash Cyber

Google DeepMind Blog1218 字 (约 5 分钟)
85

Google发布Gemini 3.8 Flash和3.8 Flash Cyber,推理与编码能力提升,价格保持0.75美元/百万输入令牌,网络安全模型通过Fairwind计划提供。

入选理由:Gemini 3.8 Flash在DeepSWE v1.1基准测试中超越多数大模型,成本仅为前者的几分之一。

FeaturedArticle#Gemini#AI模型#网络安全#DeepMind英文
Google DeepMind Blog 图标

Introducing Gemini 3.7 Flash

Google DeepMind Blog954 字 (约 4 分钟)
85

Google发布Gemini 3.7 Flash,性能提升显著且价格降低50%,适用于复杂编码和代理任务。

入选理由:Gemini 3.7 Flash在FrontierCode 1.1 Main任务中准确率提升30.6%(43.6% vs 34.4%)

FeaturedArticle#Gemini#AI模型#Google#DeepMind#编码工具英文
Introducing Gemini 3.7 Flash

Introducing Gemini 3.7 Flash

The Keyword (blog.google)954 字 (约 4 分钟)
85

Google推出Gemini 3.7 Flash模型,性能较前代提升显著且价格降低50%,适用于编码、代理和复杂工作流程。

入选理由:7 Flash在FrontierCode 1.1 Main基准中准确率提升26.6%(43.6% vs 34.4%)

FeaturedArticle#Gemini#AI模型#Google#机器学习#编码工具英文

跨材料问答 · DeepSWE v1.1

回答基于:DeepSWE v1.1 相关 5 条材料
    0 / 500

    AI may generate inaccurate information. Please verify important content.