Bring near-Astra intelligence to everyday work with GPT-6.1 Sol on Amazon Bedrock
GPT-6.1 Sol在Amazon Bedrock上发布,提供更高效的推理能力,成本降低至GPT-6 Astra的五分之一,性能提升6.4%。
入选理由:GPT-6.1 Sol成本为GPT-6 Astra的20%,推理效率提升6.4%
论文
别名:DeepSWE
软件工程基准测试框架
已跟踪 5 条高相关材料
最近变化
2026-09-29 · GPT-6.1 Sol成本为GPT-6 Astra的20%,推理效率提升6.4%
为什么值得关注
DeepSWE v1.1 被反复提及时,通常意味着它正在影响产品路线、开发者工作流或 AI 产业判断。这个页面把分散材料合并成一个可持续更新的观察入口。
Bring near-Astra intelligence to everyday work with GPT-6.1 Sol on Amazon Bedrock
AWS Machine Learning Blog · 8.5 分
GPT-6.1 Sol在Amazon Bedrock上发布,提供更高效的推理能力,成本降低至GPT-6 Astra的五分之一,性能提升6.4%。
Enter the AGI Era with GPT-6 Astra. GPT-6 Astra scores 75.2% on DeepSWE v1.1 at xhigh reasoning. A...
OpenAI Developers(@OpenAIDevs) · 8.5 分
GPT-6 Astra在DeepSWE v1.1测试中达到75.2%,具备自动化修复bug的能力。
Introducing Gemini 3.8 Flash and 3.8 Flash Cyber
Google DeepMind Blog · 8.5 分
Google发布Gemini 3.8 Flash和3.8 Flash Cyber,推理与编码能力提升,价格保持0.75美元/百万输入令牌,网络安全模型通过Fairwind计划提供。
已收录 5 条与 DeepSWE v1.1 相关的内容,按评分排序。
GPT-6.1 Sol在Amazon Bedrock上发布,提供更高效的推理能力,成本降低至GPT-6 Astra的五分之一,性能提升6.4%。
入选理由:GPT-6.1 Sol成本为GPT-6 Astra的20%,推理效率提升6.4%
GPT-6 Astra在DeepSWE v1.1测试中达到75.2%,具备自动化修复bug的能力。
入选理由:GPT-6 Astra在DeepSWE v1.1 xhigh推理任务中得分75.2%
Google发布Gemini 3.8 Flash和3.8 Flash Cyber,推理与编码能力提升,价格保持0.75美元/百万输入令牌,网络安全模型通过Fairwind计划提供。
入选理由:Gemini 3.8 Flash在DeepSWE v1.1基准测试中超越多数大模型,成本仅为前者的几分之一。
Google发布Gemini 3.7 Flash,性能提升显著且价格降低50%,适用于复杂编码和代理任务。
入选理由:Gemini 3.7 Flash在FrontierCode 1.1 Main任务中准确率提升30.6%(43.6% vs 34.4%)
Google推出Gemini 3.7 Flash模型,性能较前代提升显著且价格降低50%,适用于编码、代理和复杂工作流程。
入选理由:7 Flash在FrontierCode 1.1 Main基准中准确率提升26.6%(43.6% vs 34.4%)