Stanford AI Lab(@StanfordAILab)
The most capable models available in the world are using Terminal-Bench-Science to show it (just one...
8.5内容质量

TL;DR · AI 摘要
Stanford AI Lab宣布Terminal-Bench-Science基准在发布一周后被OpenAI的GPT-6 Astra采用,性能提升42.2%。
核心要点
- Terminal-Bench-Science基准发布一周后即被OpenAI集成到GPT-6 Astra模型中
- GPT-6 Astra在基准测试中达到64.6%准确率,较GPT-5.6 Sol提升42.2个百分点
- Steven Dillmann团队开发的基准成为OpenAI最新模型的核心评估工具
结构提纲
按章节快速跳转。
- §基准发布
Stanford AI Lab推出Terminal-Bench-Science基准并获得OpenAI快速采用
- ·性能对比
GPT-6 Astra在基准测试中较GPT-5.6 Sol提升42.2个百分点
- ›技术影响
新基准成为评估AI科学能力的核心指标
- ·团队贡献
Steven Dillmann团队开发的基准被OpenAI选为官方评估工具
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- Terminal-Bench-Science
- OpenAI采用
- GPT-6 Astra性能提升42.2pp
- 团队贡献
- Steven Dillmann团队开发
- 技术影响
- 成为AI科学能力评估核心指标
金句 / Highlights
值得收藏与分享的关键句。
GPT-5.6 Sol → 22.4% GPT-6 Astra → 64.6% The +42.2pp jump
Terminal-Bench-Science 0.1 is now also the #1 featured benchmark
Congratulations to @StevenDillmann and team for their remarkable impact
#Terminal-Bench-Science#AI for Science#OpenAI#GPT-6 Astra#基准测试
打开原文斯坦福AI实验室在X平台上的推文:"目前世界上能力最强的模型正在使用Terminal-Bench-Science来展示其性能(在基准发布仅一周后)。祝贺@StevenDillmann及其团队带来的显著影响!" / X
斯坦福AI实验室
@StanfordAILab
目前世界上能力最强的模型正在使用Terminal-Bench-Science来展示其性能(在基准发布仅一周后)。祝贺
@
StevenDillmann
及其团队带来的显著影响!
Steven Dillmann
@StevenDillmann
9月3日
Terminal-Bench-Science和科学AI领域迎来了非凡的一周!🥂 在发布仅一周后,Terminal-Bench-Science 0.1版本现已成为今日
OpenAI
发布的GPT-6 Astra版本的#1特色基准测试。GPT-5.6 Sol → 22.4% GPT-6 Astra → 64.6% 从GPT-5.6到GPT-6 Astra的+42.2个百分点的提升令人瞩目
显示更多
2026年9月3日 下午9:56
9.6K
浏览量
5
48
18