Stanford AI Lab(@StanfordAILab)

The most capable models available in the world are using Terminal-Bench-Science to show it (just one...

8.5内容质量
The most capable models available in the world are using Terminal-Bench-Science to show it (just one...

TL;DR · AI 摘要

Stanford AI Lab宣布Terminal-Bench-Science基准在发布一周后被OpenAI的GPT-6 Astra采用,性能提升42.2%。

核心要点

  • Terminal-Bench-Science基准发布一周后即被OpenAI集成到GPT-6 Astra模型中
  • GPT-6 Astra在基准测试中达到64.6%准确率,较GPT-5.6 Sol提升42.2个百分点
  • Steven Dillmann团队开发的基准成为OpenAI最新模型的核心评估工具

结构提纲

按章节快速跳转。

  1. Stanford AI Lab推出Terminal-Bench-Science基准并获得OpenAI快速采用

  2. GPT-6 Astra在基准测试中较GPT-5.6 Sol提升42.2个百分点

  3. 新基准成为评估AI科学能力的核心指标

  4. Steven Dillmann团队开发的基准被OpenAI选为官方评估工具

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • Terminal-Bench-Science
    • OpenAI采用
      • GPT-6 Astra性能提升42.2pp
    • 团队贡献
      • Steven Dillmann团队开发
    • 技术影响
      • 成为AI科学能力评估核心指标

金句 / Highlights

值得收藏与分享的关键句。

#Terminal-Bench-Science#AI for Science#OpenAI#GPT-6 Astra#基准测试
打开原文

斯坦福AI实验室在X平台上的推文:"目前世界上能力最强的模型正在使用Terminal-Bench-Science来展示其性能(在基准发布仅一周后)。祝贺@StevenDillmann及其团队带来的显著影响!" / X

斯坦福AI实验室

@StanfordAILab

目前世界上能力最强的模型正在使用Terminal-Bench-Science来展示其性能(在基准发布仅一周后)。祝贺

@

StevenDillmann

及其团队带来的显著影响!

Steven Dillmann

@StevenDillmann

9月3日

Terminal-Bench-Science和科学AI领域迎来了非凡的一周!🥂 在发布仅一周后,Terminal-Bench-Science 0.1版本现已成为今日

OpenAI

发布的GPT-6 Astra版本的#1特色基准测试。GPT-5.6 Sol → 22.4% GPT-6 Astra → 64.6% 从GPT-5.6到GPT-6 Astra的+42.2个百分点的提升令人瞩目

显示更多

2026年9月3日 下午9:56

9.6K

浏览量

5

48

18