Astra is our most aligned model, with substantial improvements in understanding user intent.
OpenAI发布GPT-6 Astra模型,在多个专业领域基准测试中表现优异,显著提升用户意图理解能力。
入选理由:Astra在Agents’ Last Exam和AutomationBench等基准测试中达到SOTA。
概念
别名:ALE
评估AI代理能力的基准测试。
已跟踪 2 条高相关材料
最近变化
2026-09-03 · Astra在Agents’ Last Exam和AutomationBench等基准测试中达到SOTA。
为什么值得关注
Agents’ Last Exam 被反复提及时,通常意味着它正在影响产品路线、开发者工作流或 AI 产业判断。这个页面把分散材料合并成一个可持续更新的观察入口。
Astra is our most aligned model, with substantial improvements in understanding user intent.
OpenAI(@OpenAI) · 8.5 分
OpenAI发布GPT-6 Astra模型,在多个专业领域基准测试中表现优异,显著提升用户意图理解能力。
[AINews] not much happened today
Latent Space · 6.3 分
本文主要梳理了近期 AI 领域的热点动态,包括 Anthropic 的 Mythos/Opus 讨论、RSI 研究的正式化、以及新型长周期评测基准的出现,强调前沿模型在可靠性与长周期任务上的不足。
已收录 2 条与 Agents’ Last Exam 相关的内容,按评分排序。
OpenAI发布GPT-6 Astra模型,在多个专业领域基准测试中表现优异,显著提升用户意图理解能力。
入选理由:Astra在Agents’ Last Exam和AutomationBench等基准测试中达到SOTA。
本文主要梳理了近期 AI 领域的热点动态,包括 Anthropic 的 Mythos/Opus 讨论、RSI 研究的正式化、以及新型长周期评测基准的出现,强调前沿模型在可靠性与长周期任务上的不足。
入选理由:Anthropic 的 Opus 4.7 在某些化学任务上已匹配或超越专用 NMR 软件,显示模型在专业领域的潜力。