GPT-6 Astra: an automated AI Engineer you can hire for <$6 an hour

TL;DR · AI 摘要
GPT-6 Astra展现强大自动化工程能力,每小时成本低于6美元,可胜任AI工程师多项任务。
核心要点
- GPT-6 Astra在FrontierMath和ARC-AGI-3测试中分别达到97.6%和99.9%准确率
- 模型可同时管理20-50个子代理,实现并发任务处理
- 每百万token成本50美元,33 tokens/秒处理速度优于Sol和Fable
结构提纲
按章节快速跳转。
- §引言
介绍GPT-6 Astra模型的测试背景和核心发现
展示Astra在各类基准测试中的突破性表现
描述Astra作为自动化AI工程师的10项核心能力
揭示每小时6美元的超低成本和33 tokens/秒处理速度
说明Astra同时管理20-50个子代理的并发处理能力
- ·未来展望
讨论Astra在个人工具开发和企业应用中的潜力
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- GPT-6 Astra能力解析
- 模型表现
- FrontierMath 97.6%
- ARC-AGI-3 99.9%
- 工程能力
- 模型训练/数据标注
- 系统部署/调试
- 子代理管理
- 成本效益
- $6/小时
- 33 tokens/秒
- $50/百万token
金句 / Highlights
值得收藏与分享的关键句。
GPT-6 Astra在FrontierMath测试中达到97.6%准确率,完全超越人类表现
33 tokens/秒处理速度配合50美元/百万token成本,使Astra成为最经济的智能模型
Astra可同时管理20-50个子代理,实现复杂系统的自动部署和调试
GPT-6 Astra:每小时不到6美元即可雇佣的自动化AI工程师
我们投入了GPT-6 Astra的200亿多个token进行探索。以下是我们的发现。
2026年9月3日
由OpenAI推出的GPT-6 Astra,作为首个Stargate和轻量级循环超级模型今日正式发布,多项指标上已全面超越Fable 5.1,包括在最困难的FrontierMath(97.6%)和ARC-AGI-3(99.9%)版本上实现完全饱和。许多演示将聚焦于典型场景,从使用计算机到玩宝可梦、使用Blender,再到科学和网络安全性基准测试(系统卡)。Greg表示AGI已经到来,Jakub则称这正是他期待已久的自动化AI研究实习生。
我们无资格讨论这些内容,但获得了早期访问权限,并将其应用于所有能想到的实际生活任务。在消耗了Astra的200亿多个token后,我们确认最令人惊讶的发现:GPT-6 Astra属于一个全新模型类别,它们本身就是完全胜任的AI工程师。现在它们能帮助你选择和训练模型、标注数据(既帮助你标注,又利用你的标注进行主动学习,如SAM)、保持流水线饱和、监控和读取日志、一次性部署和调试整个系统、扩展并指挥和评估子代理(包括运行其他模型的代理),并在数十亿token的单个代理线程中保持一致性。
提升你的目标
我们之前曾撰文讨论过提升LLM抱负的高回报活动。我们的经历使我们变得比以往任何时候都更加雄心勃勃。过去一个月,我们从让人类参与有趣的“消灭我的SaaS”竞赛,到构建了十几个内部/个人工具(包括4个之前付费的SaaS工具),彻底重新设计了我的个人网站,制作了一个不完整但功能齐全的GitHub+Vercel替代方案,训练了用于策略棋盘游戏的AI(该游戏的合法移动次数是围棋的10,000倍),在个人财务清理中节省了数万美元,重新出版了我的旧书并同步了有声书音频和印刷版,还有更多即将推出的雄心勃勃的项目。
每小时6美元的数字可能令人惊讶,但这正是我们在测试中看到的结果——每秒33个token,每百万token最高收费50美元。鉴于Astra的token效率比Sol和Fable更高(由Artificial Analysis独立确认),这意味着Astra通常同时还是你所能购买的最佳快速且智能的模型(假设我们的预览延迟在正式发布时保持不变),除了Spark 1.3之外。
查看日志
管理子代理舰队(单独调整,有限并发)
当然,如果你只是将Astra设置为Ultra模式,每小时消耗的费用会远超6美元……因为它在并行处理方面实在太出色了。根据实际任务的不同,我们通常会同时启动20到50个代理,当然,所有代理都由一个主Astra代理管理。
监控自身运行,启动和停止波次
这基本上就是你会支付初级AI工程师做的事情——照看运行,盯着数据,发现问题,修复,重新运行,无限循环。你可以每天雇佣一个人花费200到1000美元,或者你可以花两天100美元雇佣GPT-6来完成这些工作。
制定模型基准,处理预算,进行估算,扩大运行规模,获取人工评分
当然你需要这些能力来运行自己的AI工程计划,毕竟OpenAI内部早已用GPT-6实现了这些功能……
此处示例
或者你可以让Astra轻松为你创建一个个人版Arena.ai克隆,用于微调提示词、为任务挑选模型,或对齐你自己的偏好模型!
你应该得出的总体结论是:OpenAI显然已经训练出能够自动化大部分自身AI工程工作的模型,现在正是你学习利用Astra和Fable系列模型的时候了,你应该对当前智能体能实现的成果抱有远超以往的期待。
我们正在Grok、Fable和其他类似前沿模型上开展类似工作,但OpenAI在试用限制方面最为慷慨,因此这篇分析聚焦于OpenAI - 但此处讨论的智能体编程模式很可能适用于所有2026年末的前沿模型。
许多人在等待结果... 对之前的沉默表示歉意!我们确实... 忙起来了!我们将公布获奖者、补偿方案和最佳尝试结果。
Previous
Next