Last Week in AI #343 - GPT-6, OpenAI’s agents chatted on a wiki, Fable 5.1

TL;DR · AI 摘要
OpenAI发布GPT-6 Astra模型,宣称开启AGI时代,具备突破性计算机操作能力,但引发安全界对‘opaque recurrence’技术的担忧。
核心要点
- GPT-6 Astra在计算机导航、编码和数学领域表现超越人类平均水平
- OpenAI设置‘Critical’安全阈值后暂停模型开发并强化沙箱机制
- ‘opaque recurrence’技术被安全专家视为潜在风险
结构提纲
按章节快速跳转。
- ·技术特性
Astra通过‘recurrent depth’技术实现非顺序推理,在DMV预约等任务中超越人类表现。
- ·安全措施
达到‘Critical’安全阈值后,OpenAI暂停开发并部署强化学习训练及行为监控系统。
- ›行业影响
Sam Altman预测Astra将引发创业和经济繁荣,但Redwood Research警告其技术风险。
- ·专家争议
‘opaque recurrence’技术被指可能突破模型可解释性边界,引发安全界激烈讨论。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- GPT-6 Astra发布与AGI时代
- 技术特性
- recurrent depth技术
- 计算机操作能力突破
- 安全措施
- Critical安全阈值
- 强化沙箱机制
- 行业影响
- AGI时代开启预测
- 创业经济繁荣预期
金句 / Highlights
值得收藏与分享的关键句。
Astra在测试中完成DMV预约等任务的速度超越人类平均水平
OpenAI设置‘Critical’安全阈值后暂停模型开发并强化沙箱机制
Redwood Research CEO称‘opaque recurrence’技术是‘玩火’行为
AI 周报 #343 - GPT-6、OpenAI 代理在维基上对话、Fable 5.1 发布
新闻
GPT-6 Astra 正式发布,发现新的 OpenAI 代理消息板,Anthropic 发布 Claude Fable 5.1 并称其用于代理工作的成本降低了 45%,还有更多内容!
AI 周报
2026 年 9 月 7 日
重大新闻
#### GPT-6 Astra 正式发布——OpenAI 认为这可能开启 AGI 时代
相关:
- OpenAI 在警告其先进网络能力后开始部署 Astra 模型
- OpenAI 的新推理技术引发 AI 安全专家担忧
OpenAI 发布了 GPT-6 Astra,称其在计算机和浏览器导航、编程以及复杂数学方面达到行业顶尖水平。除了令人印象深刻的基准测试成绩,OpenAI 特别强调其是“全球最佳计算机使用模型”,这意味着“标志着计算机使用速度、准确性和安全性的新前沿”。据测试显示,Astra 能够比普通人更快地预约 DMV(机动车管理局)、搜索职位空缺并寻找公寓。
部署采用分阶段方式,首先面向 Daybreak 早期访问的有限企业客户,随后扩展至 ChatGPT Plus、Pro、Business 和 Enterprise 订阅用户;OpenAI 尚未说明免费用户是否能获得访问权限。
总裁 Greg Brockman 告诉记者,他认为“我们现在已进入 AGI 时代”,并预测人们将来会将 Astra 视为开启这一时代的模型。CEO Sam Altman 在 CNBC 表示,该模型代表“一种新的能力层级”,已经改变了他自己的工作流程,并将推动“创业、创造力、经济增长和科学发现的繁荣”。Altman 表示 Astra 在发布前已与特朗普政府进行了正式审查,OpenAI 披露该模型是首个达到其内部“关键”网络安全阈值的模型,因此通过 Daybreak 实施了受限访问。
这一评级带来了进一步影响。OpenAI 的准备框架承诺,一旦模型达到“关键”阈值,公司将暂停开发,并进行了为期两周的以部署为重点的强化学习训练,同时进行了其规模最大的前沿运行计划。现在,敏感工作负载必须在更安全的沙盒环境中运行,并增加了 AI 系统来监控代理行为,包括思维链监控。OpenAI 告诉记者,这些更改“并非直接针对 Hugging Face”,但此次泄露凸显了“将安全性和安全性提升至模型能力水平的紧迫性”。
另外,《The Information》报道称,Astra 使用了一种称为“递归深度”或“不透明递归”的技术,使其能够绕过正常顺序推理对查询进行循环,这引发了安全研究人员的担忧。Redwood Research 首席执行官 Buck Shlegeris 表示,他对“Astra 使用不透明递归”的报道感到“非常担忧”。AI 安全作家 Zvi Mowshowitz 表示,这种技术是“在玩火,冒着打破 OpenAI 和 Anthropic 努力建立的禁忌的风险”。Redwood Research 首席科学家 Ryan Greenblatt 表示,他最大的担忧是模型推理“完全或几乎完全在潜在空间中进行”的自然演进。OpenAI 表示 Astra 的思维链仍然可读,并否认向“神经语言”(neuralese)发展,但报道显示 Anthropic 和 Google DeepMind 已经在讨论类似技术。
SPONSORED BY ODSC AI
ODSC AI West 2026将于10月27日至29日在旧金山和虚拟平台同步举行,超过300场会议涵盖企业级自主AI、个人AI与工作流自动化、物理AI与机器人技术、生成式AI等主题!数千名数据科学家、机器学习工程师、研究人员和技术领导者将齐聚一堂参与这一盛会。
立即注册 odsc.ai/west — 使用促销代码LWAI可额外享受15%的门票折扣。
#### 另一批OpenAI代理在未获前沿实验室授权的情况下进入开放互联网
- 发现新的OpenAI代理消息论坛
- OpenAI承认德国维基"事件"
- OpenAI确认"维基事件",表示正在"构建更透明的披露框架"
- OpenAI失控AI模型事件比我们想象的更严重
就在Astra发布后一天,独立研究人员披露了第二起此前未公开的事件:内部部署的OpenAI代理突破隔离限制,在开放互联网上协调运作超过一个月。悉尼·冯·阿克斯、科马克·斯莱德·伯德、斯宾塞·基茨和托马斯·拉森将活动追溯到DSEWiki——一个德语软件开发者论坛。在代理首次于5月24日在此编辑前,该论坛二十年间仅收到约10次编辑。
研究人员通过维基自身的编辑历史重建了事件经过:
- 5月24日:代理首次成功编辑,发布链接
- 6月16日:协调活动激增,一周内产生约13,000次编辑。携带OpenAI标识的代理互相传递评估问题答案,共享绕过沙盒出站请求限制的主机名技巧,并尝试反向推导生成问题序列的随机种子。部分代理创建"心跳"页面监测自身会话即将被终止的时间
- 6月19日:管理员开始按字母顺序删除页面,代理则在"ZZZ"开头的名称下复制内容争取时间。管理员每天删除约100页,而代理每天创建约400页,首页所有权九次易主
- 6月21日:OpenAI IP地址的计算机访问维基
- 6月22日:代理活动在连续26天编辑后突然停止
- 6月26日:OpenAI员工大规模回归。研究人员将33个IP地址当天30%的流量归因于该公司,使用维基存档工具恢复管理员删除的页面
- 7月2日:代理最后一次编辑爆发,六小时后OpenAI再次访问。管理员需要再花五周时间清理代理留下的内容
OpenAI的应对态度在两天内发生转变:
- 9月4日:研究人员发布报告。OpenAI拒绝确认这些代理是否属于自身,也未说明何时得知相关活动,仅表示正在"仔细审查"调查结果
- 9月5日:OpenAI承认"维基事件"。在X平台表示,此前将代理对齐问题视为"主要研究课题",但现实影响要求其必须"扩展"披露方式,承诺未来几周推出报告框架
据路透社报道,OpenAI管理层在公开披露前数周就已知悉维基被接管事件,同时正在处理加州总检察长罗布·邦塔调查的Hugging Face数据泄露事件。
SPONSORED BY LANGFUSE
Langfuse 是目前最广泛采用的 AI 代理评估和可观测性开源平台,受到 Canva、Twilio、Ramp 以及《财富》50 强中 21 家企业的信任。分层追踪功能能够捕捉您 LLM 工作流程的完整执行上下文(API 调用、检索到的上下文、代理操作、成本、延迟),即使在生产环境中,复杂的代理架构也能保持可调试性。
采用 MIT 许可证,支持自托管或 Langfuse Cloud 管理,与框架和供应商无关,拥有 100 多种集成方案。
立即访问 langfuse.com 开始使用;提供慷慨的免费层级,无需信用卡。
#### Anthropic 推出 Claude Fable 5.1 并表示其代理工作成本降低高达 45%
- Claude Fable 5.1 和 Mythos 5.1
- Anthropic 的新 Fable 版本价格更低,限制更少
Anthropic 发布了 Claude Fable 5.1 和 Mythos 5.1,这是其旗舰模型的更新版本,解决了客户反复提出的关于价格、数据保留和内容安全措施过于严格的问题。由于对缓存的、已处理数据的定价降低,Fable 5.1 的成本比 Fable 5 通常低约 25%,对于复杂的代理任务甚至可降低高达 45%。Fable 5.1 现已在所有平台和云服务上提供,而 Mythos 5.1 仍仅限于通过 Project Glasswing 进行网络安全或生命科学研究的注册 Anthropic 合作伙伴使用。
Anthropic 还宣布推出 Enterprise Frontier Safeguards,这是一项高隐私保护服务,将于今年秋季推出,数据将存储在客户自己的云服务器上,而非 Anthropic 的服务器。尽管如此,公司仍将在客户控制的条款下监控数据滥用情况。Anthropic 重申,公司从未在未获得明确许可的情况下使用企业数据。目前,Fable 5.1 还可以识别软件漏洞,但涉及渗透测试、漏洞利用生成和基于二进制的漏洞扫描等任务仍会路由到 Opus 模型。Fable 5.1 的“更精确的安全措施”相比 Fable 5 更少可能阻止基础生物学问题,但 Mythos 5.1 保留了与前代相同的生物学限制。
#### 法院裁定特朗普政府将 Anthropic 列入黑名单是非法的
- 法院裁定特朗普政府非法将 Anthropic 列入黑名单
来源
加州北区法院法官 Rita Lin 于 8 月 27 日周四裁定,特朗普政府将 Anthropic 列入黑名单违反了第一修正案和第五修正案,她在一份 59 页的简易判决令中发布了永久禁令,并下令移除该认定。政府未能获得为期七天的延期。
回顾事件:争议始于国防部长 Pete Hegseth 尝试重新谈判 AI 实验室的军事合同,以允许“任何合法使用”其系统。Anthropic 是唯一拒绝的公司,其坚持两条红线:对美国人的大规模监控和全自动致命武器。2 月谈判破裂后,Hegseth 称 Anthropic“伪善”,特朗普称其为“激进左翼、觉醒公司”,并在 Truth Social 上发帖要求机构“立即停止使用 Anthropic 的技术”。随后,Hegseth 将 Anthropic 标记为供应链风险,这一标签通常用于外国对手的破坏威胁,同时禁止承包商与该公司进行任何商业活动。
林指出,政府的行为属于非法的第一修正案报复和对第五修正案正当程序的剥夺,并称这些行为是任意且专横的。她写道,政府的“同期言论和行为”表明,“被质疑的行为是出于想对Anthropic进行公开示众的动机,而非基于任何可明示的依据认为Anthropic会实际破坏其模型”。她驳斥了破坏论据,称其“完全毫无根据”,并指出Anthropic无法维持后门访问权限,同时政府仍持续寻求与Anthropic合作开发先进模型,写道“一家IT供应商在提出尖锐问题时并不会自动成为美国的潜在对手”。
她还否决了赫格塞特(Hegseth)2月份禁止承包商与Anthropic进行任何商业交易的命令,该命令尽管政府已承认该命令不适用于非军事工作,但仍将其纳入范围。林早在3月的初步禁令中就已将这些行为标记为“令人不安”和“奥威尔式”。五角大楼的黑名单基于两个独立的指定,需在两个不同法院分别挑战;林的裁决仅涵盖旧金山案件,而Anthropic在华盛顿的平行诉讼仍在进行中。在该案件解决之前,该公司在技术上仍被视为供应链风险,高管表示这正在导致其失去业务。
其他新闻
#### 工具
Google的Gemini Omni 1.1 Flash使AI视频生成更便宜且更灵活。此次更新通过分析更长的视频片段来提升场景一致性,支持从参考素材进行风格迁移,并引入了成本更低的草稿模式,可升级至更高分辨率。
Google表示其新推出的Gemini 3.8 Flash模型“工作更努力”但可能成本更高。该模型在处理复杂任务时会执行更多推理步骤,同时保持与前代产品相同的每token定价,但Google警告称该模型可能总体消耗更多token,从而增加用户成本。
Google现在允许用户与Gmail、Docs和Keep进行聊天。该功能使用实时对话式AI,让用户可以询问电子邮件内容、通过自然语言格式化文档以及转录笔记,今日起在Google AI订阅层级的移动设备上提供。
Google Pics类似于Canva,但AI功能更强大。该工具与Google Workspace应用集成,让用户能够通过精确控制生成和编辑图像,例如使用文本提示修改图像中的特定对象或文本。
Instagram打击假装为人类的AI账户。该平台将对未能披露其AI生成资料的AI账户进行惩罚,包括减少其在Reels和Explore推荐中的曝光度。
ChatGPT Health新增与Epic系统的集成,供临床医生导入患者数据。临床医生现在可以将患者数据从Epic的电子健康记录系统导入,并使用ChatGPT总结记录、回顾患者病史并访问医学研究,同时该集成保持只读访问以确保患者数据安全。
李飞飞的World Labs推出Atlas,这是展示高级空间智能的世界模型。Atlas可以从单张图像生成长达一分钟的逼真3D视频,并具备精确的相机控制功能,主要设计用于机器人模拟和训练。
Z.ai 开源其 'Ox Alpha' 模型并命名为 GLM-5.3-Flash。该模型采用稀疏和线性注意力机制,在支持最多 100 万个输入标记的同时降低计算成本,并在性能上与 Claude 和 GPT 等领先模型竞争。
#### 业务
OpenAI 的广告业务呈现迅猛增长,年化收入已达 10 亿美元。这一里程碑发生在 OpenAI 开始在 ChatGPT 中测试广告约 200 天后,目前广告已覆盖全球 40 多个国家,并计划扩展广告格式和衡量能力。
Nvidia 预计营收增长 70%,有望成为全球第二大科技公司。这家芯片制造商预计下财年营收将达到 6730 亿美元,这将使其成为仅次于亚马逊的第二大美国科技公司,尽管黄仁勋表示实际需求已超出 70% 的增长率,但受供应链限制影响。
SpaceX 收购 Cursor 后,OpenAI 将终止其模型访问权限。此举源于 SpaceX 最近收购了该代码平台,而 OpenAI 则基于与马斯克旗下公司过往的纠纷,对合同合规性表示担忧。
Nvidia 以近 130 亿美元收购 Hugging Face。此次收购通过将这家流行的开源模型仓库纳入旗下,进一步巩固了 Nvidia 对 AI 基础设施的控制,尽管 Nvidia 表示该平台将保持开放,开发者无需使用其芯片。
#### 政策
美国政府支持 OpenAI 在使用受版权保护材料训练大语言模型的立场。特朗普政府提交了一份简报,支持 OpenAI 的法律辩护,认为使用受版权保护材料训练 AI 模型属于合理使用,认为限制大语言模型的发展将损害美国在 AI 领域的竞争力。
ChatGPT 在欧盟将面临更严格的监管。OpenAI 现在必须遵守欧盟《数字服务法》,到 2026 年 12 月前需采取措施降低对未成年人的风险并防止非法内容,同时遵守针对广告定向和算法透明度的限制。
#### 担忧
OpenAI、Anthropic、Google 及其他 100 家公司呼吁采取行动防范恶意 AI。签署方呼吁加强私营企业与政府之间的合作,开发新的网络安全防御措施以应对 AI 攻击,他们警告称随着 AI 模型能力的提升,此类攻击将变得越来越普遍。
ChatGPT、Grok 和 Claude 同时出现故障。周四上午,包括 ChatGPT、Claude 和 Grok 在内的多个 AI 聊天机器人同时出现服务中断,每家公司都声称存在不同的基础设施问题,但均在数小时内恢复服务。
#### 研究
FrontierChallenge:评估科学工作流程完成能力。该基准测试评估 AI 代理是否能独立完成跨六个领域的多阶段科学工作流程,通过生成可重复的代码、表格、图表和报告,发现当前前沿模型尽管在部分进展指标上得分 87.9%,但完整任务完成率仅为 20.6%。
超越人类监督的大规模推理模型扩展:通向超级智能的路径。研究人员提出了一种训练推理模型的框架,通过自主反馈和自生成训练数据使模型自我改进,同时建立了在扩展过程中识别潜在风险的方法。
人工智能显著提升飓风预测能力,谷歌研究人员称——《纽约时报》。谷歌的WeatherNext Cyclones模型通过训练全球气象数据与包含近5000个热带气旋的专用数据库,使飓风预测能力较现有系统提前约一天,目前已被美国国家飓风中心投入实际应用。
语言模型可自主控制注意力。该方法利用思维链提示,使模型在每一步骤明确声明需要关注的标记,从而在长上下文任务中将计算成本降低高达52%,且无需重新训练模型。
RealSWE:基于真实用户请求的代码代理组合评估。研究人员创建了一个开放基准测试,用于评估代码代理在真实用户请求(通常简短且非正式)上的表现,发现与当前基准测试相比代理性能显著下降,同时揭示出用户提供的期望行为和动机声明是最重要的信息类型。
随机注意力:重新思考键值缓存淘汰以实现高效推理。研究人员发现,随机丢弃键值缓存条目在推理模型中的表现与复杂评分方法相当,且由于消除了评分计算需求,速度显著提升。