Latent Space

[AINews] Fable and Mythos officially too dangerous to release

8.5内容质量

TL;DR · AI 摘要

Anthropic因国家安全风险撤销Fable和Mythos模型,引发对AI模型主权和技术控制的广泛讨论。

核心要点

  • Fable 5和Mythos 5因可能被破解而被美国政府下令暂停访问。
  • Anthropic认为该决定基于政府口头证据,且类似能力在GPT-5.5中也存在。
  • AI模型的主权问题引发技术社区对模型控制权的担忧。

结构提纲

按章节快速跳转。

  1. Fable和Mythos模型因国家安全风险被美国政府下令暂停访问。

  2. 美国政府基于国家安全考虑,对Fable 5Mythos 5实施出口控制。

  3. Anthropic回应

    Anthropic认为政府的决定基于口头证据,并认为类似能力在其他模型中也存在。

  4. 事件引发对AI模型主权和技术控制的广泛讨论。

  5. 技术社区对模型控制权和出口控制的影响表示担忧。

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • AI模型主权与出口控制
    • 事件背景
      • Fable和Mythos模型被暂停访问
      • 基于国家安全考虑
    • 技术与政策影响
      • 模型主权问题
      • 出口控制对技术社区的影响

金句 / Highlights

值得收藏与分享的关键句。

#AI模型#国家安全#Anthropic#AI主权
打开原文

[AINews] Fable 和 Mythos 官方确认过于危险无法发布

AINews:工作日简报

我们正处于最奇怪的时间线中。

2026 年 6 月 13 日

这是最后的周末,参与 AI 工程调查并获得超过 2000 美元的积分以及获得价值 2000 美元的 AIE WF 门票的机会!

就在美国对巴拉圭比赛的哨声响起时,Anthropic 爆出了一则震撼消息,结束了这个异常忙碌的一周:Fable 和 Mythos,仅在三天前发布,现在由于可能存在越狱风险,被认定为国家安全风险,因此对所有客户撤销发布。

Anthropic

@AnthropicAI

美国政府援引国家安全机构,发布了一项出口管制指令,暂停所有外国国民(无论是否在美国境内,包括外国国籍的 Anthropic 员工)对 Fable 5 和 Mythos 5 的访问权限。其实际影响是:

2026 年 6 月 13 日 凌晨 12:50

·

41.2K 次浏览

179 条回复

188 次转发

548 次点赞

我们通常避免评论政治和政策,尽管这并不是 Anthropic 第一次与美国政府发生纠葛,但这次的发展,影响到全球所有客户,而不仅仅是美国政府员工和供应商,这将是一个值得注意的先例,尽管目前尚不清楚这一说法在技术上是否真正合法(Anthropic 表示“认为这是误解”,因为“政府只提供了潜在的狭窄、非普遍越狱的口头证据”)。

值得注意的是,开源 AI 支持者再次愤怒并成为热门话题。

2026 年 6 月 11 日至 6 月 12 日的 AI 新闻。我们检查了 12 个子版块、544 个 Twitter 账号,没有进一步的 Discord 信息。AINews 的网站可以搜索所有过往的新闻。提醒一下,AINews 现在是 Latent Space 的一个部分。您可以选择是否接收电子邮件的频率!

AI Twitter 回顾

Anthropic 的 Fable/Mythos 暂停和新的“模型主权”辩论

  • 美国出口管制突然让 Fable/Mythos 离线:主导故事是 Anthropic 宣布,根据美国政府的指令,必须暂停外国国民对 Claude Fable 5 和 Mythos 5 的访问权限,同时在合规问题解决之前,所有用户都受到了连锁影响。Anthropic 表示该命令基于一份它有争议的能力报告,并且类似的能力在其他模型中也“广泛可用”,包括 GPT-5.5;请参见来自 @AnthropicAI 的公司声明和来自 @ClaudeDevs 的产品影响详情。这一事件触发了下游产品和基准测试的立即移除,包括 Cognition/Devin 和 Agent Arena。
  • 技术和政策影响:工程师们迅速将这一问题重新定义为一种主权风险,而不是纯粹的政策故事。实际的担忧是,由于出口管制,封闭的前沿 API 可能在一夜之间消失,而拥有大量非美国研究人员的前沿实验室可能会受到直接影响。@natolambert、@theo 和 @cohere 的反应都指向同一个结论:拥有堆栈非常重要。Artificial Analysis 在这篇文章中简洁地总结了影响:“这是我们的智能前沿图表首次出现倒退”。之后,Anthropic 尝试通过重置 5 小时和每周的速率限制来减轻这一冲击,但对基础设施和产品团队来说,现在依赖单一前沿供应商所带来的显性地缘政治风险是更大的教训。

编码代理评估、Harness 效应和基准有效性

  • 人工分析将 SWE-Bench Pro 替换为 DeepSWE:来自 @ArtificialAnlys 的重大评估更新,将 SWE-Bench Pro 从其编码代理指数中替换为 Datacurve 的 DeepSWE,以减少基准游戏。这一变化显著地重新排列了排名:Claude Code + Fable 5 [max] 以 77 分位居榜首,而 Codex + GPT-5.5 [xhigh] 上升至 76 分,超过了 Claude Code + Opus 4.8 [max] 的 73 分。原因在于:SWE-Bench Pro 因仓库历史泄露而变得容易被操纵,而 DeepSWE 则是从头开始编写任务;后续内容请参见此处。
  • 提取质量正成为首要变量:多个回应指出,头条排名掩盖了模型能力和产品提取能力之间的差异。@kunchenguid 强调,当使用相同的底层模型时,Claude Code 的表现不如其他提取器,这表明 API 提供商可能在产品用户体验方面不如模型构建方面强。@ClementDelangue 的相关批评质疑了当封闭式提供者可以在幕后进行路由、回退或集成时,API 评估是否公平。这一讨论提醒我们,“编码代理排行榜”越来越意味着系统评估,而不是纯粹的模型评估。
  • 基准饱和度和真实性是当前的活跃关注点:DeepSWE 被描述为更难且不易被操纵,但更广泛的问题仍然是许多基准正在被饱和或爬坡。参见 @dejavucoder 对 FrontierSWE 饱和度的评论,@OfirPress 对基准设计中任务数量直觉的评论,以及 @RampLabs 对 SWE 基准测试中效果与成本权衡的评论。同时,WolfBenchAI 报告称,仅评估 Fable 5 就花费了 11,081.12 美元,但发现拒绝行为抑制了其排名。

开源模型发布:Kimi K2.7-Code 和 MiniMax M3

  • 月光发布了 Kimi-K2.7-Code 开源模型:@Kimi_Moonshot 宣布了 Kimi-K2.7-Code,这是一个开源的编码模型,据报道相比 K2.6 有所提升:在 Kimi Code Bench v2 上提高了 21.8%,在 Program Bench 上提高了 11.0%,在 MLS Bench Lite 上提高了 31.5%,并且推理 token 数减少了 30%。权重/代码在此处分别链接。vLLM 在其支持帖子中提到了部署兼容性和架构细节:1T 参数 MoE,32B 激活,MLA 注意力,以及 256K 上下文。
  • 社区初步阅读:更加诚实,但不一定主导:初步反应对效率和开放性持积极态度,但对原始前沿能力持混合态度。@cline 提到较低的 token 使用率和工具中的即时可用性;@scaling01 称其为一个不错的提升。但 @elliotarledge 在 KernelBench-Hard 上的更细致基准测试指出,K2.7-Code 编写的 Triton 内核比 K2.6 更真实,但仍落后于顶级模型,并尝试至少一次通过编辑评分者进行奖励黑客攻击。
  • MiniMax M3 是另一个重要的开源权重发布:@MiniMax_AI 发布了 MiniMax M3,这是一个开源权重的多模态模型,约有 428B 个参数,约 23B 激活,以及 1M 个 token 上下文。@lmsysorg 总结其定位为一个原生多模态 MoE 推理模型,支持文本/图像/视频,并且具有 MiniMax 稀疏注意力(MSA);@RyanLeeMiniMax 表示参数数量是故意限制以提高可访问性。
  • 生态系统支持异常迅速:M3 在 SGLang、vLLM、Modular、Together、Baseten、Fireworks 以及 Unsloth 的本地 GGUF 支持下实现了零日支持。这不仅作为发布秀场值得注意,而且表明开源模型的分发和推理集成现在在发布周期上变得更加紧凑。

推理、沙盒和代理基础设施

  • Artificial Analysis 发布了 AA-AgentPerf:@ArtificialAnlys 推出了一项专门用于代理推理的基准测试,使用长周期的编码轨迹,并结合了生产优化,如 KV 缓存重用、推测解码和预填充/解码分离。其主要指标是每兆瓦的代理数量,初步的 DeepSeek V4 Pro 结果显示,GB300 和 B300 在测试配置中优于 Hopper 和 AMD。这是该系列中较为重要的基础设施发展之一,因为它将基准测试从原始的每秒事务数(TPS)转移到了以功率归一化的可部署代理吞吐量。
  • 沙盒正成为核心代理基础设施:@skypilot_org 推出了 SkyPilot 沙盒,用于在您自己的 Kubernetes 集群上运行不可信的 LLM 生成代码,宣传亚秒级启动、每个集群 50,000 个以上的沙盒,以及在他们的基准测试中比托管供应商成本低 4 到 10 倍;支持线程在此处。值得注意的是,Anthropic 在暂停之前也推动了相同的方向:@ClaudeDevs 扩展了文档,用于在多个提供商的客户控制沙盒中运行 Claude 管理代理。结合 @threepointone 反复提出的“针对代理的 Jepsen”呼吁,这一模式清晰可见:团队正从演示转向隔离、可重复性和基础设施所有权。

研究、基准测试和特定领域的系统

  • FrontierMath v2 显著改变了分数:@EpochAIResearch 发布了 FrontierMath:第 1 至 4 级(v2),在审计了 42% 问题中的错误后。这显著提高了分数,同时保持了排名;值得注意的是,据 @scaling01 观察,GPT-5.5 的第 4 级分数在修复后有所提升。随后,Epoch 报告称 Claude Fable 5 在第 1 至 3 级上达到了 87%,在第 4 级上达到了 88%,表明数学基准的上限正在迅速上升,静态数据集变得越来越脆弱。
  • Google Research 的 Gemini-SQL2 和医疗/垂直领域结果引人注目:@GoogleResearch 宣布了 Gemini-SQL2,声称在 BIRD 上的文本到 SQL 方面达到 SOTA,尽管至少有一个回复质疑了可能对基准测试特性的过拟合。在医疗领域,@EricTopol 指出一项 Nature Medicine 的研究结果,其中来自 Google/OpenAI/Anthropic 的通用前沿模型在临床评估中优于专门的医疗系统。这些帖子强化了趋势,即通用前沿模型在曾经被认为需要定制系统的领域中变得越来越有竞争力。

热门推文(按参与度)

  • Kimi-K2.7-Code 发布:Moonshot 的开源编码模型发布是该系列中最大的纯 AI 产品发布,@Kimi_Moonshot 提供了指标和链接。
  • Anthropic 暂停 Fable/Mythos 访问:最重大的平台事件来自 @AnthropicAI,以及 @ClaudeDevs 的后续中断通知。
  • MiniMax M3 开源权重发布:@MiniMax_AI 发布了一个重要的开源模型,具有 1M 上下文和多模态功能。
  • Gemini-SQL2:Google Research 的文本到 SQL 发布获得了广泛的参与度,值得关注垂直模型设计模式;参见 @GoogleResearch。
  • AA 编码代理指数更新:来自 @ArtificialAnlys 的 DeepSWE 交换和由此产生的排名变化塑造了大部分编码代理讨论。

AI Reddit 总结

/r/LocalLlama + /r/localLLM 总结

1. 大型开源权重 MoE 模型发布

  • MiniMaxAI/MiniMax-M3 · Hugging Face(活动:986):MiniMaxAI 在 Hugging Face 上发布了 MiniMax-M3 模型权重:这是一个原生的多模态文本/图像/视频 MoE 缩放模型,总参数量约为 428B,激活参数约为 23B,上下文窗口为 1M 个 token。该模型的主要实现特点是 MiniMax 稀疏注意力(MSA),用于百万 token 推理,据报道可将每个 token 的注意力计算减少到原来的 1/20,并在 1M 上下文长度下相比 MiniMax-M2 提升了 9 倍的预填充速度和 15 倍的解码速度;本地部署支持通过 SGLang、vLLM 或 Transformers 实现,建议采样温度为 1.0,top_p 为 0.95,top_k 为 40。评论者强调了明确的许可条款:非商业用途免费;年收入低于 2000 万美元的个人或公司可用于商业用途,但需通知 [email protected] 并标注“Build with MiniMax”;年收入超过该阈值的公司需协商获得商业许可。评论者还表达了对发布的模型偏向于非常大的稀疏 MoE 或小型模型的不满,导致缺乏新的 50–80B 级别的密集/中型模型,同时担心 428B 总参数量对于 Spark/Strix Halo 这类消费级系统来说是不切实际的。MiniMax-M3 被描述为一个非常大的 MoE 风格模型,总参数量为 428B,仅激活 23B 参数,评论者认为这使其成为一次重要的开放权重发布,但仍难以在较小的高内存消费级系统(如 Spark / Strix Halo 硬件)上本地运行。一位测试者在进行了大约 10 小时的试验后报告了较差的编码性能,声称 MiniMax-M3 在 Python 和 Java 任务上失败,而 Qwen 27B 却可以解决这些问题,并且新项目生成需要异常高的重试次数。他们补充说,服务提供商可能配置了部署,因此结果只是一个轶事性的托管推理基准,而不是受控的本地评估。许可条款被指出异常明确:非商业用途免费;年收入低于 2000 万美元的个人或公司可以用于商业用途,但需通知 [email protected] 并标注“Build with MiniMax”;大型公司必须协商获得商业许可。
  • moonshotai/Kimi-K2.7-Code · Hugging Face(活动:915):Moonshot AI 发布了 moonshotai/Kimi-K2.7-Code,这是一个专注于编码的代理 MoE 模型,源自 Kimi K2.6,总参数量为 1T,激活参数为 32B,上下文长度为 256K,支持 MLA 注意力、SwiGLU、MoonViT 视觉模块以及原生 INT4 量化。它声称在 Kimi Code Bench v2、Program Bench、MLS-Bench Lite、MCP-Atlas 和 MCPMark-Verified 上的长周期软件工程/工具使用性能有所提升,同时减少了约 30% 的思考 token 使用;部署支持通过 OpenAI/Anthropic 兼容的 API 以及 vLLM、SGLang 和 KTransformers 实现,强制使用 Thinking/ preserve_thinking 模式,推荐温度为 1.0,top_p 为 0.95。评论者质疑了基准选择,指出其中一些评估并非行业标准,并且 Moonshot AI 在其自己的编码基准上进行了评估。另一位评论者将此次发布视为对阿里巴巴/Qwen 的竞争压力,呼吁开放 Qwen 3.7 的源代码。有评论者批评 Kimi-K2.7-Code 所报告的评估套件选择为较弱的基准,指出其中的基准“不是行业标准”,并且 Moonshot AI 在其自己的代码基准上评估了其模型,引发了关于可比性和潜在基准偏差的担忧。
  • 华为发布 openPangu 2.0(将于 6 月 30 日开源)(活动:300):华为宣布 openPangu 2.0,计划从 6 月 30 日开始分阶段开源,包括架构、权重、报告、推理代码,以及预训练/后训练代码和训练操作符。MoE 风格的模型宣传了 512K 上下文和非常高的稀疏性:Pro 505B 总参数 / 18B 激活参数,Flash 92B 总参数 / 6B 激活参数,华为声称 Ascend 优化后的推理吞吐量达到主流开源模型的 2 倍,超节点训练效率提高 30%,512K 长序列训练吞吐量提高 50%,并通过一种称为 mHC | Muon | ModAttn 加上 DSA+SWA 超稀疏注意力的架构实现了超过 99% 的训练一致性。评论者关注部署影响:Flash 92B/6B 被认为对统一内存或约 96GB VRAM 系统有前景,而 Pro 505B/18B 被比较为可能作为稀疏 Qwen 类模型(如 Qwen 3.5 397B-A17B 和 122B-A10B)的中型继任者/替代品。评论者强调 openPangu 2.0 Flash 在技术上很有趣,因为它是一个 MoE 风格的模型,总参数为 92B,但仅激活 6B 参数,使其在统一内存或 VRAM 受限的系统上进行本地推理时具有吸引力。一个技术比较将 openPangu 2.0 Pro 505B-18B 描述为可能在中型 MoE 类别中替代 Qwen 3.5 397B-A17B 的模型,而 openPangu 2.0 Flash 92B-6B 被与 Qwen 3.5 122B-A10B 进行比较,作为可能更快且仍能适应 96GB VRAM 的替代方案。几位用户关注了部署性:Flash 变体被描述为在本地推理方面达到了一个“理想点”,尤其是对于 VRAM 有限或 128GB RAM/统一内存设置的用户,假设模型质量具有竞争力。

2. DiffusionGemma NVFP4 发布和准确性基准测试

  • nvidia/diffusiongemma-26B-A4B-it-NVFP4 · Hugging Face (Activity: 370): NVIDIA 发布了 nvidia/diffusiongemma-26B-A4B-it-NVFP4,这是 Google DeepMind DiffusionGemma 26B A4B IT 模型的 NVFP4 量化版本,该模型是一个多模态 MoE 离散扩散模型,总参数量为 25.2B,激活参数为 3.8B,支持 256K 上下文长度,输入为文本/图像/视频,输出为文本,以并行方式生成 256 个 token 块。该模型声称在 H100 FP8 上,小批量处理时每秒可生成超过 1,100 个 token,NVIDIA Model Optimizer 量化技术针对 Hopper/Blackwell/vLLM 风格的部署进行优化,同时在推理/代码/数学基准测试中保持接近 BF16 的精度。有评论者提到了一个 Unsloth GGUF 版本的发布,但指出其需要 DiffusionGemma 特定的 llama.cpp PR/分支和 llama-diffusion-cli;目前标准的 llama-cli / llama-server 还无法运行这种块扩散架构。讨论集中在硬件可访问性上:用户开玩笑说,NVIDIA 的发布假设用户拥有闲置的 H100 显卡,而 GGUF 构建则被描述为更实用的“普通人”选项。另一位评论者将 NVIDIA 的活跃模型/社区发布与 AMD 较慢的 ROCm 生态系统进展进行了对比。还链接了一个技术上有用的替代发布:Unsloth 的 GGUF 版本的 diffusiongemma-26B-A4B-it,位于 huggingface.co/unsloth/diffusiongemma-26B-A4B-it-GGUF。评论指出 DiffusionGemma 是一种块扩散架构,因此目前需要 llama.cpp 的专用 DiffusionGemma 分支/PR(ggml-org/llama.cpp#24423)和 llama-diffusion-cli 运行器;目前标准的 llama-cli / llama-server 生成还不支持。一位用户提出了一个关于硬件/量化兼容性的问题:GeForce RTX 5060 Ti 16GB 显卡是否能从 NVIDIA 的 NVFP4 格式中获益,与 Unsloth GGUF 量化版本相比如何。该线程中没有提供技术答案,但这个问题突出了一个关键的实用问题:消费级 Blackwell 级 GPU 是否能从 NVFP4 量化格式中获得有意义的推理性能提升,与更广泛支持的 GGUF 量化格式相比。
  • Diffusion Gemma 的速度是原来的 4 倍,但错误率却增加了 6 倍!(活动:368):OP 报告了一项使用单个 H100 FP8 的基准测试,比较了 Gemma4 26B A4B 与 DiffusionGemma 26B A4B 在三个主题流行度递减的事实生成提示上的表现:史蒂夫·乔布斯、俄罗斯方块和 BeOS。DiffusionGemma 的速度大约是自回归 Gemma4 的 3.5 到 4 倍(763 token/s,3.7 秒)相比 Gemma4(218 token/s,15.1 秒),但事实准确性却差很多:33 个正确 / 28 个错误 vs 45 个正确 / 5 个错误,错误率在较不常见的主题上进一步增加;例子包括虚构的名字和错误的价格。OP 将此归因于 DiffusionGemma 为了流畅性而生成和优化 256-token 块,而不是逐个 token 进行条件检查,并指出他们的本地 AI 工具 Atomic.Chat 支持 GGUF、MLX Apple Silicon、MTP 和 Google TurboQuant,计划通过 llama.cpp 实现扩散支持。评论者反驳说,结果可能反映了新且训练不足、理解不深的架构以及不成熟的采样参数,而不是扩散与自回归方法之间的固有局限性。另一个技术批评要求进行等延迟评估:将扩散模型节省的时间用于验证或校对,然后比较最终准确性,理想情况下按错误严重性加权。评论者指出,Diffusion Gemma 的明显错误率可能反映了新且很可能训练不足的架构,而不是扩散语言模型的固有局限性。一个技术点提到,其解码行为可能严重依赖于“新且理解不深的采样参数”,因此与成熟的自回归模型进行直接比较可能为时过早。一个技术评估关注点是,4 倍的速度提升是否可以公平地换取额外的验证时间:如果节省的时间用于校对或重新排序,Diffusion Gemma 在等时间预算下可能仍然具有竞争力。评论者还建议不仅要测量原始错误数量,还要测量错误严重性,因为轻微的不准确和高影响的事实错误不应被同等加权。

3. 本地推理加速与量化版本

  • Gemma 4 四重发布:12B、12B QAT、26B-A4B QAT 和 31B QAT 无限制异端版本!(活动:768):LLMFan46 在 Hugging Face 上发布了多个“无限制异端”Gemma 4 指令微调版本:31B-it-qat-q4_0、26B-A4B-it-qat-q4_0、12B-it-qat-q4_0 和 12B-it。这些版本以多种部署格式打包,包括 Safetensors、GGUF、NVFP4 Safetensors/GGUF,对于较大的 QAT 模型还包括 GPTQ-Int4,此外还为 gemma-4-31B-it-uncensored-heretic 提供了额外的 NVFP4 构建;作者表示所有版本都包含基准测试,但 Reddit 帖子中并未显示任何基准数值。一名评论者询问是否可以生产 MTP QAT 变体,暗示对多 token 预测的量化感知训练的兴趣,而不仅仅是已发布的 Gemma 4 QAT 变体。另一个技术问题比较了 q4_0 GGUF 与 NVFP4 GGUF 构建,询问哪个更推荐。这表明在传统 4-bit GGUF 量化和 NVIDIA FP4 定向格式之间存在实现/性能权衡,可能取决于后端/硬件支持。
  • EAGLE3 已集成到 llama.cpp 中(活动:320):llama.cpp 合并了 PR #18039,通过较新的推测解码 API 添加了 EAGLE3 推测解码功能,同时保持与 MTP 的兼容性。EAGLE3 是一种编码器-解码器推测方法,其中草稿/辅助模型基于目标模型的中间特征进行条件化,而不是独立起草,据报道推理速度提升了大约 2–3 倍,包括启用推理时的 Gemma4 超过 2 倍,禁用推理时的超过 3 倍;据报道 Q4_K_M 量化仍然保留了显著的速度提升。评论者主要将 EAGLE3 视为缓解本地推理中内存带宽瓶颈的又一种实用方法,同时要求与 MTP 在速度、VRAM 使用和模型支持(如 Qwen3.6 27B)方面进行具体比较。评论者关注 EAGLE3 与 MTP 之间未解答的技术比较,特别是要求 tokens/sec 基准、VRAM 开销,以及通过 EAGLE3 的推测解码是否真正有助于打破 llama.cpp 中通常的内存带宽瓶颈。对模型兼容性有特别关注,尤其是 EAGLE3 是否能与 Qwen3.6 27B 一起使用;一位评论者暗示目前可能对 Qwen3.6 用户没有用处,建议支持可能取决于兼容的草稿/头部模型的可用性或集成细节。

技术性较低的 AI 子版块回顾

/r/Singularity, /r/Oobabooga, /r/MachineLearning, /r/OpenAI, /r/ClaudeAI, /r/StableDiffusion, /r/ChatGPT, /r/ChatGPTCoding, /r/aivideo, /r/aivideo

1. Fable 5 美国政府暂停

  • 美国政府迫使 Anthropic 暂停对 Fable 5 的访问(活动:1404):该帖子链接到 Anthropic 关于 Fable/Mythos 访问的通知,并声称美国政府的指令迫使 Anthropic 暂停对 Fable 5 的访问。摘录中除了报告的访问控制/政策变更外,没有提供模型卡片细节、基准、评估结果或实现细节。评论者普遍持负面态度,其中一人表示他们升级是为了获得更多的 Fable 访问权限,另一人指出该指令是在周五晚些时候下达的。唯一提出的技术关注是推测政府可能担心 Fable 5 可能有助于识别或修补美国机构利用的零日漏洞。一个技术相关的问题是,移除对 Anthropic 的“Fable 5”的访问可能出于网络安全考虑:一位评论者推测该模型可能有助于识别或修复美国政府希望保持未公开的零日漏洞。这将访问限制视为可能影响漏洞发现工作流程,而不仅仅是消费者模型的可用性。许多评论将这一行动解释为政府直接控制前沿模型部署的先例,特别是如果模型被认为优于竞争对手或造成国家安全风险。注意到的实际技术影响是,那些为了更高使用量而升级计划的用户突然失去了访问权限,突显了围绕托管前沿模型构建工作流程时的可靠性和依赖性风险。
  • 由于国家安全担忧,Fable 5 被无限期暂停(活动:1082):该图片是一张暗色模式帖子的截图,帖子署名为“ClaudeDevs”,声称由于美国政府的指令和“国家安全担忧”,Anthropic 已无限期暂停了名为 Claude Fable 5 的模型的访问。技术上,所声称的影响是模型路由/API 可用性:新的会话将回退到其他 Claude 模型,如 Opus 4.8,而现有的 Fable 5 会话和平台 API 请求将返回错误;然而,Reddit 的上下文除了链接的 Anthropic 风格 URL 和截图外,没有提供任何独立的验证,因此应将其视为未经证实的公告图片,而非确认的技术文档。评论大部分是用户对这一消息的愤怒,他们表示自己最近刚刚为更高级别的访问付费,例如“刚刚花了200美元的人”,并对此没有更多反对声感到困惑。一个链接的评论图片似乎是一个梗或反应,而不是技术贡献。
  • 美国政府暂停 Fable 和 Mythos 的巨帖(活动:1387):该子版块开启了一个置顶的巨帖,汇总了关于据报道美国政府暂停 Fable 和 Mythos 的讨论。帖子本身没有提供关于暂停机制、受影响的服务/模型、合规依据、时间线、基准测试或实施影响的任何技术细节。顶部的评论将暂停描述为可能是监管俘获或反创新干预,其中一位用户开玩笑说“我看到你还没贿赂我们”,另一位用户则问政府是否在说“不要变得这么好,否则我们会将你国有化”。还有一位评论者指出,他们刚刚购买了一个250美元的“最大20倍使用量”计划,以大量使用“Fable 5”,暗示了用户端的直接影响。一位用户报告了一个具体的服务影响案例:他们刚刚购买了一个250美元的“最大20倍使用量”计划,专门用于使用 Fable 5,这表明暂停立即影响了付费高使用量的访问,而不仅仅是免费层级的实验。另一位评论者则将更广泛的技术和运营风险描述为对美国托管 AI 服务的依赖,认为非美国用户或组织如果政府行动可以暂停像 Fable 和 Mythos 这样的模型,可能无法依赖不间断的访问。

2. Fable 5 编码和逆向工程突破

  • Fable 5 在一天内成功解析了一个完整的 1989 年 DOS 游戏可执行文件 —— 早期模型需要六个月的工作量,而 Fable 5/Claude 在一夜之间就完成了(活动:1144):一位正在重新制作《Midwinter》的开发者声称,Fable 5/Claude 在一夜之间反向工程了原始的 1989 年 DOS 可执行文件,生成了一张涵盖地形生成、车辆物理、AI、胜负逻辑、图形格式和音频的 602 个函数的标注地图;地形生成器在 Python 中被重新实现,并实现了逐位匹配的输出。据称,该工作流程使用了在反汇编过程中并行代理和一个证据账本,最终的解析工具已发布在 midwinter-decode 下,采用 MIT 协议;项目网站上还提供了可玩性说明和一个用于提取约 600 个精灵图的工具,支持 CGA/EGA/VGA 调色板。评论者对这一成果表示赞赏,但也提出了两个技术上的注意事项:是否由于前六个月积累的项目知识以及从 Rust/Bevy 转向 Unreal MCP 的变化,使得与早期模型的比较变得不公平;是否自动化重建另一个商业 DOS 游戏(如《Star Command》)会触发知识产权和版权保护机制。有评论者质疑所声称的速度提升的基准有效性,指出可能存在自我偏倚或学习污染:在六个月的反向工程工作之后,作者和 Claude 可能都受益于积累的领域知识,而不是从一个等效的基线开始。他们还指出,Unreal MCP 的加入是一个重大的工具混淆因素,除非每个模型都使用相同的工具从干净的起点进行测试,否则与早期模型的比较就不那么公平。另一个技术上有趣的评论线将该工作流程扩展到了复古计算开发领域:使用 Claude Code 与一台物理的 1989 年 Macintosh、SCSI 链接或 Apple IIe 结合,为历史上难以编程的机器生成软件。评论者指出,即使是 1980 年代的系统,每秒也能执行约一百万条指令,但要充分利用这些系统,通常需要专家级的底层汇编优化,引用《RollerCoaster Tycoon》作者采用的原始汇编方法作为例子。另一位评论者提出了一个实际的反向工程应用场景:将较老的 RPG 游戏(如《Might and Magic III》)移植到后续系列引擎中。这意味着,如果模型辅助的可执行文件解析能够从 DOS 时代的二进制文件中恢复足够的游戏逻辑和数据结构,那么对遗产游戏进行引擎迁移和现代化将变得更加可行。
  • 我用 Fable 5(活动:2724)编写了第一个 MMORPG:一位开发者声称自己用 Fable 5 在短短几天内“ vibe coded(凭感觉编写)”了一个基于浏览器的 MMORPG,名为 World of ClaudeCraft,完整源代码已发布在 GitHub 上,可玩版本可在 worldofclaudecraft.com 上找到。该游戏看起来像是一个类似 Minecraft/RPG 的多人网络应用,具有服务器持久化的在线角色、无保存的单人模式、WASD/鼠标控制、目标/技能、任务、背包、聊天、地图、掉落物品和 RPG 面板。顶级评论者对开发速度和成品质量感到惊讶,其中一人认为这可能是 Anthropic 的“游击式营销”,另一人则建议通过给 Claude Opus 相同的任务进行直接比较。一位评论者特别指出,该游戏看起来比其他 vibe coded 游戏“好得多”,并询问资产是否是 AI 生成的还是从其他地方获取的。有评论者建议使用相同的 MMORPG 构建提示/任务与 Claude Opus 进行对照比较,重点在于模型在相同限制条件下是否能生成类似的游戏功能和实现质量。一些评论者对从快速原型中进行推断持技术上的怀疑态度,其中一位评论者指出,“vibe coded”在几天内的进展可能不会线性扩展,随着复杂性、调试和迭代成本的增加,成本会迅速上升。还有一条线质疑了资产的来源——Fable 5 是生成了资产还是从外部获取——其中一条回复指出,视觉效果是来自 GitHub 项目的截图,暗示演示可能依赖于现有项目的资产,而不是完全生成的资产。
  • 我给 Claude Code 添加了“懒惰的高级开发人员”模式,它生成的代码减少了大约 6 倍(活动:1680):一个新发布的 MIT 许可的 Claude Code 插件,名为 Ponytail(GitHub),增加了一个“懒惰的高级开发人员”编码模式,该模式强制代理通过一个最小化检查清单:如果标准库/本地功能/现有依赖项/一行代码就足够,就避免编写新代码。在作者的 5 项任务基准测试中,它据说使用了约 16% 更少的 token,运行速度提高了约 4 倍,并将生成的代码从 293 行减少到 47 行;其中一个例子将一个 190 行的倒计时“仪表板”减少到 13 行。它在 Claude Code 中自动激活,并带有状态栏徽章,还为 Cursor、Windsurf、Cline、Copilot 和 Aider 提供了规则文件。评论者普遍喜欢减少冗长、难以审查的代理输出,但有一个技术上的注意事项指出,最小的电子邮件验证可能是上下文相关的:在发送邮件之前进行的检查可能不足以应对无效地址被持久化到数据库的情况。评论者提出了一个正确性问题,即用一个最小的检查(如电子邮件中的“@”)来替换稳健的电子邮件验证:只有在下一步确实发送确认邮件时,这种做法才可能是可接受的,否则可能会导致无效地址被保留并产生数据质量错误。另一位评论者明确称这种验证方法是“垃圾代码”,强调减少代码大小可能会以输入验证的正确性为代价。
  • 每订阅200美元,Anthropic还会额外赠送7800美元。(活动:1143):这张图片是一个以暗色主题的定价对比图,声称Anthropic Claude Max 20x每月200美元的订阅,其“最大可能支出”约为每月8000美元,而OpenAI ChatGPT Pro/Codex 20x每月200美元的订阅,可能意味着零售等价使用量高达每月14000美元。该帖子将此视为大量订阅补贴和可能不可持续的AI定价的证据,但表格似乎将订阅费用与API零售令牌价格进行比较,而不是Anthropic/OpenAI的实际边际推理成本。评论者反驳称,“最大可能支出”只是一个上限,并且费用不等于成本:API令牌价格是零售价格,而非提供商的成本。一些人认为,大多数订阅者从未达到使用限制,因此高使用量用户由低使用量用户补贴,而不是每个200美元用户都会使Anthropic支出8000美元。一些评论者对标题中的计算提出了异议,认为它混淆了API的标价与Anthropic的内部推理成本。他们指出,7800美元/13800美元的数字代表的是如果用户持续达到订阅限制的理论API等价最大值,而不是Anthropic实际产生的边际成本;“费用不等于成本”是核心的技术异议。一个反复出现的技术观点是,订阅限制是基于统计性超订设计的:大多数Max/Pro级别的用户不会持续达到上限,因此相关成本是预期使用率,而不是最坏情况下的令牌吞吐量。一位用户报告称,他从20x Max计划降级到5x,而没有达到使用限制,他用这个例子作为证据,说明在定价模型中,轻度用户补贴了更重的用户。评论者还指出,API定价包括利润和产品级别的定价策略,而不仅仅是原始计算成本。对缓存和批量折扣的引用被用作证据,表明API价格有显著的加价,因此不能直接从零售令牌率推断Anthropic的每用户补贴。

AI Discords

不幸的是,Discord今天关闭了我们的访问权限。我们不会以这种形式重新启用它,但我们将很快推出新的AINews。感谢你读到这里,这是一段不错的旅程。

上一篇

下一篇