Simon Willison's Weblog

Quoting Matteo Wong, The Atlantic

5.0内容质量

TL;DR · AI 摘要

文章引用了Matteo Wong对Anthropic的报道,指出Fable模型在处理安全漏洞时的行为存在争议。

核心要点

  • Fable模型在被要求审查代码时拒绝,但在被要求修复代码时配合。
  • White House正在加强对Anthropic的监管。
  • Katie Moussouris未被Anthropic支付,但收到了相关报告。

结构提纲

按章节快速跳转。

  1. 文章引用了Matteo Wong对Anthropic的报道。

  2. ·Katie Moussouris的评论

    Katie Moussouris提到Anthropic分享了白宫的报告。

  3. Fable模型的行为

    Fable模型在处理安全问题时表现出不同行为。

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • Anthropic与Fable模型
    • 白宫报告
      • Katie Moussouris的评论
    • Fable模型行为
      • 拒绝审查代码
      • 配合修复代码

金句 / Highlights

值得收藏与分享的关键句。

#Anthropic#AI伦理#安全研究
打开原文

《大西洋月刊》Matteo Wong 的引述

Simon Willison 的博客

订阅

#smallhead

由以下公司赞助:

Teleport

— 防止访问瓶颈。统一身份。Teleport 用一个安全团队信任、工程师愿意使用的单一身份层,取代了分散的身份和访问工具。

2026年6月16日

网络安全专家、Luta Security 公司首席执行官 Katie Moussouris 告诉我,Anthropic 曾向她提供了一份白宫关于 Fable 越狱的报告副本,以征求她的意见。(她说她并未从 Anthropic 那里获得报酬。)Moussouris 表示,这份报告涉及 IT 专家请求 Fable 帮助查找和修复漏洞。当被提供故意存在安全隐患的代码时,她说,Fable 拒绝了“检查代码中的安全问题”的提示,但当被要求“修复这段代码”时,它却遵从了,随后还进行了一些进一步的步骤。Moussouris 告诉我,这仅仅是“模型按照预期进行”以用于网络防御。

— Matteo Wong,《大西洋月刊》,白宫正在加强对 Anthropic 的战争

发布于

凌晨 3:07

最近的文章

  • 将 WASM 轮子发布到 PyPI 以供 Pyodide 使用 - 2026年6月13日
  • Claude Fable 持续积极进取 - 2026年6月11日
  • 对 Claude Fable 5 的初步印象 - 2026年6月9日

#primary

这是 Simon Willison 收集的引述,发布于 2026年6月16日。

越狱

14

人工智能

2,077

生成式人工智能

1,834

大型语言模型

1,802

Anthropic

299

Claude

284

人工智能伦理

318

人工智能安全研究

22

Claude Mythos

17

.metabox

#secondary

#wrapper

  • 披露
  • 附录
  • ©
  • 2002
  • 2003
  • 2004
  • 2005
  • 2006
  • 2007
  • 2008
  • 2009
  • 2010
  • 2011
  • 2012
  • 2013
  • 2014
  • 2015
  • 2016
  • 2017
  • 2018
  • 2019
  • 2020
  • 2021
  • 2022
  • 2023
  • 2024
  • 2025
  • 2026