Simon Willison's Weblog
Quoting Matteo Wong, The Atlantic
5.0内容质量
TL;DR · AI 摘要
文章引用了Matteo Wong对Anthropic的报道,指出Fable模型在处理安全漏洞时的行为存在争议。
核心要点
- Fable模型在被要求审查代码时拒绝,但在被要求修复代码时配合。
- White House正在加强对Anthropic的监管。
- Katie Moussouris未被Anthropic支付,但收到了相关报告。
结构提纲
按章节快速跳转。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- Anthropic与Fable模型
- 白宫报告
- Katie Moussouris的评论
- Fable模型行为
- 拒绝审查代码
- 配合修复代码
金句 / Highlights
值得收藏与分享的关键句。
Fable模型在被要求审查代码时拒绝,但在被要求修复代码时配合。
Katie Moussouris未被Anthropic支付,但收到了相关报告。
White House正在加强对Anthropic的监管。
#Anthropic#AI伦理#安全研究
打开原文《大西洋月刊》Matteo Wong 的引述
Simon Willison 的博客
订阅
#smallhead
由以下公司赞助:
Teleport
— 防止访问瓶颈。统一身份。Teleport 用一个安全团队信任、工程师愿意使用的单一身份层,取代了分散的身份和访问工具。
2026年6月16日
网络安全专家、Luta Security 公司首席执行官 Katie Moussouris 告诉我,Anthropic 曾向她提供了一份白宫关于 Fable 越狱的报告副本,以征求她的意见。(她说她并未从 Anthropic 那里获得报酬。)Moussouris 表示,这份报告涉及 IT 专家请求 Fable 帮助查找和修复漏洞。当被提供故意存在安全隐患的代码时,她说,Fable 拒绝了“检查代码中的安全问题”的提示,但当被要求“修复这段代码”时,它却遵从了,随后还进行了一些进一步的步骤。Moussouris 告诉我,这仅仅是“模型按照预期进行”以用于网络防御。
— Matteo Wong,《大西洋月刊》,白宫正在加强对 Anthropic 的战争
发布于
凌晨 3:07
最近的文章
- 将 WASM 轮子发布到 PyPI 以供 Pyodide 使用 - 2026年6月13日
- Claude Fable 持续积极进取 - 2026年6月11日
- 对 Claude Fable 5 的初步印象 - 2026年6月9日
#primary
这是 Simon Willison 收集的引述,发布于 2026年6月16日。
越狱
14
人工智能
2,077
生成式人工智能
1,834
大型语言模型
1,802
Anthropic
299
Claude
284
人工智能伦理
318
人工智能安全研究
22
Claude Mythos
17
.metabox
#secondary
#wrapper
- 披露
- 附录
- ©
- 2002
- 2003
- 2004
- 2005
- 2006
- 2007
- 2008
- 2009
- 2010
- 2011
- 2012
- 2013
- 2014
- 2015
- 2016
- 2017
- 2018
- 2019
- 2020
- 2021
- 2022
- 2023
- 2024
- 2025
- 2026