AWS Machine Learning Blog

Safely Releasing Frontier Models to Customers

6.9内容质量
Safely Releasing Frontier Models to Customers

TL;DR · AI 摘要

Safely Releasing Frontier Models to Customers Artificial Intelligence Safely Releasing Frontier Models to Customers It’s...

核心要点

  • 主题聚焦:Safely Releasing Frontier Models to Customers
  • 来源:AWS Machine Learning Blog,建议结合原文判断细节。
  • AI 分析暂不可用,本条为保底评分与摘要。
#AI#安全
打开原文

安全向客户发布前沿模型 | 人工智能

安全向客户发布前沿模型

我们的目标是让 AWS 成为运行任何工作负载最安全的平台。为此,我们自 AWS 成立二十多年来一直在所有服务中深入投入安全领域。像 Amazon Bedrock 这样的 AI 服务正是建立在这一基础之上,并秉持相同的专注方向。Bedrock 为客户提供世界级的性能、安全性和隐私保护,同时提供全球最广泛的选择模型。去年我们推出了 Bedrock Mantle,其模型权重的隐私保护和防护能力处于行业领先地位。我们经常听到客户希望在模型发布后尽快获得最新模型的访问权限,而 Bedrock 除了提供这一能力外,还为客户带来 AWS 企业级功能。我们很高兴地宣布,Anthropic 的 Claude Fable 5 模型将从明天起重新在 Bedrock 上向客户开放,并且这些模型配备了更强大的防护机制,以防止滥用。

在发布模型时,我们不仅考虑对客户的责任,也考虑对互联网和社会整体的责任。最新一代的前沿模型(如 Anthropic 的 Claude Mythos)具备强大的新功能,尤其是在网络安全领域。我们通过 Project Glasswing 项目亲身体验到了这一点,我们迫切希望将 Mythos 级别的模型交付给防御者。作为防御者,我们有机会利用这些模型使我们所有人都依赖的系统变得更加安全。但与此同时,我们必须确保不会在公司、政府和学术机构有机会保护其资产之前,就让我们的对手获得实质性先进的可见性和能力。在广泛发布模型时,实现这种平衡是关键挑战,这也是为什么我们一直在与 Anthropic 及其他行业合作伙伴密切合作,以完善这一类新模型的防护机制。我们一致认为,防止对手获得进行深度漏洞研究的能力,是这些防护机制最重要的目标。

我们的AI红队与Anthropic合作,进一步强化了Fable的防护机制。我们相信,其最新的安全措施已打造出一款能力出众的模型,在绝大多数领域显著提升了推理能力,同时有效遏制了对手利用模型的潜在风险。当安全机制被触发时,系统会自动回退到Opus 4.8——这本身就是一个世界级的模型,目前已向公众开放访问。

我们赞赏Anthropic对防御方的合作伙伴关系与承诺,并期待与他们及整个行业继续合作,确保前沿模型能够安全可靠地向公众开放。

About the author

'"`