From Evaluation to Guardrails: What We Brought to ACM FAccT 2026

TL;DR · AI 摘要
Mozilla在ACM FAccT 2026展示,AI guardrails需与模型同等严格评估,跨语言场景评估可生成动态政策,提升实际部署可靠性。
核心要点
- 跨语言评估120个难民场景,生成英文和波斯语guardrail政策,提升多语言系统安全性。
- 动态政策替代静态分类,基于事实核查和行动性评估,解决文本无法判断的结构性问题。
- 开源MHRE数据集与评估标准,推动guardrail评估科学化,促进AI安全领域协作。
结构提纲
按章节快速跳转。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- AI Guardrail评估与改进
- 跨语言场景评估
- 120难民场景对
- 动态政策生成
- 事实核查标准
- 开源数据集MHRE
- 多语言评估指标
金句 / Highlights
值得收藏与分享的关键句。
跨语言评估120个难民场景,生成英文和波斯语guardrail政策,提升多语言系统安全性。
动态政策替代静态分类,基于事实核查和行动性评估,解决文本无法判断的结构性问题。
开源MHRE数据集与评估标准,推动guardrail评估科学化,促进AI安全领域协作。
从评估到防护机制:我们在ACM FAccT 2026的成果
技术内容
在ACM FAccT会议上,我们展示了为何AI防护机制需要与模型本身接受同等程度的审查。从静态策略转向基于上下文和语言的评估,我们的实践环节证明,配备网络搜索等工具的智能防护机制对于实现可靠的实际部署至关重要。
#### Roya Pakzad,Daniel Nissani
2026年7月22日
—
3分钟阅读
6月,我们前往蒙特利尔参加ACM公平性、问责性与透明度会议(ACM FAccT),这是安全可靠AI开发的顶级会议;在这个会议上,计算机科学家、社会科学家、政策制定者和律师齐聚一堂,不仅探讨如何构建AI系统,更深入思考为何构建、何时构建以及为谁构建。这正是我们教程《跨语言与智能系统中LLM防护机制的上下文评估》的理想受众。
评估是贯穿始终的核心
评估一直是AI安全领域的主要讨论话题,也是实现负责任部署的关键步骤。该领域正在从庆祝通用能力转向衡量实际场景中特定领域和语言的表现,跨行业组织如EvalEval联盟正在构建评估科学和基础设施。尽管评估投入了大量资金,基准测试趋于饱和,评估数据逐渐过时,但一个实用功能依然存在:评估塑造防护机制。当评估显示模型在特定上下文或语言中生成有害或有毒内容时,一种应对方式就是围绕该具体失败设计防护机制。
防护机制应与模型接受同等审查
防护机制——用于过滤、标记或约束大型语言模型输入输出的机制——决定了用户在聊天机器人、平台和公共服务中实际看到的内容。然而,它们获得的关注远少于其所管理的模型。历史上,它们是专有的分类器,只能通过无法解释的拒绝回应来观察。开源防护模型和政策提示防护机制使独立评估成为可能。
我们在FAccT上的论点很简单:评估防护机制与评估其保护的LLM同样重要,基于上下文和语言的评估结果应推动防护机制从静态危害分类转向动态政策。
从评估到防护机制的路径
正是这条路径将我们带到FAccT,因为将两者连接起来往往并不直接。我们的方法:在英语、波斯语、阿拉伯语、库尔德语-索拉尼语和普什图语中,对120个难民和庇护相关场景对进行社区和语言导向的评估,由Respond Crisis Translation的母语评估者根据六大权利相关标准进行评分。我们以开放数据形式在Mozilla Data Collective上发布结果,遵循与评估者协商的条款,并将反复出现的失败案例(如不安全的转介、缺失的免责声明和刻板印象假设)转化为英文和波斯语的具体防护政策。
测试这些政策暴露出结构性缺陷:事实性与可操作性等标准无法仅通过文本判断。这个非政府组织是否存在?这项法律在该司法管辖区是否仍然有效?文本为主的护栏机制往往对无法验证的响应、虚构术语进行无差别评分,甚至对英文与波斯语政策给出不同评分(详见我们的博文)。因此我们提出假设:基于大语言模型的护栏机制需要借助搜索、检索与事实核查等工具,才能实现更可靠可信的判断。这就是我们带到蒙特利尔进行测试的智能体护栏。
实操环节的发现
整体方法论与上下文护栏的论证(包含语言与场景依赖的政策和工具)获得了参与者的广泛共鸣。35位参与者通过自主选择场景与政策,对智能体与非智能体判断机制在相同响应上的表现进行了对比测试。
工具影响支撑证据的频率高于最终判决结果:90%的判决结果在两种模式下保持一致。但"智能体"行为高度依赖底层判断大模型。Claude Sonnet 4.6在每次运行时都调用网络搜索(平均每轮4.1次工具调用),而GPT-5 Nano几乎不调用(平均每轮0.2次)。当工具被激活时,其影响呈现双向性:核实庇护相关响应中的事实主张会提升评分,而识别出无工具辅助判断者遗漏的事实错误则会将判决结果从"通过"降级为"临界"。
实现可行性的工具支持
如果每次对比都需要重新开发,这些实验就无法实现。Mozilla AI开源的any-guardrail项目提供了统一接口,支持自定义策略的护栏选择与切换,使护栏层的配置灵活性与模型本身相当。而Mozilla新推出的开源LLM网关Otari,则可无缝切换判断器背后的LLM模型。
后续计划
我们正在持续优化设计,测试工具访问能否在人道主义、金融与社会工程等场景中,通过更丰富的工具与上下文场景(涵盖英<->波斯语与英<->西班牙语),提升大语言模型护栏的可靠性与可信度。研究结果即将公布,敬请期待,并希望在下一届ACM FAccT会议上与各位再见。
LLM使用免责声明:Roya Pakzad使用Claude Opus 4.8对本文进行了校对。