Apple Machine Learning Research

From Preferences to Principles: Rubric-Based Alignment for Grounded Knowledge Answers

8.5内容质量

TL;DR · AI 摘要

苹果提出基于评分标准的奖励框架,通过分解多维质量指标提升开放域问答效果,三个评估维度平均提升6.5%。

核心要点

  • 基于检索证据的评分标准框架使答案质量提升6.5%
  • 分解为结构/依据/指令遵循三个维度提升模型一致性
  • 事实支持度和指令遵循能力同步提升4%以上

结构提纲

按章节快速跳转。

  1. 指出开放域问答中多维质量指标难以量化的问题。

  2. 提出基于检索证据的评分标准框架分解为三个质量维度。

  3. 在三个评估维度上平均提升6.5%,优于基线模型4%。

  4. 通过条件评分标准提升事实支持度和指令遵循能力。

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • 评分标准对齐框架
    • 方法创新
      • 多维质量分解
      • 检索证据条件
    • 评估结果
      • 6.5%性能提升
      • 5个基准测试

金句 / Highlights

值得收藏与分享的关键句。

#机器学习#自然语言处理#问答系统#苹果研究
打开原文

从偏好到原则:基于评分标准的 grounded 知识答案对齐 - Apple 机器学习研究

研究领域

方法与算法

,

语音与自然语言处理

内容类型

论文

发表时间

2026年8月

从偏好到原则:基于评分标准的 grounded 知识答案对齐

作者 Aman Saini, Priyanshu Kumar, Eric Peng, Kai Yuan, Harsh Girase, Wanming Chen

查看出版物

复制 Bibtex

为开放领域问答设计有效的奖励信号具有挑战性,因为高质量的回答必须同时满足多个难以用整体标量目标捕捉的答案质量维度。我们引入了一个基于评分标准的奖励框架,该框架根据检索到的证据生成特定查询的评分标准,并将其分解为多个质量维度,在微调过程中提供细粒度的监督。在三个评估维度(内容结构、事实依据和指令遵循)上平均计算,我们的方法相比指令微调基线提升了6.5%,相比扁平评分标准变体提升了4%,所有评估数据集上均有稳定提升。将评分标准与检索证据结合可提升事实支撑能力,而将评分标准分解为特定质量维度则进一步提升了连贯性、组织性和对查询要求的遵循度。我们的实验表明,基于证据的多维评分标准为复杂开放领域问答提供了更有效的奖励监督。

相关阅读与更新

开放领域问答模型能否回答视觉知识问题?

2022年2月28日 研究领域 语音与自然语言处理

外部知识视觉问答(OKVQA)任务要求自动系统使用外部知识回答关于图片和图像的自然语言问题。我们观察到许多包含指代性短语(指向图像中实体)的视觉问题可以重写为"非 grounded"问题,并可通过现有的文本问答系统回答。这使得现有系统能够复用...

阅读更多

MKQA:多语言开放领域问答的多样化基准

2020年7月30日 研究领域 知识库与搜索 , 研究领域 语音与自然语言处理

跨语言建模的进步依赖于具有挑战性、真实且多样化的评估集。我们引入了多语言知识问答(MKQA),这是一个开放领域问答评估集,包含10k个跨26种语言类型(总计260k个问答对)对齐的问答对。该数据集的目标是为广泛范围内的问答质量提供具有挑战性的基准...

发现机器学习领域的机遇

我们的机器学习研究每天都在取得突破性进展。

与我们合作