From Preferences to Principles: Rubric-Based Alignment for Grounded Knowledge Answers
TL;DR · AI 摘要
苹果提出基于评分标准的奖励框架,通过分解多维质量指标提升开放域问答效果,三个评估维度平均提升6.5%。
核心要点
- 基于检索证据的评分标准框架使答案质量提升6.5%
- 分解为结构/依据/指令遵循三个维度提升模型一致性
- 事实支持度和指令遵循能力同步提升4%以上
结构提纲
按章节快速跳转。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- 评分标准对齐框架
- 方法创新
- 多维质量分解
- 检索证据条件
- 评估结果
- 6.5%性能提升
- 5个基准测试
金句 / Highlights
值得收藏与分享的关键句。
基于检索证据的评分标准使事实支持度提升2.1个百分点
分解为结构/依据/指令维度后,答案组织性提升3.8%
在MKQA等5个基准测试中保持稳定性能提升
从偏好到原则:基于评分标准的 grounded 知识答案对齐 - Apple 机器学习研究
研究领域
方法与算法
,
语音与自然语言处理
内容类型
论文
发表时间
2026年8月
从偏好到原则:基于评分标准的 grounded 知识答案对齐
作者 Aman Saini, Priyanshu Kumar, Eric Peng, Kai Yuan, Harsh Girase, Wanming Chen
查看出版物
复制 Bibtex
为开放领域问答设计有效的奖励信号具有挑战性,因为高质量的回答必须同时满足多个难以用整体标量目标捕捉的答案质量维度。我们引入了一个基于评分标准的奖励框架,该框架根据检索到的证据生成特定查询的评分标准,并将其分解为多个质量维度,在微调过程中提供细粒度的监督。在三个评估维度(内容结构、事实依据和指令遵循)上平均计算,我们的方法相比指令微调基线提升了6.5%,相比扁平评分标准变体提升了4%,所有评估数据集上均有稳定提升。将评分标准与检索证据结合可提升事实支撑能力,而将评分标准分解为特定质量维度则进一步提升了连贯性、组织性和对查询要求的遵循度。我们的实验表明,基于证据的多维评分标准为复杂开放领域问答提供了更有效的奖励监督。
相关阅读与更新
开放领域问答模型能否回答视觉知识问题?
2022年2月28日 研究领域 语音与自然语言处理
外部知识视觉问答(OKVQA)任务要求自动系统使用外部知识回答关于图片和图像的自然语言问题。我们观察到许多包含指代性短语(指向图像中实体)的视觉问题可以重写为"非 grounded"问题,并可通过现有的文本问答系统回答。这使得现有系统能够复用...
阅读更多
MKQA:多语言开放领域问答的多样化基准
2020年7月30日 研究领域 知识库与搜索 , 研究领域 语音与自然语言处理
跨语言建模的进步依赖于具有挑战性、真实且多样化的评估集。我们引入了多语言知识问答(MKQA),这是一个开放领域问答评估集,包含10k个跨26种语言类型(总计260k个问答对)对齐的问答对。该数据集的目标是为广泛范围内的问答质量提供具有挑战性的基准...
发现机器学习领域的机遇
我们的机器学习研究每天都在取得突破性进展。
与我们合作