From Preferences to Principles: Rubric-Based Alignment for Grounded Knowledge Answers
Apple Machine Learning Research399 字 (约 2 分钟)
85
苹果提出基于评分标准的奖励框架,通过分解多维质量指标提升开放域问答效果,三个评估维度平均提升6.5%。
入选理由:基于检索证据的评分标准框架使答案质量提升6.5%
FeaturedArticle#机器学习#自然语言处理#问答系统#苹果研究英文