Open-sourcing AstaBrief, the fast report-generation model in Asta
TL;DR · AI 摘要
AstaBrief模型将科学报告生成速度提升3.5倍并开源,支持机构本地部署处理敏感数据。
核心要点
- AstaBrief生成报告速度比Thinking模式快3.5倍(51.1秒 vs 178.5秒)
- 开源允许机构在本地运行模型处理未公开研究数据
- 训练数据包含数万真实研究查询及偏好数据
结构提纲
按章节快速跳转。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- AstaBrief模型
- 性能优势
- 生成速度提升3.5倍
- 技术特点
- 单次生成完整报告
- 科学证据关联训练
- 应用价值
- 机构本地部署
- 敏感数据处理
金句 / Highlights
值得收藏与分享的关键句。
Fast模式平均51.1秒生成报告,比Thinking模式快3.5倍
训练数据包含数万真实研究查询和偏好数据
开源允许机构在本地运行处理未公开研究数据
开源AstaBrief,Asta中的快速报告生成模型
返回文章列表
[0
[-1
企业
]
文章
发布于2026年10月2日
点赞
4
[
Kyle Wiggers
Ai2Comms
关注
allenai
🤗 模型 | 📊 数据
语言模型已经能够帮助研究人员搜索文献、综合证据并解决复杂问题。但科学工作对这些模型有特殊要求——答案需要基于证据,模型需要保留证据实际支持的内容而非悄然扩大研究结论,研究人员需要能够验证最终输出。
我们在科学家使用Asta(我们用于科学工作的智能代理平台)的方式中看到了这一点。与简单的关键词搜索不同,用户经常带来大量上下文和诸多约束——例如要求Asta在考虑特定方法、人群或场景时,跨文献比较不同方法。许多人之后还会反复查看生成的报告,将其视为工作研究素材而非一次性答案。
我们希望帮助科学家更快生成带引用的报告,使用他们可以自行下载运行的模型。为此,我们测试了专为科学报告生成训练的小型开源模型,是否能在保证报告质量的同时,减少生成时间和服务成本。
我们构建了AstaBrief 8B,这是一个将研究问题和检索到的文献摘录转化为引用报告的模型。AstaBrief今天已在Asta的"生成报告"功能中作为"快速模式"上线,与Claude驱动的"思考模式"并行提供。我们同时开源了该模型和训练数据,以便其他人研究、复现并基于我们的方法进行开发。
开发AstaBrief需要数万个真实研究查询、以引用为中心的过滤、偏好数据,以及重新设计的报告生成流程——该流程通过单次完整生成而非分章节生成报告。与我们追踪的专有模型相比,报告生成时间减少了近一个数量级——在完整的Asta流程中,快速模式平均每份报告耗时51.1秒,而思考模式耗时178.5秒,快约3.5倍。
这些效率提升使AstaBrief成为实现更广泛目标的有用测试案例:构建可适应科学工作特定需求的开源语言模型。
开源权重还将使机构能够在自有基础设施上运行AstaBrief,这在研究问题涉及敏感或未发表工作时是必要的。除了模型权重,我们还发布了研究人员可调整以从自有PDF生成报告的示例工作流,为本地报告生成提供起点。
本文将介绍我们如何训练AstaBrief,关于如何将其扎根于科学证据的发现,以及我们认为可延续到未来科学模型的方法部分。大部分训练和评估工作在2025年完成,因此用于生成训练数据和作为对比的专有模型反映了当时的前沿水平。我们尚未针对当前前沿模型重新运行完整评估;以下结果应被视为关于特定训练和系统设计选择的证据。
训练模型
我们的目标是通过AstaBrief构建一个开放权重模型,具备长文本科学综述最重要的特性:答案质量、相关性、结构化和引用依据。我们以Qwen3-8B为基础,将大部分精力集中在后训练数据、评估以及报告生成的配套框架上。
在Ai2,我们正在广泛探索将通用模型适配到科研领域以及从零开始训练新的科研模型。通过NSF OMAI(由Ai2主导的美国国家科研发现全开放AI基础设施和模型建设项目),我们的研究人员正与科学界直接合作,了解未来开放模型需要满足的需求以及当前通用模型的不足之处。这包括研究不同科学领域和工作流程中的需求差异,未来将分享更多相关研究发现。
近期的工作,包括我们的DR Tulu项目,表明基于强化学习(RL)的方法可以提升开放权重模型的长文本报告生成能力,尤其是在训练过程中引入判别模型时效果更显著。我们曾考虑过这一路径,但最终选择了以监督微调(SFT)和直接偏好优化(DPO)为核心的更简单方案。
基于强化学习的训练方法可能不稳定且成本高昂。我们希望探索在更经济、更易于操作的设置下,能够达到多高的报告生成质量——这种设置也更容易调试和迭代。
这使得训练数据的质量变得尤为重要。我们没有依赖更复杂的优化方法来弥补噪声样本的影响,而是投入大量精力研究如何生成、筛选和过滤真正能体现我们期望报告撰写行为的样本。
我们还希望AstaBrief运行速度更快,让用户能快速获得初步报告并在后续交互中进行迭代。为提升速度,我们决定让AstaBrief在单次处理中直接根据用户查询和相关检索片段生成最终报告,跳过了Claude基于思考模式使用的昂贵片段摘要和聚类阶段,并且不按章节逐步生成答案。有趣的是,我们发现这样做并不会影响性能。
收集SFT训练数据
训练流程始于通过我们论文《Synthesizing scientific literature with retrieval-augmented LMs》和ScholarQA(现为Asta生成报告功能的基础框架)所描述系统提交的真实用户查询。我们没有仅使用合成提示或基准任务进行训练,而是希望AstaBrief能从真实科学家提出的真实查询中学习。
我们的研究表明,科学家对语言模型的使用方式往往与普通用户使用通用聊天机器人或传统搜索工具的方式不同。在对数以万计的Asta查询进行分析时,我们发现专家研究人员经常提供大量上下文、多个约束条件以及概念间的关系,而不是依赖简短的关键词式提示。
更近期的Asta用户研究也揭示了研究人员希望AI参与其工作的不同方式——有些人乐于使用模型进行创意构思或实验,而另一些人则更倾向于让AI在综合信息、文献监控或模式发现等环节扮演更有限的角色。无论存在哪些差异,参与者都希望获得更清晰的来源可追溯性、更透明地了解模型的运作过程,并能更有效地控制模型使用的上下文环境。
我们对收集到的用户日志进行了质量、相关性和隐私方面的筛选,剔除了测试人员和机器人流量,过滤掉过于简短而无意义的查询,并通过基于LLM的过滤流程识别出非英文查询、非科学性请求以及包含个人身份信息的提示。最终筛选出约9万条以研究为导向的查询。
在进行SFT(监督微调)时,我们使用Asta报告生成背后的多步骤ScholarQA流程,从筛选后的查询中生成完整的报告目标输出。该流程检索相关文献,将材料组织成不同章节,并利用支持报告生成的模型将证据综合成引用报告。我们使用了多种专有系统:Claude 3.5 Sonnet、Claude 3.7 Sonnet、o3、o4-mini和GPT-4.1。经过质量筛选后,最终获得4.7万个可用的训练样本。
创建DPO对
DPO(直接偏好优化)需要不同类型的训练数据。与每个查询对应一个目标报告不同,我们需为每个查询生成一对报告,并明确其中的优先级。
这些对由SFT数据生成过程中未使用的查询子集构建而成。每个查询对应的一份报告来自现有的ScholarQA流程(通常由Claude 3.5 Sonnet或3.7 Sonnet支持)。另一份竞争性报告则通过将ScholarQA检索到的文献片段输入不同模型生成,具体模型根据示例选择:o3、o4-mini、DeepSeek-V3或DeepSeek-R1。
两个判断模型(GPT-4.1和DeepSeek-R1)对每对报告进行比较并选出优胜者。我们确保LLM判断模型与人类偏好保持一致(一致性达95%),仅保留两个判断模型达成一致的报告对,这使我们获得更清晰的偏好集合,显著降低了大规模生成偏好数据时通常出现的噪声。
经过质量筛选后,最终的DPO数据集包含约6000个示例。
通过使用多个生成器并要求两个判断模型达成一致,我们找到了一种相对简单的方法来构建偏好数据,而无需将任何单个模型的输出或判断视为绝对真理。
优化数据过滤以提高归因准确性
我们的主要评估目标是SQABench-CS2,这是一组200个用户撰写的计算机科学研究问题。在AstaBrief的开发过程中,我们跟踪了四个关键指标:
- 评分标准分数:衡量报告覆盖必要内容的程度。
- 答案精确度:衡量每个段落是否与问题相关。
- 引用精确度:衡量每个引用是否支持其附带的主张。
- 引用召回率:衡量报告中的主张是否完全由提供的引用支持。
对于最终模型,我们还进行了二次评估:DeepScholarBench,这是一个基于近期ArXiv论文构建的63个查询长篇研究综合基准测试,以及两项针对Claude驱动流水线生成报告的独立对比评估——一项是基于SQABench-CS2的LLM判断比较,另一项是小型人工研究。
一份报告可能听起来完整而精致,但实际上却偏离了问题,或引用了缺乏足够证据支持的主张。对于科学综述而言,我们需要分别衡量这些行为。但引用支撑只是科学严谨性的一部分——模型可能引用了正确的研究,但仍可能提出比研究本身支持程度更强的主张。这种情况可能以微妙的方式发生,例如将针对特定样本的发现泛化为对整个群体的通用主张,将过去时态的报告结果转化为听起来更具普遍性的现在时态陈述,或将描述性发现转化为对临床医生、政策制定者或研究人员应采取行动的建议。
这些泛化在科学报告生成中尤为重要,因为每一步都可能扩大证据的表面范围,而不会引入明显错误的陈述。因此,被引用的句子可能在技术上与来源相关,但仍可能夸大了研究人员实际证实的内容。我们的开发指标主要关注相关性、覆盖范围和引用依据;对科学报告撰写者的更全面评估还应测试他们是否保留了来源中主张的范围和强度。
我们的首次SFT运行提升了整体内容质量,但在答案精确性和引用质量方面仍落后于Claude驱动的报告生成流水线。换句话说,模型在撰写报告方面有所改进,但其对证据的依据仍不够一致,无法满足科学综述的需求。
这促使我们投入更多时间提升数据质量。我们测试了四种基于统计的过滤器,以识别较弱的合成训练示例:
- 输出与输入的token比例:比例过高的答案通常存在噪声,因为它们从过少的证据中生成了大量文本。
- 引用相关性:对于训练集中的每个合成报告,我们计算其引用论文的检索相关性得分平均值。低平均值表明报告过度依赖排名较低的证据。
- 引用密度:我们测量了至少有一处引用的陈述所占比例。低密度报告通常包含大段未支持的文本。
- 引用多样性:我们测量了答案中引用的论文比例,基于Claude驱动的报告检索流水线返回的论文集合。低分表明报告过度依赖少数论文。
最大的提升来自于过滤掉引用密度较低的合成报告;更激进的过滤、过滤组合和学习率调整并未带来显著提升。
这是项目中最清晰的教训之一:更复杂的过滤并不一定更好。一个相对简单的信号——合成报告是否持续引用其主张——比我们尝试的多种更复杂的组合更有用。换句话说,科学专业化并不一定取决于在预训练中增加更多科学文本;后训练数据的构成和质量,以及其是否展示出引用依据和归因等行为,会显著影响最终模型的表现。
验证方法
由于该模型旨在作为我们代理式Asta报告生成框架的一部分(不一定是独立模型),我们主要关注的问题是:AstaBrief是否能在保持我们关注的报告质量的同时,实现显著更快且更便宜的报告生成流程。换句话说,我们不仅询问该模型是否能在单个基准测试中匹配更强大的专有模型;我们更想知道在系统大幅简化的情况下,能保留多少原有质量。
每个条目按最佳排序;所有指标中数值越高越好。Qwen3-8B仅在SQABench-CS2测试中进行了评估。SQABench-CS2是一组用户撰写的计算机科学研究问题;DeepScholarBench则使用其自有指标对长篇研究综述进行评分,这些指标与SQABench-CS2的指标不可比较。
在开发过程中使用的评估中,AstaBrief在答案和引用质量的多个指标上与基于Claude的流程和DR Tulu具有竞争力。下图显示了LLM判断的比较结果——在单独的14个问题的人类研究中,三位科学研究员每人贡献了4-5个问题,并根据总体偏好、完整性、相关性、组织性和引用准确性(允许并列)对三个系统的报告进行排名。在总体偏好方面,DR-Tulu胜出,但三位研究员中有两位在引用准确性指标上更偏好AstaBrief,这证明了我们SFT数据质量过滤器的实用性。
柱状图显示每个系统在相同问题上与Thinking模式进行报告比较时获胜的比例。人类判断是单独评估的,未包含在内。Thinking模式是对比参考基准,没有对应柱状图。与DR-Tulu不同,Asta Brief在DPO阶段专门针对这种成对报告排名进行了优化。
这些数据应被视为当时工程方法的验证,而不是对这个特定基础模型相对于当前前沿水平的定位声明。模型生态系统发展迅速——数据构建、归属过滤和部署经验是预期可以推广的部分。
在Asta中验证AstaBrief的实用性时,Fast模式的早期使用情况令人鼓舞。在374名尝试过该模式的Asta用户中,29.1%的用户连续两天或更多天使用它,用户平均使用该模式生成3.67份报告线程。23%尝试过Fast模式的用户持续使用它,并且从未切换回Thinking模式进行后续线程。另外18%的用户根据目标在Fast模式和Thinking模式之间切换,将Fast模式用于约40%的线程。
尽管反馈总体过于稀疏,难以得出强结论,但我们观察到Fast模式获得积极反馈的比例与Thinking模式相当(84.2% vs 85.2%)。
下一步方向
Asta的报告生成功能是AstaBrief的首次生产环境应用,为研究人员提供了开放权重的Fast模式,同时保留现有的Thinking模式。由于模型采用开放权重,机构可以将其部署在自有硬件上,包括部署在自己的防火墙后,而无需依赖专有模型API进行报告生成。
在Asta中,这也意味着我们可以在保留Thinking模式作为计算密集型任务选项的同时,直接研究和改进报告生成流程的这一部分。
仍有更多工作要做。我们正在探索更细粒度的偏好学习、更强的RAG-plus-RL方法、多轮对话和多工具能力、额外的科学数据源以及查询分解。我们还对超越"声明是否有支持性引用"的评估方式感兴趣,希望探讨模型是否能保留证据的完整性——这不仅有助于更准确地捕捉报告作为研究产物的质量,也能评估模型是否保留了来源的证据范围。这包括简洁性和条理性等特性,以及模型是否会将特定样本的发现转化为广泛的一般性结论,或把描述性结果转化为建议。
AstaBrief是我们在科学语言模型领域一系列研究中的一个实验,从ScholarQA和DR Tulu到正在逐步成型的Olmo未来版本。这里的经验教训——特别是在训练数据、过滤和评估方面——将有助于指导我们下一步的构建工作。
立即在Asta中尝试Fast模型,或从Hugging Face下载AstaBrief。
本文提及的模型 1
本文提及的集合 1
更多作者文章
介绍Olmo-core 3:面向大型MoE的开放可扩展训练基础设施
22
2026年10月1日
BenchMIRT:大型语言模型基准实际在衡量什么?
27
2026年9月1日
社区
编辑
预览
通过拖拽、粘贴或点击此处上传图片、音频和视频
轻点或粘贴此处上传图片
评论
· 注册或登录以评论