Ai2开源AstaBrief 8B:科学报告生成进入单次生成时代
基于Qwen3-8B,用SFT + DPO替代强化学习路线,Fast模式平均 51.1 秒生成一份带引用报告,比Thinking模式快约 3.5 倍;模型权重与训练数据同步开放。
AI解读:Ai2把AstaBrief 8B开源了,同时放出训练数据。这个模型解决的具体问题是:让科研人员用自己下载、自己部署的模型快速生成带引用的文献综述报告,而不是每次都调闭源API。
它选了一条更便宜的路。团队没有用强化学习,而是用监督微调加直接偏好优化,把主要精力花在筛选训练数据上——尤其是把引用密度低的合成报告删掉,这一步带来的提升最明显。结果是一个 80 亿参数的模型在开发期评测中接近Claude驱动管线的答案与引用质量,同时单次生成、速度约为后者的 3.5 倍。
真正会因此改变做法的是有敏感或未发表研究问题的机构。权重开放意味着可以放在自有硬件甚至防火墙后面运行,还附了一个从本地PDF生成报告的示例工作流。不过原文明确说训练与评测大多在 2025 年完成,对比的是当时的闭源前沿模型,没有对今天的前沿模型重跑评测,所以这些数字应被当作对特定训练和系统设计选择的验证。
Ai2在Hugging Face博客宣布开源AstaBrief 8B——一个把研究问题和检索到的文献片段转成带引用报告的模型,并同步开放训练数据。该模型今天已作为Asta「Generate a report」功能里的Fast模式上线,与Claude驱动的Thinking模式并列。
AstaBrief从Qwen3-8B起步,训练重点放在后训练数据、评测与报告生成的配套脚手架上。团队采用监督微调(SFT)加直接偏好优化(DPO)的简化方案,没有走强化学习路线,理由是RL训练不稳定且昂贵,而他们想看一个更便宜、更易调试和迭代的方案能把报告质量推到多远。
SFT数据来自 9 万条真实科研查询
SFT训练数据的源头是用户通过ScholarQA框架(Asta报告生成功能的基础)提交的真实查询,而非纯合成提示或基准式任务。团队对用户日志做了质量、相关性和隐私过滤:剔除beta测试者和机器人流量、丢弃过短查询,并用一轮LLM过滤识别非英文查询、非科学请求和包含个人信息的提示,最终得到约 9 万条研究型查询。
目标输出由ScholarQA多步管线生成,调用Claude 3.5 Sonnet、Claude 3.7 Sonnet、o3、o4-mini和GPT-4.1等专有系统合成带引用报告;经质量过滤后得到 4.7 万条可用训练样本。
- SFT查询池:90K条研究型查询
- SFT可用样本:47K条
- 生成目标报告所用专有模型:Claude 3.5 Sonnet、Claude 3.7 Sonnet、o3、o4-mini、GPT-4.1
DPO偏好对约 6K条,两名评审一致才保留
DPO需要成对报告而非单一目标。团队从未用于SFT生成的另一批查询中构建偏好对:一份来自现有ScholarQA管线,通常由Claude 3.5 Sonnet或 3.7 Sonnet支撑;竞争报告则把ScholarQA检索到的文献片段交给o3、o4-mini、DeepSeek-V3或DeepSeek-R1生成。
GPT-4.1和DeepSeek-R1两个评审模型逐对比较并选出胜者。团队称LLM评审与人类偏好的一致率为 95%,只保留两名评审意见一致的偏好对。质量过滤后最终DPO数据集约 6K条。
- 竞争报告生成模型:o3、o4-mini、DeepSeek-V3、DeepSeek-R1
- 评审模型:GPT-4.1、DeepSeek-R1,与人类偏好一致率 95%
- 最终DPO数据:约 6K条
筛引用密度比堆复杂过滤器更有效
首个SFT版本提升了整体内容质量,但在答案精确度和引用质量上仍落后于Claude驱动的报告管线。团队据此转向数据质量,测试了四类统计过滤器:输出与输入token比、引用相关性均值、引用密度(至少有一条引用的陈述占比)、引用多样性。
提升最大的是过滤掉引用密度低的合成报告。更激进的过滤、过滤器组合和学习率扫描都没有带来有意义的额外收益。博客称这是项目最清楚的教训之一:相对简单的信号——合成报告是否持续为其陈述提供引用——比更复杂的组合更有用。
- 测试的四类过滤器:输出/输入token比、引用相关性、引用密度、引用多样性
- 收益最大的单项:过滤低引用密度的合成报告
- 更激进过滤与组合未带来显著额外收益
评测与线上使用数据
主要评测目标是SQABench-CS2,一组 200 条用户撰写的计算机科学研究问题,追踪四项指标:评分表分数(必要内容覆盖度)、答案精确度、引用精确度、引用召回率。团队还运行了DeepScholarBench(基于近期arXiv论文、63 条查询的长文综述基准)以及对Claude管线报告的两项成对评测。
在一项 14 个问题的人类研究中,三名科研人员各自贡献 4 至 5 个问题,从总体偏好、完整性、相关性、组织、引用准确性等维度对三个系统的报告排名,允许并列。总体上DR-Tulu胜出,但三名研究者中有两人在引用准确性指标上更偏好AstaBrief。
线上使用方面,在 374 名试用过Fast模式的Asta用户中,29.1% 使用了两天或以上,人均生成 3.67 个报告线程;23% 的用户此后持续使用Fast模式,未再切回Thinking模式;另有 18% 在两种模式间按目标切换,其中约 40% 的线程使用Fast模式。Fast模式获得正面反馈的比例为 84.2%,Thinking模式为 85.2%。
- SQABench-CS2:200 条用户撰写的计算机科学研究问题
- DeepScholarBench:63 条查询,指标与SQABench-CS2不可比
- 人类研究:3 名研究者、14 个问题、允许并列
- Fast模式用户:374 人尝试,人均 3.67 个报告线程
- 正面反馈:Fast模式 84.2%,Thinking模式 85.2%
速度数据与明确的适用边界
AstaBrief被训练为在给定用户查询和检索到的相关片段后,一次生成完整最终报告,跳过Claude版Thinking模式使用的片段摘要与聚类阶段,也不逐节写出答案。团队称这一做法没有牺牲性能。
在完整Asta管线中,Fast模式平均每份报告 51.1 秒,Thinking模式为 178.5 秒,约快 3.5 倍;博客同时称相比其追踪的专有模型实现了接近一个数量级的报告生成时间缩减。
博客明确说明:大部分训练和评测在 2025 年完成,用于生成训练数据和作为对比点的专有模型反映的是当时的前沿水平;团队没有针对今天的前沿模型重跑完整评测,结果最好被理解为对特定训练与系统设计选择的证据。
权重开放后,机构可在自有基础设施上运行AstaBrief,包括部署在自有防火墙之后,这对研究问题涉及敏感或未发表工作时是必要的。随模型权重一同发布的还有一个示例工作流,研究者可据此用自己的PDF生成报告。
- Fast模式平均 51.1 秒/报告,Thinking模式 178.5 秒,约 3.5 倍
- 开发期对比基于 2025 年的前沿模型,未对今天的前沿模型重跑评测
- 权重开放支持自有硬件与防火墙内部署
- 随权重提供从自有PDF生成报告的示例工作流