产品量子位·原文 2026年9月15日

北京中关村学院7名博士生一个暑假从零训出7B模型ZGCM-1,权重、代码、数据配方全公开

团队组建几百个Agent参与数据、实验、评测,并按L1到L5框架给11类研发任务做自主性评级:实验监控和部署达到L4,模型架构与学习算法设计仍在L2。

AI解读:这条新闻最有价值的部分不是7B模型本身,而是它把一次从零训练大模型的完整过程——各阶段权重、中间checkpoint、训练代码、数据配方和日志——都放了出来。平时研究者读技术报告时最看不明白的"我们做了数据清洗"这类概括,这次能直接对着代码和数据追踪。对想复现、想搞懂训练细节的高校研究者,这是少见的可追溯样本。

7个人能做完大厂几百人团队的活,靠的是自建Agent团队:几百个Agent分头做数据、跑实验、看日志、做评测,人负责提目标、设约束和做关键判断。团队按L1到L5给11类研发任务打分,实验监控和部署到了L4(人给目标后Agent可独立规划执行),模型架构和学习算法设计还在L2。判断很清楚:Agent能接住的是一线执行活,关键设计仍得人来拍板。

训练里踩的坑也值得注意:有一次loss正常下降但模型能力明显退步,最后追到数据分片和shuffle环节,实际送进训练的数据比例发生波动。此后团队密集保存checkpoint,并建了把能力拆成18类、183项、2503个探针的ACE评测体系,一轮诊断约两三分钟。这件事说明单盯loss曲线不足以发现问题,评测颗粒度得足够细。

北京中关村学院7名博士生用2026年一个暑假,从零训练出7B大模型ZGCM-1,随后开放了各阶段训练数据和配方、模型权重、训练代码、中间checkpoint和日志。该消息来自量子位刊载的团队项目介绍。

文章称,ZGCM-1在多项通用评测中与Qwen3-8B等同规模模型表现相近,在部分数学推理和搜索评测中也能与Qwen3-235B-A22B、GLM-5.1等更大规模模型比较;团队认为它在14项推理评测的同规模模型比较中处于领先地位。

七名成员中两人为人工智能方向,两人为网络方向,另外三人分别来自化学、生物和网安。项目由北京中关村学院与中关村人工智能研究院的何纪言指导,核心成员为冯文俊、关浩祥、郭俊毅、梁广、柳浩、沈逸飞、孙锦博、谢彦泰。

七个人怎么替代几百人团队:几百个Agent分头干活

团队把整个工程展开后,认为数据、算法、训练、集群、评测每一项都对应大厂里的一个专项团队。数万亿token来自不同来源,清洗、去重、检查格式、核对分布要反复做,工作量超出七人承受范围。

于是他们组建了由几百个Agent构成的团队,分出做数据、跑实验和做评测的不同Agent子团队,并搭建类似论坛的任务发布与汇报系统,让任务有人接、进展有地方看、结果能被检查,也评价不同Agent的工作。研究者负责提出目标、设定约束和做关键判断,Agent持续推进具体工作。

在数据处理上,Agent队伍能依据人给出的质量要求编写清洗脚本,检查数据分布是否达标,并根据结果自动调整规则和阈值,形成闭环。在实验环节,Agent具备从提交任务、监控日志到定位故障、调整配置的能力,还能主动发现存储与数据传输瓶颈,优化训练框架的I/O流程以提升训练速度。

团队还自研了ZGent平台,把会议讨论、研发决策和计划积累成共享上下文,再把验证过的脚本、工作流和debug经验沉淀为可复用的Skill,让后来加入的Agent接着此前经验做事。

11类研发任务的AI自主性评级:实验监控和部署到L4,架构设计还在L2

为判断AI能独立做多少事,团队把研发过程拆成11类任务,请9名核心参与者按L1到L5的自主性框架逐项评级,文章给出的是评分平均值。

差别明显:实验监控和部署到了L4,即人给定目标与约束后,Agent可以独立规划、执行并根据反馈继续调整;模型架构和学习算法设计仍在L2,更多是帮助实现已有方案、运行预设实验。至于研究什么、关键设计怎么选,仍需要人主导。

团队由此得出的工程结论是:几个人带几百个Agent确实能推进很多工作,但距离让AI独立承担整个研发过程还有不少问题要解决。

loss正常下降但能力退步:问题出在数据分片和shuffle

一次训练中loss仍在下降,模型能力却突然明显退步,曲线没有给出原因。团队最终把问题追到底层的数据分片和shuffle环节:实际送进训练的数据比例发生波动,模型吃进去的数据并不总是预设的那份配方。

此后团队不再只盯loss,而是更密集保存中间checkpoint,追踪知识、数学、代码和推理等能力变化,并建立ACE原子能力评测体系,把能力拆成18类、183项,用2503个探针检查;在内部分布式评测系统中,一轮诊断大约两三分钟。

团队称,这套方法让一次修改哪里变好、哪里退步,下一步该查数据还是训练方法,都有了更具体的依据。文章还提到,训练到一半时团队让模型写了一首歌,它确实写出来了。

效率方案:256K上下文吞吐提升约3.94倍,预训练效率提高约4.2倍

针对长推理、搜索和多轮工具调用不断积累上下文的问题,团队采用局部注意力与全局注意力结合的架构,在训练过程中把上下文从16K逐步扩展到64K、256K。文章称,在256K上下文下,这套设计相较全注意力方案带来约3.94倍的吞吐提升,KV Cache占用降至约六分之一。

团队还结合Muon和FP8改善训练效率,用延迟缩放与TWEO抑制极端激活值,改善低精度训练的稳定性。整套方案在16K预训练中达到相同loss的效率,相比标准BF16/AdamW基线提高约4.2倍。

团队把交互轨迹重新组织成状态与行动,让模型根据当前任务、历史交互和最新反馈学习下一步决策,以应对搜索后读哪个结果、工具失败后如何恢复、新证据出现后要不要改计划这类长程判断。

SFT实战发现:样本减少约44.9%后整体评测反而提升

文章列出几条来自实验修正的判断:SFT阶段更严格的质量筛选让样本减少约44.9%,整体评测表现反而有所提升,但并非每项能力都同步受益;长思维链数据比例过高会损害指令遵循;Agent数据不能脱离通用能力单独训练。

团队表示,他们因此更在意一个方法在什么条件下有效、需要付出什么代价。这些发现来自SFT数据处理流程,涵盖格式规范、质量验证、配比选择和评测去污染。

下一步:已开始尝试400B、500B规模

文章称,7B阶段结束后,团队已经开始尝试400B、500B规模的模型,并准备继续用实验回答两个问题:7B阶段积累的方法到更大规模还能用多少,几百个Agent又能承接多少新的工作。

ZGCM-1技术报告、训练与数据处理代码、模型权重、训练数据均已公开,链接分别指向GitHub和Hugging Face上的zgcagi仓库。

信息来源

量子位原始来源