留言

7名博士生仅用3个月从零训练7B大模型:代码+数据+训练日志全公开

允中 发自 凹非寺 量子位 | 公众号QbitAI 北京中关村学院7名博士生,用一个暑假,从零训练出了一个7B大模型——ZGCM-1。 随后,他们把各阶段训练数据和配方、模型权重、训练代码、中间checkpoint和日志也开放出来,让每一位感兴趣的研究者都可以追溯、复现整个流程。 在多项通用评测中,ZGCM-1与Qwen3-8B等同规模模型表现相近;在部分数学推理和搜索评测中,它也能与Qwen3-235B-A22B、GLM-5.1等更大规模的模型比较。 但比最终分数更让人好奇的是,数据、训练、集群、评测这一整套工程,在大厂通常需要几百人的团队协作完成,七个人怎么做得过来? 他们给自己组建了一支几百个Agent的团队,分头处理数据、跑实验、看日志、做评测,亲手实践「AI4AI」研发范式。 模型训完后,团队还对整个模型研发流程中Agent的实际表现做了一次评级,希望基于本次完整的大模型训练实践,为RSI现状提供真实的工程结论。 至于为什么开始做这件事,还要从一顿火锅说起。 △ZGCM-1模型能力概览及主要技术路线 看了很多技术报告,还是想自己训一次 七个人最初因为兴趣凑到一起:两人人工智能方向,两人网络方向,另外三人分别来自化学、生物和网安。 平时,他们更多是在现成模型上做微调。技术报告看了不少,许多问题却还是想不明白:数据到底怎么选,训练出了问题怎么查,最后写进报告里的方法,又是经过多少次失败才留下来的?一句“我们进行了数据清洗”,落到实际工程中,究竟意味着多少工作? 吃火锅时,大家聊到了这些困惑,也聊出了一个念头:既然光看报告总有弄不明白的地方,要不要自己从头训练一次? 当时,他们甚至想用一个7B模型去挑战Sonnet这样的模型。参数装不下那么多知识,就让模型多想一会儿,学会搜索、使用工具。 至于能走多远,谁也没有把握。他们想先动手,也把过程留下来,让其他学校里同样好奇的研究者有东西可参考。 老师们半信半疑,还是决定让他们试试,先给了一些算力。 接下来的几天,大家日夜赶着复现已有项目,快速迭代一个小模型。团队较为顺利地把完整流程快速跑通了,也让老师们看到继续投入的可能,团队因此获得了更多资源,饭桌上聊出的想法开始变成每天都要推进的工程。 真正开始7B模型的训练之后,他们才发现还有很多东西没有真正弄懂。有些概念在论文里见过,到了要改代码、解释实验现象的时候,又会卡住。 于是大家就让Agent从基本原理开始调研讲解,讲完再回到代码和实验里验证。原本冷冰冰的知识,开始对应具体的实现,也对应一次训练为什么跑不下去。 七个人忙不过来,就组建几百个Agent的团队 也有觉得干不了的时候,他们把整个工程展开,数据、算法、训练、集群、评测……每一项都能对应大厂里的一个专项团队。 七个人既要推进任务,又要不断补课,各种问题也接踵而至。 数据尤其如此:数万亿token来自不同来源,质量参差不齐,清洗、去重、检查格式、核对分布,做完一轮还要继续检查。 当所有这些环节同时压在七个人身上,工作量便远超他们的承受范围。 于是,他们开始给自己组建一支Agent团队。 几个人调度几百个Agent,逐渐分出了做数据、跑实验和做评测的不同Agent子团队,还搭建了类似论坛的任务发布与汇报系统,让任务有人接、进展有地方看、结果能被检查,也评价不同Agent的工作。 研究者负责提出目标、设定约束和做关键判断,Agent把具体工作持续推进下去。 比如在数据处理上,团队构建的Agent队伍能依据人给出的质量要求编写清洗脚本,检查数据分布是否达标,并根据结果自动调整规则和阈值,形成一个闭环。 在实验环节,它们同样具备从提交任务、监控日志到定位故障、调整配置的完整能力,甚至能主动发现存储与数据传输的瓶颈,优化训练框架的I/O流程,从而提升训练速度。 同时为了优化Agent之间的迭代和沟通效率,团队通过自研的ZGent平台,把会议讨论、研发决策和计划积累成共享上下文,再把验证过的脚本、工作流和debug经验沉淀为可复用的Skill。后来加入的Agent可以接着此前的经验做事。 大家的日常里,也多了把问题讲清楚、把任务组织好,再回来检查结果这几件事。 △人与Agent共同参与研发,会议决策和实验经验在后续任务中持续复 后来,大家逐渐意识到,这种借助AI来研发AI的做法,正是最近非常流行的“AI4AI”。 不过,如果追问AI到底已经能独立做多少事情,光凭“帮了很大忙”的印象还不够。 于是,团队将研发过程拆成11类任务,请核心参与者按照L1到L5的自主性框架逐项评级。 差别很明显,实验监控和部署到了L4,人给定目标与约束后,Agent可以独立规划、执行,并根据反馈继续调整;模型架构和学习算法设计仍在L2,更多是帮助实现已有方案、运行预设实验。 至于研究什么、关键设计怎么选,还需要人

about image
阿季奇前教练:去萨索洛最合适,希望他进10球 14年连续进季后赛,道奇主帅却说今年最"饿"