网易首页 > 网易号 > 正文 申请入驻

7名博士生仅用3个月从零训练7B大模型:代码+数据+训练日志全公开

0
分享至

允中 发自 凹非寺
量子位 | 公众号QbitAI

北京中关村学院7名博士生,用一个暑假,从零训练出了一个7B大模型——ZGCM-1。

随后,他们把各阶段训练数据和配方、模型权重、训练代码、中间checkpoint和日志也开放出来,让每一位感兴趣的研究者都可以追溯、复现整个流程。

在多项通用评测中,ZGCM-1与Qwen3-8B等同规模模型表现相近;在部分数学推理和搜索评测中,它也能与Qwen3-235B-A22B、GLM-5.1等更大规模的模型比较。

但比最终分数更让人好奇的是,数据、训练、集群、评测这一整套工程,在大厂通常需要几百人的团队协作完成,七个人怎么做得过来?

他们给自己组建了一支几百个Agent的团队,分头处理数据、跑实验、看日志、做评测,亲手实践「AI4AI」研发范式。

模型训完后,团队还对整个模型研发流程中Agent的实际表现做了一次评级,希望基于本次完整的大模型训练实践,为RSI现状提供真实的工程结论。

至于为什么开始做这件事,还要从一顿火锅说起。


△ZGCM-1模型能力概览及主要技术路线

看了很多技术报告,还是想自己训一次

七个人最初因为兴趣凑到一起:两人人工智能方向,两人网络方向,另外三人分别来自化学、生物和网安。

平时,他们更多是在现成模型上做微调。技术报告看了不少,许多问题却还是想不明白:数据到底怎么选,训练出了问题怎么查,最后写进报告里的方法,又是经过多少次失败才留下来的?一句“我们进行了数据清洗”,落到实际工程中,究竟意味着多少工作?

吃火锅时,大家聊到了这些困惑,也聊出了一个念头:既然光看报告总有弄不明白的地方,要不要自己从头训练一次?

当时,他们甚至想用一个7B模型去挑战Sonnet这样的模型。参数装不下那么多知识,就让模型多想一会儿,学会搜索、使用工具。

至于能走多远,谁也没有把握。他们想先动手,也把过程留下来,让其他学校里同样好奇的研究者有东西可参考。

老师们半信半疑,还是决定让他们试试,先给了一些算力。

接下来的几天,大家日夜赶着复现已有项目,快速迭代一个小模型。团队较为顺利地把完整流程快速跑通了,也让老师们看到继续投入的可能,团队因此获得了更多资源,饭桌上聊出的想法开始变成每天都要推进的工程。

真正开始7B模型的训练之后,他们才发现还有很多东西没有真正弄懂。有些概念在论文里见过,到了要改代码、解释实验现象的时候,又会卡住。

于是大家就让Agent从基本原理开始调研讲解,讲完再回到代码和实验里验证。原本冷冰冰的知识,开始对应具体的实现,也对应一次训练为什么跑不下去。

七个人忙不过来,就组建几百个Agent的团队

也有觉得干不了的时候,他们把整个工程展开,数据、算法、训练、集群、评测……每一项都能对应大厂里的一个专项团队。

七个人既要推进任务,又要不断补课,各种问题也接踵而至。

数据尤其如此:数万亿token来自不同来源,质量参差不齐,清洗、去重、检查格式、核对分布,做完一轮还要继续检查。

当所有这些环节同时压在七个人身上,工作量便远超他们的承受范围。

于是,他们开始给自己组建一支Agent团队。

几个人调度几百个Agent,逐渐分出了做数据、跑实验和做评测的不同Agent子团队,还搭建了类似论坛的任务发布与汇报系统,让任务有人接、进展有地方看、结果能被检查,也评价不同Agent的工作。

研究者负责提出目标、设定约束和做关键判断,Agent把具体工作持续推进下去。

比如在数据处理上,团队构建的Agent队伍能依据人给出的质量要求编写清洗脚本,检查数据分布是否达标,并根据结果自动调整规则和阈值,形成一个闭环。

在实验环节,它们同样具备从提交任务、监控日志到定位故障、调整配置的完整能力,甚至能主动发现存储与数据传输的瓶颈,优化训练框架的I/O流程,从而提升训练速度。

同时为了优化Agent之间的迭代和沟通效率,团队通过自研的ZGent平台,把会议讨论、研发决策和计划积累成共享上下文,再把验证过的脚本、工作流和debug经验沉淀为可复用的Skill。后来加入的Agent可以接着此前的经验做事。

大家的日常里,也多了把问题讲清楚、把任务组织好,再回来检查结果这几件事。


△人与Agent共同参与研发,会议决策和实验经验在后续任务中持续复

后来,大家逐渐意识到,这种借助AI来研发AI的做法,正是最近非常流行的“AI4AI”。

不过,如果追问AI到底已经能独立做多少事情,光凭“帮了很大忙”的印象还不够。

于是,团队将研发过程拆成11类任务,请核心参与者按照L1到L5的自主性框架逐项评级。

差别很明显,实验监控和部署到了L4,人给定目标与约束后,Agent可以独立规划、执行,并根据反馈继续调整;模型架构和学习算法设计仍在L2,更多是帮助实现已有方案、运行预设实验。

至于研究什么、关键设计怎么选,还需要人来主导。

几个人带着几百个Agent,确实能把许多工作做起来,但距离让AI独立承担整个研发过程,还有不少问题要解决。


△AI研发自主性的五个等级


△不同研发任务中的AI自主性评级,来自团队9名核心参与者的评分的

loss还在降,模型怎么退步了

有了Agent团队,训练中该踩的坑也没有自动消失。一次训练看起来很正常,loss仍在下降,模型能力却突然出现了明显退步。曲线没有告诉他们出了什么事,只能继续往下查。

最后,问题追到了底层的数据分片和shuffle环节:实际送进训练的数据比例发生了波动,模型吃进去的东西,并不总是他们以为的那份配方。

这次以后,团队不敢再只盯着loss。他们更密集地保存中间checkpoint,追踪知识、数学、代码和推理等能力的变化,还建立了ACE原子能力评测体系,把能力拆成18类、183项,用2503个探针进行检查。

在内部的分布式评测系统中,一轮诊断大约两三分钟。一次修改让哪里变好了,又让哪里退步了,下一步该查数据还是训练方法,都有了更具体的依据。


△ACE原子能力评测结果,帮助团队定位不同能力的优势与短板。

在反复排查和修正之间,也有特别开心的时刻。训练到一半,他们让模型写了一首歌,它真的写出来了。

用别人的模型生成文字,已经不是什么新鲜事,但看着自己从随机参数开始训练的模型写出一首歌,感觉还是不同。

那天晚上,大家回到最初吃火锅的地方,又吃了一顿火锅庆祝。后面还有很多工作,饭桌上那个没有把握的想法,至少已经有了可以看见的进展。

当时模型写的那首歌:


△模型写出歌后,大家回到最初吃火锅的地方庆祝

省下的卡,拿来多试几个想法

一路做下来,他们对研究效率的理解也在变化。过去做实验,很容易先想能不能把某个分数再提高一点;真正承担起从零训练的工程,每个想法都要消耗卡时,就必须多问一句:同样的算力,怎样才能获得更好的效果,或者多验证几个假设?

训练快一点,对他们来说,就意味着还有机会再试几个想法。

最初“让小模型多想一会儿”的设想,也遇到了具体的工程问题。

长推理、搜索和多轮工具调用会不断积累上下文,模型既要装得下信息,成本又不能太高。

团队采用局部注意力与全局注意力结合的架构,在训练过程中把上下文从16K逐步扩展到64K、256K。在256K上下文下,这套设计相较全注意力方案带来约3.94倍的吞吐提升,KV Cache占用降至约六分之一。

他们还结合Muon和FP8改善训练效率,并用延迟缩放与TWEO抑制极端激活值,改善低精度训练的稳定性。

整套方案在16K预训练中达到相同loss的效率,相比标准BF16/AdamW基线提高了约4.2倍。省下来的时间和算力,可以继续投入下一轮实验。


△注意力方案的效率对比;中、右图展示长上下文吞吐与KV Cache占

装得下信息以后,模型还得知道下一步该做什么。搜索后读哪个结果,工具失败后如何恢复,新证据出现后要不要改计划,这类长程任务都需要模型有连续判断的能力。

团队把交互轨迹重新组织成一个个状态与行动,让模型根据当前任务、历史交互和最新反馈学习下一步决策。报告里几句话能写完的方法,到了实验中,往往要拆开验证许多次。

真正把模型从头训一遍后,团队也积累了很多只看论文和技术报告很难获得的实践经验。

SFT阶段,更严格的质量筛选让样本减少约44.9%,整体评测表现反而有所提升,尽管并非每项能力都同步受益;长思维链数据比例过高,又会损害指令遵循;Agent数据也不能脱离通用能力单独训练。

他们开始更在意一个方法在什么条件下有效、需要付出什么代价。最后整理出的多条实战发现,就来自这些被实验反复修正的判断。


△SFT数据处理流程,覆盖格式规范、质量验证、配比选择和评测去污

把模型开源,也把建造记录留下来

等到最后一轮评测跑完,大家才更具体地知道,这个模型走到了哪里。

ZGCM-1在14项推理评测的同规模模型比较中处于领先地位,部分搜索和工具调用任务的结果,也让他们看到了较小模型的潜力。


△ZGCM-1与同规模模型在14项推理评测中的排名对比

这些问题,也解释了他们为什么想把过程一起开放。最终权重能让人使用模型,各阶段权重、中间checkpoint、训练代码、数据配方和日志,则让其他研究者有机会追踪能力如何形成,检查一个改动究竟带来了什么。

曾经读技术报告时想知道、却看不到的细节,他们想在自己的项目里尽量留下来。

如今,他们已经开始尝试400B、500B规模的模型。

7B阶段积累的方法,到了更大的规模上还能用多少?几百个Agent又能承接住多少新的工作?

这些问题,他们准备继续在实验里找答案,也把新的过程继续记录、分享。

最初那顿火锅上聊出的想法,还在往前走。

ZGCM-1开源链接
ZGCM-1技术报告:https://github.com/zgcagi/ZGCM-1/blob/main/zgcm-1-tech-report.pdf
训练、数据处理等代码:https://github.com/zgcagi/ZGCM-1
模型权重:https://huggingface.co/zgcagi/ZGCM-1-7B
训练数据:https://huggingface.co/datasets/zgcagi/ZGCM-1-Data

作者团队及合作单位
本项目由北京中关村学院与中关村人工智能研究院的何纪言指导,由AI核心学部、软件智能研究所、未来实验室的师生共同完成,核心成员为(按姓氏拼音排序):冯文俊、关浩祥、郭俊毅、梁广、柳浩、沈逸飞、孙锦博、谢彦泰。
此外,项目还得到了中关村两院以下师生的共同参与和支持(按姓氏拼音排序):陈凯、李亚韬、刘铁岩、任宇轩、邵斌、魏楚扬、徐薛胤、张晓庆、赵王宏楦、郑书新、周可心、朱明航、朱文辉。

*本文系量子位获授权刊载,观点仅为原作者所有。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
港版iPhone18系列,比国行最多便宜2700元,能去香港买么?

港版iPhone18系列,比国行最多便宜2700元,能去香港买么?

互联网.乱侃秀
2026-09-12 10:37:07
国家卫健委提醒:据统计我们盐的摄入量高达每人每天9克,超标了近一倍!尽量少油炸多蒸煮

国家卫健委提醒:据统计我们盐的摄入量高达每人每天9克,超标了近一倍!尽量少油炸多蒸煮

极目新闻
2026-09-14 15:57:13
1983年江青缓刑期满,陈云指示有关部门:如何处理都可以,但不能杀

1983年江青缓刑期满,陈云指示有关部门:如何处理都可以,但不能杀

搜史君
2026-09-11 17:55:08
太离谱!澳洲选手比赛中大便失禁,满身污秽坚持完赛,夺冠后回应惹巨大争议

太离谱!澳洲选手比赛中大便失禁,满身污秽坚持完赛,夺冠后回应惹巨大争议

球盲百小易
2026-09-14 20:03:59
乌兹别克空军曝内幕:中国运-9只是安-12改款,根本满足不了需求

乌兹别克空军曝内幕:中国运-9只是安-12改款,根本满足不了需求

近史谈
2026-09-14 17:24:15
云南一男子将车停在树下一周,妻子取车时发现车缝里密密麻麻全是蚂蚁:打开车门瞬间头皮发麻,现已送至洗车店彻底清洗,后续将做除蚁处理

云南一男子将车停在树下一周,妻子取车时发现车缝里密密麻麻全是蚂蚁:打开车门瞬间头皮发麻,现已送至洗车店彻底清洗,后续将做除蚁处理

云南网络广播电视台
2026-09-14 15:01:50
梅德韦杰夫放话:俄乌战争可能成世界大战!但俄罗斯不接受白停火

梅德韦杰夫放话:俄乌战争可能成世界大战!但俄罗斯不接受白停火

揽星戈
2026-09-14 16:37:05
蒋万安妻子被指“矮化台湾”,国民党议员批:“青鸟”贱招一堆毫无人性

蒋万安妻子被指“矮化台湾”,国民党议员批:“青鸟”贱招一堆毫无人性

海峡导报社
2026-09-15 09:54:04
德国选举上演荒诞剧,44%选票赢不来执政权,输家联合执政引争议

德国选举上演荒诞剧,44%选票赢不来执政权,输家联合执政引争议

呼呼历史论
2026-09-14 08:09:19
鼻毛总是“窜”出来的男人,有什么不同?鼻毛变白,暗示了什么?

鼻毛总是“窜”出来的男人,有什么不同?鼻毛变白,暗示了什么?

熊猫医学社
2026-09-12 11:40:03
阿媒:歼35发动机可靠性弱于阵风,所以埃及选择法国达索公司

阿媒:歼35发动机可靠性弱于阵风,所以埃及选择法国达索公司

巅峰高地
2026-09-13 18:58:04
阳气的惊天秘密!(建议永久收藏)

阳气的惊天秘密!(建议永久收藏)

神奇故事
2026-09-13 22:53:13
别再造神了!孙颖莎丢掉世一仅1天,,糟心的事出现,张本美和成导火索

别再造神了!孙颖莎丢掉世一仅1天,,糟心的事出现,张本美和成导火索

倔强的毛驴
2026-09-15 07:19:49
最扎心的不是失业,是社保年限从15年涨到20年

最扎心的不是失业,是社保年限从15年涨到20年

职场资深秘书
2026-09-13 17:38:40
整个美西世界,加拿大是白左之最,没有之一

整个美西世界,加拿大是白左之最,没有之一

壹家言
2026-09-14 08:55:22
今日重点赛事!9月15日 CCTV5、CCTV5+ 直播节目表 亚冠精英联赛开战

今日重点赛事!9月15日 CCTV5、CCTV5+ 直播节目表 亚冠精英联赛开战

行舟问茶
2026-09-15 08:22:25
美网官宣对5人开出罚单!萨巴伦卡遭罚款7500美元 丢冠后砸拍泄愤

美网官宣对5人开出罚单!萨巴伦卡遭罚款7500美元 丢冠后砸拍泄愤

我爱英超
2026-09-15 06:58:05
一晚消费十几万!网传杭州天价商K价目表流出刷屏,奢靡酒局迎来重拳整治

一晚消费十几万!网传杭州天价商K价目表流出刷屏,奢靡酒局迎来重拳整治

火山詩话
2026-09-14 12:59:03
送孩子上幼儿园,爷爷奶奶能免费吃饭?幼儿园回应:年满60岁即可吃免费早餐

送孩子上幼儿园,爷爷奶奶能免费吃饭?幼儿园回应:年满60岁即可吃免费早餐

齐鲁壹点
2026-09-14 16:53:30
本-华莱士:如果当年选的是甜瓜 我们可能永远都拿不到总冠军

本-华莱士:如果当年选的是甜瓜 我们可能永远都拿不到总冠军

北青网-北京青年报
2026-09-14 20:21:07
2026-09-15 10:47:00
量子位 incentive-icons
量子位
追踪人工智能动态
13313文章数 176562关注度
往期回顾 全部

科技要闻

芯片产业链蒸发超5000亿美元,特朗普大怒

头条要闻

"卖发动机的Tina"让外国人疯狂 "抽象"视频火遍TikTok

头条要闻

"卖发动机的Tina"让外国人疯狂 "抽象"视频火遍TikTok

体育要闻

英格兰业余门将,拒绝去非洲当国王

娱乐要闻

她是敬一丹女儿,把公益当事业

财经要闻

未来五年,电子信息制造业发展规划出炉

汽车要闻

纯电续航960km/迪迪虾上车 腾势N8L纯电售29.98万元起

态度原创

旅游
游戏
本地
教育
公开课

旅游要闻

上海最被低估的老街:300米藏了270年关帝庙,很多人却不知道

《GTA6 OL》或让玩家赚真钱!赛博商人准备开始变现

本地新闻

Onestage x 乐华娱乐暑期巡回选拔2026

教育要闻

出国留学项目院校推荐:预算与模式双路径择校全指南

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版