网易首页 > 网易号 > 正文 申请入驻

登上GitHub趋势榜!纯C推理引擎让25GB内存也能运行GLM-5.2

0
分享至

智猩猩AI整理

编辑:BugMaker

744B 参数的大模型,通常需要什么样的机器才能跑起来?

多张高端 GPU、大容量显存,或者直接把模型交给云端推理服务,基本已经成了默认答案。

但最近 GitHub 上有个项目,走了另一条很不一样的路线。

它不想把整个模型都塞进显存,甚至也不要求模型完整驻留在内存,而是直接把NVMe SSD、RAM 和 VRAM 看成同一个分层推理空间

项目叫colibri

它最初由 GitHub 用户 JustVugg 以单人项目形式启动,仓库创建于 2026 年 7 月 1 日。短短两个多月,已经拿下35.2K Stars


更夸张的是,colibri 目前还冲上了 GitHub Trending 今日榜第三,当天新增超过 1500 Stars,热度还在继续上涨。


它最吸引人的地方,是已经让GLM-5.2 这样的 744B MoE 模型在只有 25GB RAM 的机器上真正运行起来

而现在,它支持的模型范围还在继续扩大,包括 GLM-5.2/5.3、GLM-5.3-Flash、Inkling、DeepSeek V4 Flash、Qwen3.8-Flash-Next、Qwen3.6、OLMoE,甚至还有总参数达到2.8T 的 Kimi K3

核心推理引擎使用纯 C 实现,没有 BLAS 等 engine dependency,也不强制要求 GPU。

真正有意思的是,colibri 并不是靠把一个 744B 模型“压缩成几十 GB”来实现这一点。

它改变的是模型权重必须常驻内存这件事。

01

744B不用全部塞进内存,权重可以

按需“搬运”

为什么一个 744B 模型,能够在 25GB 内存的机器上启动,关键在于 MoE。

GLM-5.2 虽然总参数达到 744B,但一次生成 Token 时,并不会把所有参数都参与计算。

按照 colibri 给出的数据,每个 Token 实际激活约 40B 参数,只占模型总参数的约 5.4%

其中真正随着 Router 选择不断变化的 routed experts,对应的数据量大约只有 11GB。


既然绝大部分专家这一刻根本用不到,为什么还一定要提前把它们全部放进昂贵的 RAM 或 VRAM。

colibri 的做法是把模型拆成两类。

相对固定的Dense 部分,包括 Attention、Shared Experts 和 Embedding 等,大约 17B 参数,以 int4 形式常驻 RAM,实际约占9.9GB

剩下规模庞大的 Routed Experts 则完全换一种处理方式。

GLM-5.2 中一共有19,456 个 Routed Experts。按照 int4 存储,每个专家约 19MB,整体在磁盘上大约需要 370GB。

这些专家不再全部加载到内存。

它们可以直接待在 NVMe SSD 上,等 Router 真正选择到某个专家时,再按需读取。


所以 colibri 真正做的,是把VRAM、RAM、NVMe SSD 统一成一个权重存储层级

最快、最常访问的专家可以放进 VRAM。

经常命中的专家可以留在 RAM。

大量暂时没有被调用的专家继续待在 SSD。

硬件资源不足时,并不是直接告诉你“模型放不下”,而是让更多权重下沉到速度更慢的层级。

项目把这套思路类比成给模型权重做 JIT。

传统 JIT 不会提前编译程序所有路径,而是观察真正执行的部分,再优化热点代码。

colibri 也不会要求 744B 参数全部成为常驻状态,而是根据 Router 的实际选择,把当前真正需要的权重提前搬到更快的存储层。

系统会记录 Expert Routing Heat,通过 Per-layer LRU、Pinned Hot-store 等机制保存热门专家,还可以提前一个 Layer 做 Prefetch,尽量把 SSD 读取时间藏在计算过程里。

换句话说,权重从“必须常驻的模型状态”,变成了可以动态调度的数据。


更直观的是,colibri 甚至把这 19,456 个专家做成了一个实时可视化页面。

不同颜色代表专家当前位于哪个存储层级,亮度代表 Routing Heat,被当前 Token 选中的专家还会实时闪烁。


02

25GB只是能跑的下限,6张5090

已经做到6.84 tok/s

这里必须把一个很容易被标题忽略的问题说清楚。

25GB RAM 能跑,不代表 25GB RAM 跑得快。

colibri 最早使用的开发机只有 12 核 CPU、25GB RAM 和 NVMe。

GLM-5.2 在这台机器上确实能够正确完成推理,但冷启动状态下的 Decode 速度只有大约0.05—0.1 tok/s

项目文档自己也写得很直接,这并不快。

真正的意义在于,它证明了“744B 模型必须完整塞进高端显存或超大内存”并不是唯一方案。

而当硬件资源增加以后,colibri 不需要换另一套推理架构。

它只是不断把专家从 SSD 往 RAM、再往 VRAM 上搬。

同一个引擎,硬件资源决定的是权重放在哪一层,以及最终能跑多快

一个很典型的实验发生在6×RTX 5090的机器上。

测试机器拥有 6 张 32GB RTX 5090、双路 Intel Xeon Silver 4510、251GB RAM 和本地 NVMe。

当 colibri 最终把全部 19,456 个专家完整放进 VRAM + RAM 后,Decode 阶段已经不再需要访问磁盘。

其中约9343 个专家进入 GPU,10113 个专家放在 RAM,Decode 磁盘等待时间降到 0 秒

最终在固定 96 Token Greedy Benchmark 上达到6.28 tok/s,256 Token 测试进一步达到6.84 tok/s


这里最值得看的不是单独一个 6.84 tok/s。

而是从 25GB 小机器到六张 RTX 5090,colibri 使用的仍然是同一种模型放置逻辑

在小机器上,大量 Expert 从 SSD Streaming。

RAM 多一些,就把 Hot Experts 留在内存。

有 GPU,就继续把高频 Expert 推进 VRAM。

资源足够时,整个 Routed Expert Set 都能驻留在 VRAM + RAM 中,磁盘自动退出 Decode Critical Path。

这也是它和普通“CPU 跑大模型”项目比较不一样的地方。

它解决的不是单一硬件配置,而是在尝试构建一套跨 SSD、RAM、CPU、GPU 的统一 MoE 推理层级

目前项目还支持双 SSD Streaming、CUDA、Metal、NUMA、Expert Prefetch、Routing History、Hot Expert Pinning 等机制。

模型支持范围也从最初的 GLM-5.2 继续扩展。

其中Kimi K3 总参数达到 2.8T

也就是说,colibri 现在研究的问题已经不只是“怎么在小机器上跑一个 744B 模型”。

当模型总参数越来越大,但每次真正参与计算的参数依然有限时,能不能把“模型必须装进内存”这个前提彻底拆掉。

当然,内存省了不代表存储也省了。

以 GLM-5.2 为例,官方推荐的 colibri int4 Container 仍然大约需要372GB 磁盘空间

所以 25GB 指的是 RAM 门槛,不是“整个 744B 模型只有 25GB”。

这个区别很重要。

03

从“模型能不能装下”变成

“权重应该放在哪里”

过去部署大模型时,一个最直观的问题是,我的显存或者内存,能不能装下这个模型?

colibri 尝试把这个问题换掉。

对于 MoE 来说,如果每个 Token 真正使用的只是总参数中的一小部分,那么更重要的问题可能不是:

整个模型能不能常驻。

下一步需要哪些权重,这些权重现在应该位于 SSD、RAM 还是 VRAM。

这也是 colibri 最有意思的地方。

它并没有声称 25GB 消费级机器可以替代多 GPU 服务器,项目甚至很明确地公开了 0.05—0.1 tok/s 这样的低速结果。

但它证明了一种新的推理思路:

总参数规模和高速内存容量,不一定必须继续一一绑定。

模型越来越大之后,除了继续买更多显存,另一条路可能就是让模型权重真正流动起来。

哪些专家应该常驻,哪些可以缓存,哪些应该提前预取,哪些只需要在被 Router 选中时才从 SSD 读取。

过去大家优化的是 Kernel 和算力。

colibri 更进一步,把权重本身放在哪里、什么时候搬、怎么搬也变成了推理系统的一部分。

对于越来越大的 MoE 模型来说,这条路线值得继续看。

关注+星标,获取AI前沿进展与开源一线动态

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
难怪中国人瞧不起印度,印度记者:不是中国人自大,差距真的太大

难怪中国人瞧不起印度,印度记者:不是中国人自大,差距真的太大

白哥全球事
2026-09-17 12:39:04
从炸串到被造谣“下体坏死”,王鹤棣这八年,撕开内娱最脏的一面

从炸串到被造谣“下体坏死”,王鹤棣这八年,撕开内娱最脏的一面

王楔晓
2026-09-17 19:53:31
新加坡最后还是说了实话,硬生生把“中国好欺负”的底兜了

新加坡最后还是说了实话,硬生生把“中国好欺负”的底兜了

今夜繁星坠落
2026-09-18 11:06:02
驻日武官王庆简:潜伏在日本20年,出卖了无数军情,没料到最后竟被一个老习惯断送了性命

驻日武官王庆简:潜伏在日本20年,出卖了无数军情,没料到最后竟被一个老习惯断送了性命

磊子讲史
2026-09-16 18:16:40
盖·里奇新片首曝预告,卷福搭档裴淳华演惊悚片

盖·里奇新片首曝预告,卷福搭档裴淳华演惊悚片

浅遇时光
2026-09-17 22:23:18
赛力斯首次回应“问界正式撤出鸿蒙智行”:赛力斯与华为坚定在一起、造好车

赛力斯首次回应“问界正式撤出鸿蒙智行”:赛力斯与华为坚定在一起、造好车

新浪财经
2026-09-18 15:21:29
家庭人伦乱,家道必衰败

家庭人伦乱,家道必衰败

皓皓情感说
2026-09-18 09:18:12
仍未续约!前国安归化大将年底合同到期,顽疾难除明年或宣布退役

仍未续约!前国安归化大将年底合同到期,顽疾难除明年或宣布退役

体坛鉴春秋
2026-09-18 11:56:12
我老公对我真的是生理性喜欢,我俩今年四十五,他每天晚上都要抱着我睡,不是那种敷衍的搭把手,是真抱

我老公对我真的是生理性喜欢,我俩今年四十五,他每天晚上都要抱着我睡,不是那种敷衍的搭把手,是真抱

徐侠客有话说
2026-08-13 11:03:24
科大讯飞出轨女主朱倩旧照疑曝光!小眼睛大脸盘,身材一般,和网传照片天差地别

科大讯飞出轨女主朱倩旧照疑曝光!小眼睛大脸盘,身材一般,和网传照片天差地别

小徐讲八卦
2026-09-03 11:53:43
房价拐点终究还是来了?国家首次正式承认房地产出现一个重大变化

房价拐点终究还是来了?国家首次正式承认房地产出现一个重大变化

专业聊房君
2026-09-16 19:32:09
大幅扩招!卫健委:增加50万医生,5年内达到500万!找工作会更难吗?扩招偏向基层,老年学科!但最重要的还是保证医生质量!

大幅扩招!卫健委:增加50万医生,5年内达到500万!找工作会更难吗?扩招偏向基层,老年学科!但最重要的还是保证医生质量!

梅斯医学
2026-09-16 19:00:44
水电大牛股,冲击“8天7涨停”

水电大牛股,冲击“8天7涨停”

上海证券报
2026-09-18 10:47:30
特朗普能炒掉国务卿和防长,唯独动不了万斯,宪法给了他一把悬顶之剑

特朗普能炒掉国务卿和防长,唯独动不了万斯,宪法给了他一把悬顶之剑

墨策讲历史
2026-09-18 15:17:17
人有没有糖尿病,看脸就知道?有糖尿病的人,脸上或有这4个表现

人有没有糖尿病,看脸就知道?有糖尿病的人,脸上或有这4个表现

路医生健康科普
2026-09-18 18:09:52
港星施明骨灰被找到,已如愿完成安葬,李泳汉神隐归来仍不知所踪

港星施明骨灰被找到,已如愿完成安葬,李泳汉神隐归来仍不知所踪

情感大头说说
2026-09-19 00:07:25
人社局:正高级职称补贴30万,副高级20万,中级6万!

人社局:正高级职称补贴30万,副高级20万,中级6万!

新浪财经
2026-09-15 22:15:19
“整完容,才到普通人水平!”初中女孩晒整容前后对比照,有点心酸!

“整完容,才到普通人水平!”初中女孩晒整容前后对比照,有点心酸!

林林先生
2026-09-12 11:45:03
邓文迪和印度首富夫人合影,“身子微倾,下巴收着”,网友称:整个人的气场直接瘪了

邓文迪和印度首富夫人合影,“身子微倾,下巴收着”,网友称:整个人的气场直接瘪了

丫头舫
2026-09-17 13:11:45
历届奥斯卡影帝封神之作(2000-2006):27种人生,27种活法

历届奥斯卡影帝封神之作(2000-2006):27种人生,27种活法

可乐谈情感
2026-09-07 00:32:05
2026-09-19 00:47:00
智猩猩
智猩猩
AI 技术内容与服务平台
135文章数 6关注度
往期回顾 全部

科技要闻

直击iPhone 18新机发售:黄牛加价不如前代

头条要闻

俄杜马选举拉夫罗夫"意外"登顶名单 梅德韦杰夫被拿下

头条要闻

俄杜马选举拉夫罗夫"意外"登顶名单 梅德韦杰夫被拿下

体育要闻

好吧,中国男篮辛苦了

娱乐要闻

陈思诚 佟丽娅不想让儿子知道两人离婚

财经要闻

研发0.25亿理财26亿,敷尔佳豪赌三类器械

汽车要闻

纯电/插混双动力+五座/六座双布局 海狮08应该怎么选?

态度原创

游戏
亲子
艺术
健康
数码

《给他爱5》废弃“自由城”DLC可能会加入到《GTA6》中

亲子要闻

宝蓝挑战寻找藏在商场各处的键达奇趣蛋。快看看宝蓝挑战成功了吗

艺术要闻

刘炜画了幅《我的风景》,1840万!

脑动脉瘤的治疗方法,该选哪一种?

数码要闻

Realforce静电容键盘GX1 Plus皮卡丘版亮相TGS2026

无障碍浏览 进入关怀版