随手先关注,不错过每日AI热讯速递
①
9 月 26 日,开源推理引擎Colibrì在中文技术社区刷屏:不装高端显卡,用25GB内存跑通744B参数的 GLM-5.2[2]。
项目的自我介绍只有一句话——「Tiny engine, immense model.」——引擎极小,模型极大[1]。
它靠的是MoE(混合专家结构:参数总量巨大,但每个词只调用其中一小部分「专家」)架构:GLM-5.2 总参数744B,每个词实际激活约40B[2]。
int4 量化后,模型权重约372GB16GB24GB内存即可运行,GPU 并非必需[1][2]。
![]()
图:截图为 Colibrì 在 GitHub 上的仓库页[2]
②
架构思路是把VRAM、RAM 与 SSD当成同一套推理层级:attention、embedding 等每次都要用的 Dense 部分约9.9GB常驻内存,其余19,456 个路由专家按需从 SSD 流式读取[1][2]。
猜得太慢也不行。相邻层的专家路由有71.6%可以提前一层预测,当前层还在算,后台已经在读下一层要用的专家[1]。
双 SSD 放两份模型副本实测能把解码再提速37.5%,相当于把两条独立带宽拧在一起用[1]。
速度上限由硬件决定:25GB开发机冷缓存只有0.05–0.1 tok/s128GB纯 CPU 桌面机约1.8 tok/s,6 张 RTX 5090 全驻留可到5.8–6.8 tok/s[1]。
![]()
图:截图为 Colibrì 的运行状态面板[2]
③
支持的模型家族一口气列了九个:从 GLM-5.2/5.3、GLM-5.3-Flash(321B)、Inkling(975B)到 Kimi K3(2.8T)、DeepSeek V4 Flash(284B)等[1]。
仓库页的演示截图显示,K3 聊天界面已可跑通,引擎可达状态与对话流都实时可见[1]。
2.8T的 Kimi K3 需要约 1.6TB 硬盘与 32GB 内存起步,「笔记本跑通」对它并不成立[1][2]。
![]()
图:GitHub 仓库页[1]
④
这个项目的价值不在速度,而在把「内存墙」问题改写成了I/O 调度(决定什么时候从硬盘读什么数据的安排)问题[2]。
冷缓存与全驻留的速度差了两个数量级,标题里的「跑通」不等于「可用」——它更适合批处理、离线总结这类不敏感延迟的场景[1]。
对端侧部署者来说,这是一条绕开显存天花板的新路径;代价是冷缓存下的龟速体验,长期跑盘的寿命影响也尚无公开数据,值不值取决于你的负载[1][2]。
你愿意用「慢一百倍」换「本地跑前沿模型」吗?评论区聊聊你会拿它跑什么。
参考来源:
[1] JustVugg/colibrihttps://github.com/JustVugg/colibri
[2] 笔记本跑7000亿参数GLM!无GPU也行? SSD当显存用火爆GitHubhttps://www.qbitai.com/2026/09/497624.html
欢迎点赞、分享、推荐
一起拥抱AI
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.