上个月底打开邮箱看到DeepSeek账单,我盯着那串三位数愣了两秒——这还没算上中间几次debug失败的重试消耗。结果现在?终端敲完./ds4-server --port 8080,回车一响,模型就蹲在我本地跑起来了。不是模拟,不是凑合,是实打实的26.7 tok/s生成速度,长上下文prefill直接飙到250 tok/s。M3 Max 128GB那台机器,风扇都没怎么转,安静得让我怀疑是不是没起来。
Antirez这人你肯定熟。Redis是他写的,那种写完就甩手走人、连文档都懒得配全的风格,结果这次他闷头搞了个DwarfStar(ds4),GitHub星星两周冲到1.5万。不是又一个llama.cpp套壳工具,也不是什么通用GGUF加载器,它只干一件事:把DeepSeek V4的MoE结构硬生生塞进你的MacBook里。2-bit量化只动路由层,专家层之外全保FP16,模型体积压到25GB,128GB内存能稳跑Q2,64GB加个--ssd-streaming照样扛住——我试过,32GB缓存划给SSD读专家权重,生成不卡顿,就是prefill慢个三成左右,但你能明显感觉到它在“思考”,不是等网。
装的过程比煮泡面还快。git clone、./download_model.sh q2-imatrix、make三步,模型从antirez的HuggingFace页面(https://huggingface.co/antirez/deepseek-v4-gguf)拉下来,编译十秒不到。我用的是M3 Max,但朋友在64GB的M2 Pro上也跑通了,就是得盯一眼SSD剩余空间——别低于50GB,25GB模型+缓存+系统临时文件,少一点都可能卡在加载第三层专家那里不动。
分布式那块我真试疯了。两台128GB MacBook用Thunderbolt线直连,一台跑0:30层,一台接后面,--workers一开,prefill速度居然反超单机。实测11709 token上下文,流水线并行下数据吞吐像开了闸。当然,这玩意儿现在还挂着beta标签——antirez自己在README里写“a few days”,不是谦虚,是真的才出生没几天。比如--mtp投机解码,目前只保证输出没错,提速几乎感知不到;再比如ds4-agent这个内置coding agent,跑简单补全还行,一到调shell工具就容易掉token,我最后还是切回ds4-server+Cursor旧组合更稳。
最绝的是卸载。删掉~/ds4文件夹就行,连.bashrc都不用动。不像某些Python包,卸了八百遍还在site-packages里留着幽灵文件。电费确实涨了点,但跟我原来日均37块的API开销比?大概够我多喝两个月霸王茶姬。
对了,千万别信CPU模式。macOS某次更新后,make cpu一跑,内核直接蓝屏式重启,antirez写了一句“Remember Software sucks.”,我截图发群,底下清一色“已祭天”。
模型文件路径固定在gguf/子目录里,./ds4flash.gguf这名字是定死的,你拿llama.cpp转的DeepSeek GGUF丢进去?直接报错——张量排布、权重分组逻辑全重写过,不是格式兼容,是整套体系重造。
M5 Max实测短文本生成34 tok/s,M3 Ultra跑PRO版本还能到9.6 tok/s,数字看着吓人,但真正打动我的不是这些——是凌晨三点改bug时,不用再掐着token预算删提示词,也不用对着“503 Service Unavailable”刷新八遍。它就在那儿,localhost:8080,敲回车就响应,像台老式收音机,拧开就响,不矫情,不掉链子。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.