网易首页 > 网易号 > 正文 申请入驻

部署 Kimi K3 需要多少 GPU?自托管与 API 成本对比

0
分享至

由 Moonshot AI 于 2026 年 7 月发布,是截至目前规模最大的开放权重模型。作为一个混合专家模型(Mixture of Experts,MoE),Kimi K3 拥有 2.8 万亿个总参数,但每次推理仅激活约 1040 亿个参数。与其他前沿开放权重模型相比,其激活参数占总参数的比例很低,仅为 3.7%。这种架构让模型具备很高的潜在智能水平,同时不必在单次请求中激活太多参数。

不过,激活参数相对较少,并不意味着 Kimi K3 更容易下载并在本地运行。要存放全部模型权重,仍然需要极其庞大的内存。本文将介绍运行 Kimi K3 究竟需要哪些资源,以及在什么情况下,租用 GPU 自托管会比使用无服务器推理更划算。

参数数量并不能说明全部问题

多数模型使用 16 位精度进行训练。如果为了节省显存而使用 4 位精度运行,模型能力通常会有所下降。

Kimi K3 则在设计上采用原生微缩放 4 位浮点格式(Microscaling Floating Point 4,MXFP4),并通过量化感知训练(Quantization-Aware Training,QAT)得到 4 位发布权重,因此可以在不进行有损压缩的情况下提高运行效率。

在 Kimi K3 的量化感知训练过程中,每次前向传播都会先把权重舍入到 4 位精度,然后再使用这些权重。这样一来,模型优化的损失函数本身就包含量化造成的差异。因此,模型是在训练过程中直接学习如何以 4 位精度良好运行,而不是在使用时从 16 位降低至 4 位,并被动接受由此产生的误差。

Kimi K3 也可以使用 8 位或 16 位精度运行,但这样做不是为了提高模型质量,主要是出于硬件或软件兼容性的考虑。FP4主要面向推理。如果需要微调模型或继续训练,则仍然需要使用更高精度。

估算模型权重所需内存的基本方法,是用模型总参数量乘以计划采用的量化位数,再除以 8。之所以除以 8,是因为内存容量通常使用字节计量,而一个字节等于 8 位。

以 Kimi K3 为例:

2.8 万亿参数 × 4 位 ÷ 8 = 1.4 TB

也就是说,仅加载模型权重就大约需要 1.4 TB 内存。

如果要使用 8 位或 16 位精度运行,内存需求将分别增加至两倍或四倍。对于 Kimi K3,使用更高精度的主要原因,是在不支持原生 FP4 的硬件上运行,或者使用比当前 FP4 内核更成熟的软件栈,而不是为了获得更高的推理质量。

相比之下,Kimi K2的不同版本只有 1 万亿个参数,但其全精度权重采用 BFloat16(BF16),需要约 2 TB 内存,比 Kimi K3 的原生 4 位权重大约多 600 GB。

除此之外,推理期间还需要额外内存存放键值缓存(Key-Value Cache,KV Cache)、激活值以及运行时开销。

Kimi K3 的架构让实际运行成本低于其规模所暗示的水平

像 Kimi K3 这样庞大的模型之所以还能以经济可行的方式提供推理服务,是因为在处理单个 Token 时,模型中的绝大部分参数都不会参与计算。多项效率创新使其成本模型得以成立。

MoE 的稀疏性让每个 Token 只激活 896 个专家中的 16 个,再加上两个共享专家。与此同时,模型采用分位数平衡路由(Quantile Balancing Routing),以确定性方式把 Token 分配给不同专家,避免浪费专家容量。

Kimi Delta Attention(KDA)使用固定大小的注意力状态,而不是为每个 Token 分别维护 KV 缓存,因此最多可以减少约 75% 的 KV 缓存内存占用。

Attention Residuals允许神经网络中的每一层通过学习得到的权重,调用此前特定层的输出。Stable LatentMoE则是 Kimi K3 的混合专家框架,其中的专家在经过压缩的潜在空间中运行,从而降低计算成本。

KDA、Attention Residuals 和 Stable LatentMoE 结合使用,使 Kimi K3 的整体扩展效率相比 Kimi K2 提高约 2.5 倍。

为什么单张 GPU 无法运行 Kimi K3?

对于单个用户的 Kimi K3 推理请求,根据上下文长度不同,KV 缓存还需要约 2~15 GB 内存,激活值约需 30 GB,运行时开销也约为 30 GB。加上 1.4 TB 的模型权重,总内存需求约为 1.5 TB。

单张 GPU 显然无法满足要求,因此只能采用多 GPU;如果要实现符合生产环境需求的扩展能力,通常还需要多节点部署。

按照基础容量估算,H100 配备 80 GB 显存,H200 配备 141 GB 显存,因此分别需要大约 19 张 H100 或 11 张 H200。

不过,Hopper 架构以及 AMD MI300X 虽然可以加载 4 位权重,却需要在运行时对其进行反量化。这样能够保留一部分显存节省,但无法充分发挥 Kimi K3 原生 4 位架构带来的速度优势。

更合理的方案,是使用较新一代的 Blackwell B200、B300,或者 AMD MI350X、MI400 系列 GPU,直接以原生方式执行 MXFP4(4 位)计算。

因此,自托管 Kimi K3 不只是一个“需要多少张 GPU”的问题,也涉及 GPU 硬件代际的选择。

根据 vLLM 团队发布的 Kimi K3 部署指南,目前较直接的部署方式是使用8 张 NVIDIA B300 或 8 张 AMD MI355X GPU,并将张量并行规模设置为 8。AMD GPU 使用 ROCm 软件栈;具体驱动、镜像和内核要求则应以对应的部署配置为准。

另外,由于 KDA 独特的前缀缓存机制不像标准 vLLM 那样为每个 Token 维护 KV 缓存,普通前缀缓存无法直接与其无缝配合。

Kimi K3 的开发方 Moonshot 为 vLLM 贡献了一套定制实现,专门解决这一问题。因此,如果要自行托管 Kimi K3,需要使用包含 K3 专用代码的较新版本 vLLM。

用GPU服务器自己部署,还是使用 API?

Kimi K3 官方 API 的价格为:

  • 输入:每百万 Token 3 美元;

  • 缓存输入:每百万 Token 0.30 美元;

  • 输出:每百万 Token 15 美元。

DigitalOcean 云平台的当前提供相同的输入和输出价格,即每百万 Token 3 美元和 15 美元。

能够原生运行 FP4 的最低成本单节点方案,大约由 8 张 MI350X 组成,每张 GPU 每小时约 4.76 美元。整台节点的费用约为每小时 38 美元。如果使用长期运行的预留 GPU Droplet 云服务器,每月成本约为 27,800 美元,无论是否有人发送推理请求,这笔费用都会持续产生。

如果要让无服务器推理的费用达到同样水平,用户每月需要消耗大约 18 亿个输出 Token。按照 API 每百万输出 Token 15 美元的价格计算,相当于全天候持续输出约 700 Token/秒。

实际上,单路请求的 Token 生成速度通常只有每秒数十个;即使在理想条件下,也可能只是每秒数百个。因此,单路请求几乎不可能达到这一盈亏平衡点。

不过,一个计算节点至少可以并行处理 40 个请求。如果每个请求不使用完整的 100 万 Token 上下文,可同时驻留的请求数可以接近 600 个。

上下文长度

每个请求的 KV 缓存或状态空间

可驻留请求数(约 600 GB 内存池)

完整 100 万 Token

约 15 GB

约 40 个

128K

约 2 GB

约 300 个

32K

约 1.5 GB

约 400 个

8K

约 1 GB

约 600 个

重度用户每月可能使用约 5,000 万个 Token。即使全部按照价格更高的输出 Token 计算,通过 API 调用的费用最高也约为 750 美元。

对于单个用户而言,通过 API 使用无服务器推理的成本,大约比租用 GPU 自己部署并运维 Kimi K3 低 40 倍。

但是,当稳定的重度用户超过 40 名,并且每名用户每月使用 5,000 万个以上 Token 时,成本计算会逐渐转向有利于自托管的一侧。这 40 名用户可以是相互独立的个人,也可以表示一套复杂的智能体编排系统,其中包含由单个用户调度的 40 多个智能体。

既然一个节点能够处理 40 个并发请求,是否可以减少 GPU 数量,只为单个用户配置足够的 GPU?

答案是“不行”,原因主要有以下几点。

首先,为此类大型模型提供推理服务时,需要通过张量并行(Tensor Parallelism)把模型的每一层拆分到多张 GPU 上。张量并行通常在 2 张、4 张或 8 张 GPU 上具有更合理的计算结构,而不是使用 6 张 GPU。虽然 6 张可能是容纳权重并满足单用户推理要求的最低数量,但 8 张仍然是更现实的最低配置。

其次,这类 GPU 通常不能按 5~6 张租用,而是以 1 张或 8 张为单位提供。即使能够租到 6 张 GPU,单个用户的 Token 生成速度和实际用量也很难高到足以抵消租用成本。

对于部分用户而言,成本并不是最重要的决策因素。控制能力、一致性、可靠性、数据驻留以及其他要求,都可能让自托管更具吸引力。

在这种情况下,应仔细查看所使用推理服务商的服务条款。许多第三方提供商不会存储推理数据,并且拥有良好的数据隐私记录,因此未必需要为了数据隐私而租用 GPU 自托管。

如果计划自托管 Kimi K3,并将其作为商业服务对外提供,还应查看 Kimi K3 许可证。Kimi K3 没有采用 Apache 或 MIT 许可证,而是使用定制许可证;Kimi K3 允许使用、修改、微调、部署、分发和商业化,但对达到一定规模的“模型即服务”业务以及超大型商业产品附加了条件。

在 DigitalOcean 上运行 Kimi K3 意味着什么?

如果选择使用无服务器推理,DigitalOcean 通过无服务器推理(Serverless Inference) API 提供按 Token 计费的 Kimi K3 服务,输入和输出价格分别为每百万 Token 3 美元和 15 美元,与 Kimi 官方价格一样。

如果选择 GPU 自托管路线,则可以使用 DigitalOcean 的 GPU Droplet 云服务器、或长期预留 GPU。

注:DigitalOcean 专用推理为单个用户预留独占 GPU,性能和延迟更稳定,并支持部署自有模型;无服务器推理则按 Token 计费、共享算力且无需管理基础设施。

使用 GPU Droplets 时,用户需要自行管理推理软件栈。使用 Dedicated Inference 时,DigitalOcean 会运行一个托管式 vLLM 端点,用户则负责提供 Kimi K3 模型权重。

DigitalOcean 提供 AMD Instinct MI350X 和 NVIDIA B300 GPU,这两类硬件支持原生 MXFP4 计算,更适合运行采用 4 位权重的 Kimi K3。GPU 型号和区域可用性可能变化,部署前应查看平台的实时资源情况。

GPU 型号

数据中心

AMD Instinct MI350X

亚特兰大(ATL1)、里士满(RIC1)

NVIDIA B300

里士满(RIC1)、堪萨斯城(MKC1)

如果 GPU Droplets 和 专用推理(Dedicated Inference)已达到容量上限,可以联系 DigitalOcean 中国区独家战略合作伙伴卓普云(aidroplet.com),咨询专用容量。

DigitalOcean 虽然也提供裸金属 GPU,但目前裸金属规格中没有支持原生 FP4 的选项,因此不适合运行 Kimi K3。

总结

对于大多数团队,按 Token 计费的无服务器推理仍是运行 Kimi K3 更经济、简单的方式:无需一次性租用至少 8 张高端 GPU,也不必持续承担模型部署、推理框架和集群运维成本。

只有当业务拥有长期稳定的高并发流量,GPU 能够保持较高利用率,或者对数据驻留、性能一致性、自有权重和基础设施控制有明确要求时,自托管或专用推理才更值得考虑。按照本文采用的价格和负载假设,单个重度用户使用 API 可能比租用 GPU 自托管便宜约 40 倍;当系统需要持续服务数十个高用量用户或智能体时,自托管的成本优势才可能逐渐显现。

因此,Kimi K3 的部署选择不能只比较 Token 单价,还应同时评估并发量、GPU 利用率、上下文长度、运维能力、数据要求和模型许可证。即使未来采用其他大型开放权重模型,本文介绍的“按量 API、专用推理与 GPU 自托管”成本比较方法仍然适用。

本文中说提到的所有型号的 GPU 云服务器,以及无服务器推理服务,DigitalOcean 都有提供,如需协助评估技术方案选型,可直接咨询DigialOcean 中国区战略合作伙伴卓普云(aidroplet.com)。卓普云还会为中国区的DigitalOcean企业用户提供技术支持服务。

About us

关于 DigitalOcean

作为全球领先的云基础设施提供商之一,DigitalOcean 专注于为开发者和企业提供简单、高性能的云服务,包括 Droplet 云主机、 GPU Droplet 云服务、托管数据库(PostgreSQL、MySQL 、MongoDB 、Kafka 和 Redis)、对象存储、块存储和Kubernetes、负载均衡等。

自2012年成立以来,凭借简单透明的定价和开发者友好的产品,DigitalOcean 在全球已经有 60 万企业用户在使用。如今,对于中国的出海企业,DigitalOcean 还特别通过中国区独家战略合作伙伴卓普云提供技术支持、售前服务。所有用户都可以通过卓普云与 DigitalOcean 进行直签,并享受相同的服务以及中文的技术支持。

Read More

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
中国男篮升到第五!FIBA官方盛赞杨瀚森:中国约基奇终于崛起了

中国男篮升到第五!FIBA官方盛赞杨瀚森:中国约基奇终于崛起了

追球者
2026-09-02 15:40:32
建议你一定养一个:顶嘴、拖拉、爱发脾气的孩子,长大真的有好处

建议你一定养一个:顶嘴、拖拉、爱发脾气的孩子,长大真的有好处

另子维爱读史
2026-09-02 20:03:11
全球汽车行业的“利润王”:业绩甚至追上银行,年利润超1700亿

全球汽车行业的“利润王”:业绩甚至追上银行,年利润超1700亿

柳先说
2026-09-02 20:15:23
两小时的演唱会休息80分钟?张信哲、苏有朋等明星苏州拼盘演唱会被网友吐槽,票价最高888元,主办方回应

两小时的演唱会休息80分钟?张信哲、苏有朋等明星苏州拼盘演唱会被网友吐槽,票价最高888元,主办方回应

大风新闻
2026-09-01 14:55:04
赶紧核查!1992年前干过这几类工作的,你的养老金有望更高!

赶紧核查!1992年前干过这几类工作的,你的养老金有望更高!

小鹿姐姐情感说
2026-09-01 02:44:51
张万年致电许世友:我趁热往前拱一拱,许怒斥:你摸摸脑袋热不热

张万年致电许世友:我趁热往前拱一拱,许怒斥:你摸摸脑袋热不热

芊芊子吟
2026-09-02 14:15:15
国家杰青任 211 大学副校长

国家杰青任 211 大学副校长

生物学霸
2026-09-02 17:24:37
“还我季洁!”

“还我季洁!”

中国新闻周刊
2026-09-01 16:57:38
星宇股份董事长周晓萍回应公司舆情并道歉,称公司订单“断崖式下跌”传闻不实

星宇股份董事长周晓萍回应公司舆情并道歉,称公司订单“断崖式下跌”传闻不实

时代财经
2026-09-02 14:28:25
李春平身边23名员工联名写举报信!举报利益集团安排李春平假结婚

李春平身边23名员工联名写举报信!举报利益集团安排李春平假结婚

细品名人
2026-09-01 22:35:27
性治疗室里,挤满了“不会做爱”的年轻人

性治疗室里,挤满了“不会做爱”的年轻人

十点读书
2026-09-02 19:56:12
真要无球可打了?郭艾伦未能完成注册,亲自开口,一句话叫人泪目

真要无球可打了?郭艾伦未能完成注册,亲自开口,一句话叫人泪目

开着车去流浪
2026-09-02 19:23:29
37岁女子被当街殴打扒裤,官方回应来了:打人的两个女子50多岁

37岁女子被当街殴打扒裤,官方回应来了:打人的两个女子50多岁

汉史趣闻
2026-09-02 18:14:53
越南的小心思够精明!这次吉尔吉斯斯坦举办的上合组织峰会,越南没派最高领导人出席,只让国家副主席带队参会,比起去年明显降了半格

越南的小心思够精明!这次吉尔吉斯斯坦举办的上合组织峰会,越南没派最高领导人出席,只让国家副主席带队参会,比起去年明显降了半格

扶苏聊历史
2026-09-01 15:15:37
花4500元报机器人编程,才上11课时培训机构“跑路” 家长起诉退费,胜诉5年后终于拿到退款

花4500元报机器人编程,才上11课时培训机构“跑路” 家长起诉退费,胜诉5年后终于拿到退款

红星新闻
2026-09-02 18:59:17
让大众中国告诉常州星宇: 再复制富士康式的悲剧,后果会如何

让大众中国告诉常州星宇: 再复制富士康式的悲剧,后果会如何

冷观互联网
2026-09-01 16:23:40
影响隋唐两朝历史的“鲜卑族”,是今天的哪个民族?你绝对想不到

影响隋唐两朝历史的“鲜卑族”,是今天的哪个民族?你绝对想不到

文史达观
2025-05-06 11:54:46
自曝体重40公斤还嫌不够瘦?韩女团成员言论引众怒

自曝体重40公斤还嫌不够瘦?韩女团成员言论引众怒

追星雷达站
2026-09-01 18:55:12
亚洲最穷的国家不丹:如果拿10元人民币,在不丹集市能买到什么?

亚洲最穷的国家不丹:如果拿10元人民币,在不丹集市能买到什么?

抽象派大师
2026-09-01 02:22:43
李维康告别仪式:丈夫耿其昌穿旧衣哭到站不稳,女儿五字挽联催泪

李维康告别仪式:丈夫耿其昌穿旧衣哭到站不稳,女儿五字挽联催泪

小疯子耶
2026-09-01 14:39:17
2026-09-02 20:59:00
算法与数学之美 incentive-icons
算法与数学之美
分享知识,交流思想
5743文章数 64625关注度
往期回顾 全部

科技要闻

凌晨最强模型上新,Claude Fable 5.1发布

头条要闻

被星宇股份裁掉的107名应届生 损失远远不止一份工作

头条要闻

被星宇股份裁掉的107名应届生 损失远远不止一份工作

体育要闻

一次有奖问答,让他成为欧冠主帅

娱乐要闻

香港武打影星陈观泰离世,终年80岁

财经要闻

北京首钢园数采中心停运,“百万小时”产能目标的账还算得过来吗?

汽车要闻

10万级的满配B级车 试驾2027款比亚迪海豹06

态度原创

旅游
数码
本地
公开课
军事航空

旅游要闻

北京师范大学“九寨青禾”暑期实践队走进九寨沟景区和大录乡开展调研

数码要闻

宏碁推出SFF RTX Spark迷你主机,最高128GB内存

本地新闻

昆明的雨,解锁汪曾祺的浪漫雨季

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

特朗普威胁伊朗终极打击蓄势待发

无障碍浏览 进入关怀版