部署 Kimi K3 需要多少 GPU?自托管与 API 成本对比
Kimi K3由 Moonshot AI 于 2026 年 7 月发布是截至目前规模最大的开放权重模型。作为一个混合专家模型Mixture of ExpertsMoEKimi K3 拥有 2.8 万亿个总参数但每次推理仅激活约 1040 亿个参数。与其他前沿开放权重模型相比其激活参数占总参数的比例很低仅为 3.7%。这种架构让模型具备很高的潜在智能水平同时不必在单次请求中激活太多参数。不过激活参数相对较少并不意味着 Kimi K3 更容易下载并在本地运行。要存放全部模型权重仍然需要极其庞大的内存。本文将介绍运行 Kimi K3 究竟需要哪些资源以及在什么情况下租用 GPU 自托管会比使用无服务器推理更划算。参数数量并不能说明全部问题多数模型使用 16 位精度进行训练。如果为了节省显存而使用 4 位精度运行模型能力通常会有所下降。Kimi K3 则在设计上采用原生微缩放 4 位浮点格式Microscaling Floating Point 4MXFP4并通过量化感知训练Quantization-Aware TrainingQAT得到 4 位发布权重因此可以在不进行有损压缩的情况下提高运行效率。在 Kimi K3 的量化感知训练过程中每次前向传播都会先把权重舍入到 4 位精度然后再使用这些权重。这样一来模型优化的损失函数本身就包含量化造成的差异。因此模型是在训练过程中直接学习如何以 4 位精度良好运行而不是在使用时从 16 位降低至 4 位并被动接受由此产生的误差。Kimi K3 也可以使用 8 位或 16 位精度运行但这样做不是为了提高模型质量主要是出于硬件或软件兼容性的考虑。FP4主要面向推理。如果需要微调模型或继续训练则仍然需要使用更高精度。估算模型权重所需内存的基本方法是用模型总参数量乘以计划采用的量化位数再除以 8。之所以除以 8是因为内存容量通常使用字节计量而一个字节等于 8 位。以 Kimi K3 为例2.8 万亿参数 × 4 位 ÷ 8 1.4 TB也就是说仅加载模型权重就大约需要 1.4 TB 内存。如果要使用 8 位或 16 位精度运行内存需求将分别增加至两倍或四倍。对于 Kimi K3使用更高精度的主要原因是在不支持原生 FP4 的硬件上运行或者使用比当前 FP4 内核更成熟的软件栈而不是为了获得更高的推理质量。相比之下Kimi K2的不同版本只有 1 万亿个参数但其全精度权重采用 BFloat16BF16需要约 2 TB 内存比 Kimi K3 的原生 4 位权重大约多 600 GB。除此之外推理期间还需要额外内存存放键值缓存Key-Value CacheKV Cache、激活值以及运行时开销。Kimi K3 的架构让实际运行成本低于其规模所暗示的水平像 Kimi K3 这样庞大的模型之所以还能以经济可行的方式提供推理服务是因为在处理单个 Token 时模型中的绝大部分参数都不会参与计算。多项效率创新使其成本模型得以成立。MoE 的稀疏性让每个 Token 只激活 896 个专家中的 16 个再加上两个共享专家。与此同时模型采用分位数平衡路由Quantile Balancing Routing以确定性方式把 Token 分配给不同专家避免浪费专家容量。Kimi Delta AttentionKDA使用固定大小的注意力状态而不是为每个 Token 分别维护 KV 缓存因此最多可以减少约 75% 的 KV 缓存内存占用。Attention Residuals允许神经网络中的每一层通过学习得到的权重调用此前特定层的输出。Stable LatentMoE则是 Kimi K3 的混合专家框架其中的专家在经过压缩的潜在空间中运行从而降低计算成本。KDA、Attention Residuals 和 Stable LatentMoE 结合使用使 Kimi K3 的整体扩展效率相比 Kimi K2 提高约 2.5 倍。为什么单张 GPU 无法运行 Kimi K3对于单个用户的 Kimi K3 推理请求根据上下文长度不同KV 缓存还需要约 215 GB 内存激活值约需 30 GB运行时开销也约为 30 GB。加上 1.4 TB 的模型权重总内存需求约为 1.5 TB。单张 GPU 显然无法满足要求因此只能采用多 GPU如果要实现符合生产环境需求的扩展能力通常还需要多节点部署。按照基础容量估算H100 配备 80 GB 显存H200 配备 141 GB 显存因此分别需要大约 19 张 H100 或 11 张 H200。不过Hopper 架构以及 AMD MI300X 虽然可以加载 4 位权重却需要在运行时对其进行反量化。这样能够保留一部分显存节省但无法充分发挥 Kimi K3 原生 4 位架构带来的速度优势。更合理的方案是使用较新一代的 Blackwell B200、B300或者 AMD MI350X、MI400 系列 GPU直接以原生方式执行 MXFP44 位计算。因此自托管 Kimi K3 不只是一个“需要多少张 GPU”的问题也涉及 GPU 硬件代际的选择。根据 vLLM 团队发布的 Kimi K3 部署指南目前较直接的部署方式是使用8 张 NVIDIA B300 或 8 张 AMD MI355X GPU并将张量并行规模设置为 8。AMD GPU 使用 ROCm 软件栈具体驱动、镜像和内核要求则应以对应的部署配置为准。另外由于 KDA 独特的前缀缓存机制不像标准 vLLM 那样为每个 Token 维护 KV 缓存普通前缀缓存无法直接与其无缝配合。Kimi K3 的开发方 Moonshot 为 vLLM 贡献了一套定制实现专门解决这一问题。因此如果要自行托管 Kimi K3需要使用包含 K3 专用代码的较新版本 vLLM。用GPU服务器自己部署还是使用 APIKimi K3 官方 API 的价格为输入每百万 Token 3 美元缓存输入每百万 Token 0.30 美元输出每百万 Token 15 美元。DigitalOcean 云平台的无服务器推理Serverless Inference当前提供相同的输入和输出价格即每百万 Token 3 美元和 15 美元。能够原生运行 FP4 的最低成本单节点方案大约由 8 张 MI350X 组成每张 GPU 每小时约 4.76 美元。整台节点的费用约为每小时 38 美元。如果使用长期运行的预留 GPU Droplet 云服务器每月成本约为 27,800 美元无论是否有人发送推理请求这笔费用都会持续产生。如果要让无服务器推理的费用达到同样水平用户每月需要消耗大约 18 亿个输出 Token。按照 API 每百万输出 Token 15 美元的价格计算相当于全天候持续输出约 700 Token/秒。实际上单路请求的 Token 生成速度通常只有每秒数十个即使在理想条件下也可能只是每秒数百个。因此单路请求几乎不可能达到这一盈亏平衡点。不过一个计算节点至少可以并行处理 40 个请求。如果每个请求不使用完整的 100 万 Token 上下文可同时驻留的请求数可以接近 600 个。上下文长度每个请求的 KV 缓存或状态空间可驻留请求数约 600 GB 内存池完整 100 万 Token约 15 GB约 40 个128K约 2 GB约 300 个32K约 1.5 GB约 400 个8K约 1 GB约 600 个重度用户每月可能使用约 5,000 万个 Token。即使全部按照价格更高的输出 Token 计算通过 API 调用的费用最高也约为 750 美元。对于单个用户而言通过 API 使用无服务器推理的成本大约比租用 GPU 自己部署并运维 Kimi K3 低 40 倍。但是当稳定的重度用户超过 40 名并且每名用户每月使用 5,000 万个以上 Token 时成本计算会逐渐转向有利于自托管的一侧。这 40 名用户可以是相互独立的个人也可以表示一套复杂的智能体编排系统其中包含由单个用户调度的 40 多个智能体。既然一个节点能够处理 40 个并发请求是否可以减少 GPU 数量只为单个用户配置足够的 GPU答案是“不行”原因主要有以下几点。首先为此类大型模型提供推理服务时需要通过张量并行Tensor Parallelism把模型的每一层拆分到多张 GPU 上。张量并行通常在 2 张、4 张或 8 张 GPU 上具有更合理的计算结构而不是使用 6 张 GPU。虽然 6 张可能是容纳权重并满足单用户推理要求的最低数量但 8 张仍然是更现实的最低配置。其次这类 GPU 通常不能按 56 张租用而是以 1 张或 8 张为单位提供。即使能够租到 6 张 GPU单个用户的 Token 生成速度和实际用量也很难高到足以抵消租用成本。对于部分用户而言成本并不是最重要的决策因素。控制能力、一致性、可靠性、数据驻留以及其他要求都可能让自托管更具吸引力。在这种情况下应仔细查看所使用推理服务商的服务条款。许多第三方提供商不会存储推理数据并且拥有良好的数据隐私记录因此未必需要为了数据隐私而租用 GPU 自托管。如果计划自托管 Kimi K3并将其作为商业服务对外提供还应查看 Kimi K3 许可证。Kimi K3 没有采用 Apache 或 MIT 许可证而是使用定制许可证Kimi K3 允许使用、修改、微调、部署、分发和商业化但对达到一定规模的“模型即服务”业务以及超大型商业产品附加了条件。在 DigitalOcean 上运行 Kimi K3 意味着什么如果选择使用无服务器推理DigitalOcean 通过无服务器推理Serverless Inference API 提供按 Token 计费的 Kimi K3 服务输入和输出价格分别为每百万 Token 3 美元和 15 美元与 Kimi 官方价格一样。如果选择 GPU 自托管路线则可以使用 DigitalOcean 的 GPU Droplet 云服务器、专用推理Dedicated Inference或长期预留 GPU。注DigitalOcean 专用推理为单个用户预留独占 GPU性能和延迟更稳定并支持部署自有模型无服务器推理则按 Token 计费、共享算力且无需管理基础设施。使用 GPU Droplets 时用户需要自行管理推理软件栈。使用 Dedicated Inference 时DigitalOcean 会运行一个托管式 vLLM 端点用户则负责提供 Kimi K3 模型权重。DigitalOcean 提供 AMD Instinct MI350X 和 NVIDIA B300 GPU这两类硬件支持原生 MXFP4 计算更适合运行采用 4 位权重的 Kimi K3。GPU 型号和区域可用性可能变化部署前应查看平台的实时资源情况。GPU 型号数据中心AMD Instinct MI350X亚特兰大ATL1、里士满RIC1NVIDIA B300里士满RIC1、堪萨斯城MKC1如果 GPU Droplets 和 专用推理Dedicated Inference已达到容量上限可以联系 DigitalOcean 的销售团队咨询专用容量。DigitalOcean 虽然也提供裸金属 GPU但目前裸金属规格中没有支持原生 FP4 的选项因此不适合运行 Kimi K3。总结对于大多数团队按 Token 计费的无服务器推理仍是运行 Kimi K3 更经济、简单的方式无需一次性租用至少 8 张高端 GPU也不必持续承担模型部署、推理框架和集群运维成本。只有当业务拥有长期稳定的高并发流量GPU 能够保持较高利用率或者对数据驻留、性能一致性、自有权重和基础设施控制有明确要求时自托管或专用推理才更值得考虑。按照本文采用的价格和负载假设单个重度用户使用 API 可能比租用 GPU 自托管便宜约 40 倍当系统需要持续服务数十个高用量用户或智能体时自托管的成本优势才可能逐渐显现。因此Kimi K3 的部署选择不能只比较 Token 单价还应同时评估并发量、GPU 利用率、上下文长度、运维能力、数据要求和模型许可证。即使未来采用其他大型开放权重模型本文介绍的“按量 API、专用推理与 GPU 自托管”成本比较方法仍然适用。本文中说提到的所有型号的 GPU 云服务器以及无服务器推理服务DigitalOcean 都有提供如需协助评估技术方案选型可直接咨询DigialOcean 中国区战略合作伙伴卓普云aidroplet.com。卓普云还会为中国区的DigitalOcean企业用户提供技术支持服务。相关链接Kimi K3 模型卡Hugging FacevLLM 对生产级 Kimi K3 支持的预览DigitalOcean GPU DropletsKimi K3 现已上线 DigitalOcean 无服务器推理