文章目录Kimi K3技术解析2.8万亿参数开源旗舰如何用Delta Attention冲击闭源前沿一、引言二、纵向从 K1.5 到 K3月之暗面的三年长征2.1 起源一个清华系团队和月之暗面这个名字2.2 第一波出圈K1.5 与推理能力的押注2.3 开源转向K2 系列与agentic intelligence2.4 K3 的位置把开源规模顶到天花板三、核心架构Delta Attention Stable LatentMoE 的双轨创新3.1 为什么标准 Attention 在万亿规模会撞墙3.2 Kimi Delta AttentionKDA换一种方式算注意力3.3 Attention ResidualsAttnRes让信息流接得上3.4 Stable LatentMoE让 896 个专家雨露均沾3.5 量化、上下文与多模态四、能力表现开源模型在编程任务上正面叫板闭源前沿4.1 编程与 agenticK3 的主攻方向4.2 基准与盲测够到了前沿梯队但数字仍需复测4.3 价格和 Sonnet 5 一个档位五、横向竞品对比开源 MoE 三强与闭源前沿的格局5.1 与闭源前沿的对比5.2 与开源 MoE 同行的对比5.3 格局判断开源与闭源的能力差正在被填平六、工程实践怎么用上 Kimi K36.1 接入方式速查6.2 自部署的现实门槛6.3 典型应用场景七、总结Kimi K3技术解析2.8万亿参数开源旗舰如何用Delta Attention冲击闭源前沿一、引言亲爱的朋友们创作不容易若对您有帮助的话请点赞收藏加关注哦您的关注是我持续创作的动力谢谢大家有问题请私信或联系邮箱jasonai.fngmail.com2026 年 7 月中旬的 WAIC世界人工智能大会上月之暗面把一台巨型推土机开上了开源大模型的赛道——Kimi K32.8 万亿参数截至发布时全球规模最大的开源权重模型。这件事之所以值得专门拆解不在于又一个万亿模型的数字本身而在于它同时回答了两个问题开源模型究竟能不能在能力上正面够到闭源前沿以及当参数量已经堆到万亿量级下一步的边际收益要从哪里挤出来区别于 DeepSeek 那条用极致工程把训练成本打下来的路线也区别于通义千问稠密小模型 线性注意力混合的反内卷打法Kimi K3 选择了一条更重的路把模型规模顶到开源圈的天花板同时用自研的Kimi Delta AttentionKDA注意力机制和Stable LatentMoE路由系统去消化超大参数量带来的训练和推理负担。本文将沿着发展历程、核心架构、能力表现、竞品格局、工程实践等维度对 Kimi K3 做一次完整的技术解析。二、纵向从 K1.5 到 K3月之暗面的三年长征要看懂 K3得先看懂月之暗面这三年的节奏。这家公司的迭代速度在国产大模型厂商里属于最激进的那一档而且每一步的决策逻辑都清晰得像下棋——不是见招拆招而是有明确的技术主张。2.1 起源一个清华系团队和月之暗面这个名字月之暗面Moonshot AI2023 年 3 月成立于北京创始人杨植麟是清华出身的计算机天才型研究者曾在 Google、Meta 做研究与清华校友周昕宇、吴宇欣联合创办了这家公司。公司名字取自 Pink Floyd 的专辑《The Dark Side of the Moon》——“月之暗面”一个带着极客浪漫主义的命名。时间事件决策逻辑2023年3月月之暗面成立入局时正值 ChatGPT 引爆全球但团队没有去挤通用对话的红海2023年10月Kimi 对话助手上线主打20 万字中文长上下文当时主流模型上下文多在数千到几万 tokenKimi 直接把长文本作为差异化切入2024年3月上下文扩展到200 万字中文把长上下文这条护城河挖到当时的物理极限从一开始月之暗面的赌注就不是做一个更好的 ChatGPT而是做一个能读完整本书、能吃下整个代码库的模型。这个判断在后来被证明极具前瞻性——当 Agent 时代到来长上下文从炫技变成了刚需。2.2 第一波出圈K1.5 与推理能力的押注2025 年 1 月 22 日团队发布了论文《Kimi k1.5: Scaling Reinforcement Learning with LLMs》arXiv:2501.12599把一个用大规模强化学习训练的多模态推理模型摆上了台直接对标 OpenAI 的 o1。这篇论文后来被引用近千次和 DeepSeek-R1 一起成了中国实验室在推理reasoning这条赛道上并不落后的标志性证据。这里的决策逻辑很关键当整个行业还在比拼预训练规模时月之暗面提前押注了强化学习提升推理这条路线。事后看这是它从长文本公司转向能力型公司的第一个拐点。2.3 开源转向K2 系列与agentic intelligence真正的分水岭是 2025 年中的 K2版本发布时间核心特征意义Kimi K22025年7月1万亿参数 MoE每次推理激活 320 亿开源权重定位agentic intelligence智能体智能月之暗面第一次以开源 MoE 旗舰身份入场K2 更新版2025年9月9日K2 的迭代持续打磨K2 Thinking2025年11月训练成本仅约460 万美元在 Humanity’s Last Exam、TAU-Bench 上超越 GPT-5、Claude 4.5用极低训练成本打出效率冲击波杨植麟亲自背书Kimi K2.52026年1月原生多模态 agentic 模型可调度最多100 个专业 Agent蜂群技术基于约 15 万亿多模态 token 持续预训练上线两天登顶权威开源模型榜前端编程能力尤其突出Kimi K2.62026年4月20日在 SWE-Bench Pro 上追平 GPT-5.5单工程任务可连续执行12 小时多 Agent 编排能力的又一次跃升Kimi K32026年7月16-17日WAIC 20262.8万亿参数原生多模态100万 token 上下文7月27日开放完整权重全球最大开源权重模型这一串迭代里有两件事值得单独拎出来说。第一件是 2026 年 3 月的 GTC 2026——黄仁勋把 Kimi K2.5 当作展示下一代芯片能力的基准模型杨植麟则在分论坛上 solo成为现场唯一来自独立大模型公司的演讲者。被英伟达选作基准某种程度上是国际认可的硬通货。第二件是 K2 Thinking 那 460 万美元的训练成本——它打破了大模型必然烧钱的叙事也让外界开始认真对待月之暗面的工程效率。2.4 K3 的位置把开源规模顶到天花板把这条时间线连起来K3 的出现就有了清晰的因果K2 系列已经把开源 MoE agentic这条路走通了K2.5/K2.6 把多模态和多 Agent 编排补齐那么 K3 要回答的就是开源模型的能力天花板到底在哪。月之暗面给出的答案是——直接把参数量顶到 2.8 万亿同时在底层注意力机制上动刀用 Delta Attention 去消化这个规模带来的代价。这是一次既要规模、又要效率的豪赌。商业层面同样在加速据多家媒体报道月之暗面正筹备赴港 IPO且已成为史上最快达到百亿美元估值的中国初创公司之一付费用户在 2025 年 9-11 月环比增长 170%。K3 在这个节点发布技术意义之外也带着明确的资本叙事。三、核心架构Delta Attention Stable LatentMoE 的双轨创新K3 的架构故事可以拆成两条线一条是注意力机制怎么改一条是专家路由怎么稳。两条线合在一起才让 2.8 万亿参数这个体量真正能训得动、跑得起。3.1 为什么标准 Attention 在万亿规模会撞墙标准自注意力机制的核心问题是KV Cache 会随上下文长度线性增长注意力计算量随序列长度呈平方级膨胀。当模型本身已经做到万亿参数、上下文还要撑到 100 万 token 时这套机制在训练阶段的显存和算力开销会变得极其昂贵——这部分开销并不直接转化为模型能力而是在为机制本身不够高效买单。这也是为什么 2026 年的旗舰模型几乎都在动注意力的刀子参见同期的 Qwen3.6 用 Gated DeltaNet 混合层。3.2 Kimi Delta AttentionKDA换一种方式算注意力K3 没有继续用标准注意力而是自研了Kimi Delta AttentionKDA。综合月之暗面官方与多个技术社区的解读KDA 的本质是一种混合线性注意力hybrid linear attention机制能够随序列长度更好地扩展据官方称其训练效率较前代提升约2.5 倍。KDA 一个被反复提及的副作用是它打破了传统的前缀缓存prefix caching惯例。标准注意力模型之所以能用 KV Cache 复用前缀是因为注意力是精确的逐 token 计算而线性注意力走的是另一套数学路径传统的 prefix caching 套路在这里不再直接适用。这听起来像是个退步但代价换来的是训练阶段对超长序列的友好——对 K3 这种要在海量长文本、长代码上预训练的模型这笔交易是划算的。注意力机制复杂度特性长序列表现与前缀缓存标准自注意力序列长度平方级长上下文下显存与算力代价高原生支持 prefix cachingKimi Delta AttentionKDA混合线性随序列长度更优扩展训练效率约提升 2.5 倍打破传统 prefix caching 惯例3.3 Attention ResidualsAttnRes让信息流接得上和 KDA 配套的是Attention ResidualsAttnRes。换掉标准注意力、改用线性变体最容易出的问题是信息在网络深层逐渐失真或丢失——线性注意力的表达能力本身弱于精确注意力。AttnRes 的设计目的就是改善深层网络的信息流动让残差信号在改了注意力机制之后依然能稳定传递。可以把它理解为换了一套更省钱的算账方式KDA同时加了一条保险绳AttnRes防止算着算着丢了精度。3.4 Stable LatentMoE让 896 个专家雨露均沾注意力解决了另一头是 MoE 路由。K3 的 MoE 规模极其夸张总共 896 个专家每个 token 只激活其中 16 个——激活比例仅约 1.8%。这意味着模型拥有庞大的知识容量但单次推理的实际计算量被压在一个相对可控的范围内这是万亿参数模型能实际部署的前提。但 896 选 16 的极端稀疏会带来一个老问题负载不均衡。如果路由器总是偏好少数几个专家那大部分专家就成了摆设模型容量被浪费训练也容易崩。K3 的解法是Stable LatentMoE——在隐空间latent space做路由并配合Quantile Balancing分位数均衡来分配负载强制专家被更均匀地使用。这套系统的设计目标很明确在极端稀疏度下既保住路由的精准又保住训练的稳定。┌──────────────────────────────────────────────────────────┐ │ 输入层原生多模态 │ │ 文本 token · 图像 · 最长 100 万 token 上下文 │ ├──────────────────────────────────────────────────────────┤ │ 注意力层KDA AttnRes │ │ Kimi Delta Attention混合线性注意力 │ │ Attention Residuals残差信息流保障 │ │ → 训练效率约提升 2.5 倍长序列友好 │ ├──────────────────────────────────────────────────────────┤ │ Stable LatentMoE 专家层 │ │ 共 896 个专家 · 每 token 激活 16 个约 1.8% │ │ 隐空间路由 Quantile Balancing分位数负载均衡 │ │ → 大容量 低激活算力 训练稳定 │ ├──────────────────────────────────────────────────────────┤ │ 输出层 / Agentic 能力 │ │ 长程编程 · 深度推理 · 工具调用 · 多 Agent 协同 │ └──────────────────────────────────────────────────────────┘3.5 量化、上下文与多模态除了注意力与路由两条主线K3 还有几个工程层面的关键设定维度设定说明上下文长度100 万 token延续月之暗面从 Kimi 起就坚持的长上下文基因多模态原生支持视觉图像等继承自 K2.5 的原生多模态路线非外挂权重量化MXFP4 量化版本4 比特浮点量化显著压缩 2.8 万亿参数的部署体积权重开放2026年7月27日开放完整权重WAIC 发布后约十天开放走 Hugging Face 等渠道MXFP4 这一项尤其值得注意2.8 万亿参数即便用 MoE 稀疏激活权重文件本身的体积也极其庞大MXFP4 量化是让它装得下、搬得动的必要手段——这一点和 DeepSeek-V3 当年用 FP8 走量的思路一脉相承。四、能力表现开源模型在编程任务上正面叫板闭源前沿K3 最受关注的能力集中在长程编程long-range coding和 agentic 任务上——这也是 2026 年所有旗舰模型的主战场。4.1 编程与 agenticK3 的主攻方向月之暗面在发布时明确把 K3 定位为面向长程编程、知识工作、深度推理的模型。结合 K2.6 已经能做到单工程任务连续执行 12 小时的能力基础K3 在多步 Agent 工作流、代码库级别的理解和修改上被寄予厚望。它原生多模态 100 万上下文的组合恰好命中了读整个仓库 看截图/UI 改前端这类真实工程场景。4.2 基准与盲测够到了前沿梯队但数字仍需复测在公开的盲测与第三方评测中K3 展现出了冲击闭源前沿的竞争力评测来源表现可信度说明arena.ai 盲测据多个社区与媒体报道Kimi K3 击败了 Claude Fable 与 GPT-5.6 Sol多源报道一致但模型发布仅数日完整榜单仍可能变动编程类基准SWE-bench 等多个第三方口径显示其进入全球第一梯队与 GPT-5.6、Claude Opus 4.8 同台竞技具体分数因评测版本不同存在差异精确跑分需以官方后续披露与独立复测为准综合定位被普遍认为是开源模型首次在编程任务上正面够到闭源前沿旗舰方向性判断较为可靠⚠️关于跑分的诚实说明由于 K3 发布距今仅数日社区流传的部分精确分数如某些 SWE-bench Verified 的百分比来源不一存在被早期推测性讨论放大的风险。本文不采信单一来源的具体小数点数字而是以梯队定位 多源一致的盲测结果作为判断依据。待官方放出完整技术报告与权威榜单复测后数字层面会有更可靠的结论。4.3 价格和 Sonnet 5 一个档位K3 另一个不可忽视的竞争力在价格。据多家报道K3 的 API 定价与 Anthropic 的 Sonnet 5 基本持平——这意味着开发者可以用二线模型的价格调用一个前沿梯队的能力。对成本敏感的 agentic 场景一个任务可能循环调用模型几十上百次来说这种定价策略的杀伤力比跑分更直接。五、横向竞品对比开源 MoE 三强与闭源前沿的格局K3 所在的赛道竞争极其密集属于典型的场景 C3 个以上竞品。这里把对手分成两组闭源前沿能力天花板参照系和开源 MoE直接竞争者各选代表做对比。5.1 与闭源前沿的对比维度Kimi K3开源Claude Opus 4.8闭源GPT-5.6闭源技术路线2.8T MoE Delta Attention闭源稠密/混合架构闭源三层模型架构强 agentic可获取性开源权重7月27日 API仅 API仅 API核心优势开源可私有化部署、价格对标 Sonnet 5综合能力与稳定性标杆编程与 agentic 能力顶配明显短板2.8T 体量私有部署门槛仍高价格贵、数据不出域难价格贵、闭源不可控生态位“开源里的闭源前沿平替”闭源能力天花板闭源 agentic 标杆趋势判断用开源 价格挤压闭源中端市场需用持续领先维持溢价面临开源追赶的压力增大5.2 与开源 MoE 同行的对比K3 在开源圈内的真正对手是同样走 MoE 路线的 DeepSeek 系列和通义千问 Qwen3.7-Max维度Kimi K3DeepSeek V4 ProQwen3.7-Max总参数规模2.8 万亿当前开源最大万亿级 MoE旗舰级含 397B-A17B 等多版本架构特色Delta Attention Stable LatentMoE极致训练成本控制、推理效率稠密 线性注意力混合Gated DeltaNet路线哲学规模顶满 注意力机制创新工程效率优先、把成本打到底反内卷用小模型 好架构打大模型长上下文100 万 token长上下文能力强原生 26.2 万、可扩到 100 万核心心智“全球最大开源模型”“极致性价比”“高性价比 本地可跑”竞争关系与 DeepSeek 争开源 MoE 一哥与 K3 正面竞争开源旗舰错位竞争主攻本地/边缘场景5.3 格局判断开源与闭源的能力差正在被填平把上面两张表连起来看一个清晰的判断是开源模型与闭源前沿之间的能力差正在被快速填平。K3 的意义不在于它在某个跑分上赢了多少分而在于它证明了一件事——开源圈已经能稳定地产出够到闭源前沿梯队的模型而且还能用开源 低定价的方式从闭源厂商手里抢中端市场。这对 Claude、GPT 这类靠能力领先 高溢价维持商业模型的厂商是结构性的压力。六、工程实践怎么用上 Kimi K36.1 接入方式速查方式适合人群说明Kimi.com / 官方 API想直接体验、做应用的开发者WAIC 发布后即可通过官方渠道调用支持 agentic 功能OpenRouter 等聚合平台多模型对比、统一接入第三方平台通常会快速上架定价对标 Sonnet 5 档位开源权重自部署有数据合规/私有化需求的企业7月27日开放完整权重Hugging Face 等含 MXFP4 量化版6.2 自部署的现实门槛需要给想自己部署的开发者泼一盆清醒的冷水2.8 万亿参数即便有 MoE 稀疏激活私有部署的硬件门槛依然非常高。虽然每个 token 只激活 16/896 的专家实际计算量远小于总参数量但完整的权重文件必须全部加载进显存/内存——这意味着至少需要多卡高端 GPU 集群或大容量统一内存的服务器。MXFP4 量化能把权重体积压下来一截但几个消费级显卡就能跑这种事在 K3 这个体量上是不现实的。部署规模大致硬件可行性完整 BF16 精度自部署多节点高端 GPU 集群如 H100/H200 级别多机仅大型企业/研究机构MXFP4 量化自部署单节点多卡高端 GPU 或大容量内存服务器中型团队可行仍是重资产云端 API 调用无需自建算力绝大多数开发者的首选对绝大多数开发者而言走 API 是当前最务实的路径真正需要自部署的是金融、政企等对数据出域有硬性合规要求的场景——而这恰恰也是国产开源大模型最有价值的用武之地。6.3 典型应用场景场景为什么 K3 适合代码库级 agentic 编程100 万上下文 长程编程优化能吃下整个仓库多 Agent 协同工作流继承 K2.5/K2.6 的多 Agent 编排能力企业知识库私有化问答开源 长上下文数据不出域前端/全栈开发辅助K2.5 起就以前端编程见长K3 延续并强化七、总结维度核心要点发布信息2026年7月16-17日 WAIC 2026 发布7月27日开放完整权重规模定位2.8 万亿参数截至发布时全球最大开源权重模型核心架构Kimi Delta Attention混合线性注意力训练效率约提升 2.5 倍 Attention Residuals Stable LatentMoE896 专家/激活 16分位数均衡关键能力100 万 token 上下文、原生多模态、长程编程与 agentic 任务优化竞争力arena.ai 盲测击败 Claude Fable、GPT-5.6 Sol定价对标 Sonnet 5跻身前沿梯队部署现实自部署门槛极高需多卡集群API 是多数开发者的首选行业意义标志开源模型首次在编程任务上正面够到闭源前沿结构性挤压闭源中端市场Kimi K3 这次发布最值得记住的不是2.8 万亿这个刷新纪录的数字而是它同时回答了两个行业级问题开源能不能追上闭源前沿以及万亿规模之后模型还要往哪里走月之暗面给出的答案是——用 Delta Attention 这样的架构创新去对冲规模带来的代价再用开源 低定价把能力转化为对闭源厂商的市场压力。随着开源与闭源的能力差被持续填平2026 年下半年大模型竞争的主线很可能不再是谁的参数更大而是谁能在同等能力下把成本和门槛压得更低——而这恰恰是月之暗面这三年来一直在下注的方向。参考资料Kimi K3 Tech Blog: Open Frontier Intelligence — Moonshot AI / kimi.com, 2026-07Moonshot AI Releases Kimi K3: A 2.8T Parameter Open MoE Model — MarkTechPost, 2026-07-16Moonshot AI Unveils 2.8-Trillion-Parameter Kimi K3 — EqualOcean, 2026-07-17Kimi K3 Model Overview: 2.8T Parameters, MXFP4 Quantization — Hugging FaceKimi k1.5: Scaling Reinforcement Learning with LLMs — arXiv:2501.12599, 2025-01-22Kimi K3: Moonshot AIs 2.8T Open-Weight Model Explained — Lorphic, 2026-07Kimi (chatbot) — Wikipedia中国AI公司月之暗面发布全球最大规模开源模型 — 德国之声(DW) / RFI, 2026-07-17