2026年7月17日,月之暗面正式发布新一代旗舰模型 Kimi K3

Kimi K3总参数规模达到 2.8万亿,基于Kimi Delta Attention混合线性注意力机制和Attention Residuals注意力残差技术构建,原生支持视觉理解,并拥有 100万Token上下文窗口

月之暗面将其称为全球首个3万亿级开放模型。路透社也将Kimi K3描述为当前同类产品中参数规模最大的开放权重AI模型。需要说明的是,K3服务和API已经上线,但完整模型权重计划在2026年7月27日前发布,因此现阶段更准确的说法是:Kimi K3刷新了已公布开放模型的参数规模纪录,完整权重仍在发布流程中。

image.png

Kimi K3的核心参数

Kimi K3此次公布的主要规格包括:

  • 模型总参数:2.8万亿
  • 模型架构:混合专家模型
  • 专家总数:896个
  • 每Token激活专家:16个
  • 上下文窗口:100万Token
  • 输入模态:文字、图片和视频
  • 核心架构:Kimi Delta Attention、Attention Residuals
  • 主要场景:长程编程、知识工作、科研计算和深度推理
  • 当前思考强度:max
  • 完整权重:计划于2026年7月27日前发布

Kimi官方模型列表已经将K3定位为目前能力最强的旗舰模型,并确认其支持100万Token上下文与原生视觉理解。

2.8万亿参数刷新开放模型规模纪录

在Kimi K3之前,月之暗面发布的Kimi K2采用1万亿总参数、320亿激活参数的混合专家架构。

Kimi K3将模型总规模扩大至2.8万亿参数,相当于K2总参数规模的2.8倍,同时进一步提高了混合专家架构的稀疏度。

模型内部设置896个专家,但每次处理一个Token时只激活其中16个。这样的设计意味着,K3可以通过更多专家扩大模型容量,同时避免在每次推理时调用全部2.8万亿参数。

月之暗面表示,结合Stable LatentMoE、训练方法与数据配方优化后,Kimi K3相较K2的整体扩展效率提高约2.5倍。

参数数量本身不能直接等同于模型能力,但超大规模混合专家架构可以容纳更多知识和任务模式,为代码、数学、视觉、科研与工具调用等能力提供更大的训练空间。

为什么说Kimi K3把开放模型规模推向新高?

“全球最大开源模型”这一说法,需要区分模型服务上线、技术开放与完整权重下载三个阶段。

Kimi K3目前已经完成:

  • 网页端和手机App上线
  • Kimi Work桌面端上线
  • Kimi Code接入
  • Kimi API开放
  • 模型架构与主要参数披露
  • 开放模型发布计划公布

但截至发布初期,完整模型权重尚未同步提供下载。

因此,Kimi K3可以被称为全球首个公布并计划开放权重的3万亿级模型,但在权重正式发布前,不宜写成“开发者已经可以完整下载和本地部署”。

路透社将K3称为全球最大的开放权重模型;Kimi官方则使用“全球首个开放的3万亿级模型”这一表述。

100万Token上下文能做什么?

Kimi K3的上下文窗口达到100万Token,是上一代Kimi K2系列公开上下文规模的数倍。

100万Token并不等于100万个中文词语。Token是模型处理内容的基本单位,一个中文字符、英文单词或标点可能对应一个或多个Token。

在实际使用中,100万Token上下文可以容纳:

  • 数百万字的长篇资料
  • 大型软件项目的代码文件
  • 多份财务报表和公司公告
  • 数十篇甚至上百篇研究论文
  • 长时间Agent任务产生的过程记录
  • 大量网页搜索及终端执行结果
  • 图片、视频与文字组成的多模态资料
  • 跨文件企业知识库内容

较长的上下文窗口让模型可以在一次任务中读取更多材料,减少反复切分、总结和重新输入资料的次数。

Kimi API还会自动尝试使用上下文缓存。当多次请求具有较长且相同的输入前缀时,开发者可以按照缓存命中价格计费,降低长上下文任务的调用成本。

KDA降低长上下文计算成本

支撑100万Token上下文的重要技术之一,是Kimi Delta Attention,简称KDA。

传统全注意力机制需要计算不同Token之间的关系。随着上下文长度增长,计算量和显存需求也会快速提高。

KDA采用混合线性注意力设计,通过状态记忆保存和更新长序列中的信息,减少处理超长内容时的计算压力。

KDA并不意味着长上下文使用成本可以被完全消除,而是尝试在模型能力、信息保留和推理效率之间取得更好的平衡。

月之暗面还向vLLM社区提供了适配KDA的缓存实现,以支持K3在长上下文和大规模部署环境中的推理。

Attention Residuals改善深层信息传递

Kimi K3的另一项核心结构是Attention Residuals,也就是注意力残差。

普通Transformer主要通过逐层残差连接传递信息。随着模型层数增加,早期层中的部分信息可能在不断混合后变得难以直接利用。

Attention Residuals允许模型根据当前任务,从不同深度的历史表示中选择需要的信息,而不是简单地将所有层平均累积。

可以将两项技术的作用简单理解为:

  • KDA主要解决超长序列中的信息传递效率
  • Attention Residuals主要改善超深模型中的信息流动
  • Stable LatentMoE负责扩大模型容量并控制激活规模

三者共同构成Kimi K3扩展至2.8万亿参数和100万Token上下文的主要架构基础。

原生视觉能力扩展任务边界

Kimi K3原生支持视觉输入,可以在同一个模型中理解文字、图片、视频、软件界面和程序运行截图。

这使其能够执行传统文本模型难以独立完成的任务,例如:

  • 根据设计图生成前端页面
  • 分析网页截图并调整页面布局
  • 观察游戏运行画面后继续修改代码
  • 理解CAD图纸和三维场景
  • 分析科研图片和数据图表
  • 从视频中识别内容与动作
  • 根据视觉结果控制浏览器或工具
  • 检查生成作品是否符合需求

Kimi K3可以在代码和实时截图之间反复迭代,形成“生成—运行—观察—修改”的视觉闭环。

Kimi官方展示了3D火箭发射模拟、开放世界游戏、GBA模拟器和黑洞可视化等案例,用于说明K3将编程、视觉理解和三维推理组合起来的能力。

长程编程成为Kimi K3重点方向

相比生成一段代码,长程编程要求模型持续完成多个相互依赖的工程步骤。

例如,开发一个完整功能可能涉及:

  1. 阅读代码仓库
  2. 分析项目结构
  3. 制定技术方案
  4. 修改多个文件
  5. 安装或调整依赖
  6. 运行测试
  7. 分析错误日志
  8. 修复代码
  9. 再次测试
  10. 输出交付说明

Kimi K3针对这类长时间、低人工干预的任务进行了重点训练,可以结合终端工具、代码执行环境和视觉反馈持续推进工作。

Kimi Code的更新日志还显示,K3上线后取消了单轮任务默认1000步的限制,减少长任务因为固定步数上限而被强制停止的情况。

24小时优化GPU内核

为了测试K3的长期工程能力,月之暗面搭建了GPU内核优化测试环境。

参评模型在独立GPU沙箱中获得相同任务、测试框架和生产负载,并可以在最多24小时内持续分析实现、重写内核和运行性能测试。

任务包括:

  • NVIDIA H200上的Attention Residuals内核
  • KDA线性注意力内核
  • 512头维度MLA内核
  • 国产GPU上的KDA任务

这类任务不仅要求模型生成正确代码,还要持续查看跑分结果、定位性能瓶颈并调整实现。

根据月之暗面披露的结果,Kimi K3在最大思考强度下取得了较强表现。不过,详细测试日志和完整评估方法仍需等待K3技术报告公布。

从零搭建MiniTriton编译器

Kimi K3还完成了一个名为MiniTriton的轻量级GPU编译器。

该系统没有直接依赖Triton IR,而是基于MLIR定义中间表示,并实现:

  • 编程抽象
  • 中间表示
  • 编译优化Pass
  • PTX代码生成
  • FP32与FP64支持
  • 算子编译
  • 真实训练任务接入

在当前支持的算子上,MiniTriton的性能接近Triton和torch.compile。团队还使用其支持的TensorLite训练nanoGPT,并观察到正常收敛。

这一案例主要体现Kimi K3执行开放式软件工程任务的能力,而不是证明早期MiniTriton已经能够替代经过长期优化的成熟编译器。

Kimi K3尝试完成芯片设计

在另一项概念验证中,Kimi K3连续运行48小时,使用开源EDA工具和Nangate 45nm工艺库设计了一款面向nano模型的芯片。

公开数据包括:

  • 芯片面积约4平方毫米
  • 146万个标准单元
  • 0.277MB SRAM
  • INT4 MAC阵列
  • 100MHz下完成时序收敛
  • 仿真解码吞吐超过每秒8700个Token

这项测试展示了模型在芯片结构、逻辑实现、优化和验证流程之间持续工作的能力,但该芯片目前属于仿真和概念验证,并不代表已经完成实际流片。

科研和知识工作能力继续增强

Kimi K3不仅面向软件开发,也强调端到端知识工作和科研编程。

在计算天体物理案例中,K3围绕I-Love-Q普适关系完成了:

  • 阅读和交叉验证20多篇论文
  • 实现数值计算流程
  • 评估300多种状态方程
  • 检查已发表公式中的不一致
  • 生成3000多行Python代码
  • 制作交互式HTML仪表盘

月之暗面还展示了一份覆盖推理芯片行业42年历史的研究报告。该任务包含2800多次网页搜索与抓取、1100多次终端数据拉取、87份季报和99份原始PDF,总资料超过11000页。

这些案例说明,Kimi K3正在尝试把资料检索、PDF阅读、数据分析、代码执行和可视化输出连接成完整工作流。

Kimi Work增加小组件和看板

Kimi K3发布后,Kimi Work还增加了小组件和看板功能。

小组件可以在对话中生成交互式内容,并连接本地数据或外部工具。看板则可以将多个组件整理到长期保留的页面中。

用户可以围绕一个项目或主题建立:

  • 行业数据看板
  • 公司研究看板
  • 项目进度面板
  • 科研结果页面
  • 销售数据组件
  • 新闻监控模块
  • 个人任务仪表盘

Kimi Work本身定位为本地Agent,可以读取授权的本地文件夹、操作网页、运行Python代码并执行持续性任务。

国产大模型商业化节奏正在加快

Kimi K3的意义不仅体现在参数规模,也体现在模型发布后迅速进入多个产品和收费渠道。

目前,K3已经覆盖:

  • Kimi网页端
  • iOS、Android及鸿蒙App
  • Kimi Work桌面客户端
  • Kimi Code编程工具
  • Kimi API开放平台
  • Kimi企业版
  • 后续Kimi Hosted Agent平台

这说明月之暗面并未只把K3作为技术展示,而是同步将其用于个人订阅、开发者API、企业服务和智能体产品。

从产品布局来看,Kimi正在形成“模型—应用—开发工具—企业服务”的商业结构。这个判断属于基于公开产品和收费方式作出的行业分析。

Kimi K3 API如何收费?

Kimi K3 API按照每100万Token计费:

Token类型每100万Token价格
缓存命中输入2元
未命中缓存输入20元
模型输出100元

相比小参数模型,K3的未命中输入和输出成本更高,但自动上下文缓存可以降低大型代码库、长报告和多轮Agent任务中重复输入的费用。

Kimi开放平台还在K3发布期间提供充值返券活动,反映出月之暗面正在通过促销、API价格和开发者生态加快K3的商业使用。

为什么超大模型仍需要低价格API?

2.8万亿总参数意味着K3的训练和部署对计算资源、显存、存储以及高速互联提出较高要求。

月之暗面建议在64个或更多加速器组成的Supernode环境中部署K3,普通个人电脑很难完整运行模型权重。

因此,开放权重并不等于低成本本地部署。多数个人开发者和中小企业更可能通过官方API或第三方推理平台使用K3。

API价格和缓存机制将直接影响K3是否能进入:

  • AI编程工具
  • 企业知识库
  • 金融研究平台
  • 科研计算系统
  • 智能客服
  • 文档处理工具
  • 浏览器Agent
  • 长任务自动化平台

国产替代逻辑应如何理解?

Kimi K3发布后,“国产替代”再次成为行业讨论重点。

在大模型领域,国产替代并不只是使用国内模型替换海外API,还包括:

  • 使用国内模型服务处理企业数据
  • 降低对单一海外供应商的依赖
  • 获得更适合中文任务的能力
  • 使用人民币结算的API服务
  • 在国内云平台完成部署
  • 根据企业要求进行私有化适配
  • 使用开放权重进行行业微调
  • 建立本地模型与Agent生态

Kimi K3提供中文服务、开放权重计划、API、企业版和开发工具,为国内团队提供了更多模型选项。

但模型选择仍应根据实际任务测试,不能只比较参数数量。开发者还需要评估:

  • 真实任务成功率
  • 推理速度
  • API稳定性
  • 数据安全
  • 模型输出成本
  • 工具调用能力
  • 部署硬件需求
  • 开放许可证
  • 运维与技术支持

参数规模不等于所有任务表现最好

月之暗面在发布材料中也明确指出,Kimi K3虽然在整套评测中达到较强水平,但与顶级闭源模型相比,部分用户体验和高难度任务仍存在差距。

超大参数规模可以提高模型容量,但最终能力还受到以下因素影响:

  • 训练数据质量
  • 后训练方案
  • 强化学习环境
  • 推理计算预算
  • Agent运行框架
  • 工具质量
  • 上下文组织方式
  • 提示词和权限设置

因此,“全球最大开放模型”更多描述参数规模和开放定位,不等于K3在所有基准和真实任务中都是全球第一。

Kimi K3当前有哪些局限?

对历史思考内容敏感

K3在多轮Agent任务中需要保留完整历史消息。如果第三方框架丢弃部分思考历史,可能影响后续表现。

可能过于主动

K3主要优化长程复杂任务,遇到模糊指令时可能自行作出用户未预期的决定。

开发者应通过System Prompt或AGENTS.md明确规定文件权限、网络访问、生产环境操作和确认节点。

完整权重尚待发布

模型服务已经上线,但完整权重计划在2026年7月27日前提供。开放协议、硬件要求和社区推理适配仍需等待正式发布。

本地部署成本较高

即使权重开放,2.8万亿参数模型仍需要高性能集群部署,难以在普通消费级电脑中完整运行。

Kimi K3如何使用?

Kimi网页端

访问Kimi官方网站即可使用K3完成问答、研究和内容生成任务。

Kimi手机App

将Kimi App升级至最新版,可在iOS、Android和鸿蒙设备中体验。

Kimi Work

Kimi Work 3.1.0及以上版本支持K3,适合本地文件、行业研究、数据分析和办公工作流。

Kimi Code

开发者可以在终端中使用Kimi Code,并通过模型选择命令切换至K3。

Kimi API

开发者可通过兼容OpenAI格式的接口调用kimi-k3模型,构建代码Agent、知识工作Agent和行业信息整理工具。

总结

Kimi K3总参数规模达到2.8万亿,采用896个专家、每Token激活16个专家的混合专家架构,并结合Kimi Delta Attention和Attention Residuals支持100万Token上下文。

从已公布参数看,Kimi K3刷新了开放权重模型的规模纪录,并将视觉理解、长程编程、科研计算和知识工作纳入同一模型体系。

K3已经进入Kimi网页端、手机App、Kimi Work、Kimi Code和Kimi API,完整模型权重则计划在2026年7月27日前发布。

更值得关注的是,Kimi K3发布并非只停留在模型参数展示。月之暗面同步提供API计费、桌面Agent、编程工具和企业服务,体现出国产大模型正加快从技术能力向真实产品和商业场景延伸。

不过,2.8万亿参数也带来了较高的部署与推理门槛。K3能否在开放权重发布后形成完善的推理框架支持、开发者生态和行业应用,仍需继续观察。

相关链接