2026年7月17日,月之暗面正式发布新一代旗舰模型 Kimi K3。
Kimi K3总参数规模达到 2.8万亿,基于Kimi Delta Attention混合线性注意力机制和Attention Residuals注意力残差技术构建,原生支持视觉理解,并拥有 100万Token上下文窗口。
月之暗面将其称为全球首个3万亿级开放模型。路透社也将Kimi K3描述为当前同类产品中参数规模最大的开放权重AI模型。需要说明的是,K3服务和API已经上线,但完整模型权重计划在2026年7月27日前发布,因此现阶段更准确的说法是:Kimi K3刷新了已公布开放模型的参数规模纪录,完整权重仍在发布流程中。

Kimi K3的核心参数
Kimi K3此次公布的主要规格包括:
- 模型总参数:2.8万亿
- 模型架构:混合专家模型
- 专家总数:896个
- 每Token激活专家:16个
- 上下文窗口:100万Token
- 输入模态:文字、图片和视频
- 核心架构:Kimi Delta Attention、Attention Residuals
- 主要场景:长程编程、知识工作、科研计算和深度推理
- 当前思考强度:max
- 完整权重:计划于2026年7月27日前发布
Kimi官方模型列表已经将K3定位为目前能力最强的旗舰模型,并确认其支持100万Token上下文与原生视觉理解。
2.8万亿参数刷新开放模型规模纪录
在Kimi K3之前,月之暗面发布的Kimi K2采用1万亿总参数、320亿激活参数的混合专家架构。
Kimi K3将模型总规模扩大至2.8万亿参数,相当于K2总参数规模的2.8倍,同时进一步提高了混合专家架构的稀疏度。
模型内部设置896个专家,但每次处理一个Token时只激活其中16个。这样的设计意味着,K3可以通过更多专家扩大模型容量,同时避免在每次推理时调用全部2.8万亿参数。
月之暗面表示,结合Stable LatentMoE、训练方法与数据配方优化后,Kimi K3相较K2的整体扩展效率提高约2.5倍。
参数数量本身不能直接等同于模型能力,但超大规模混合专家架构可以容纳更多知识和任务模式,为代码、数学、视觉、科研与工具调用等能力提供更大的训练空间。
为什么说Kimi K3把开放模型规模推向新高?
“全球最大开源模型”这一说法,需要区分模型服务上线、技术开放与完整权重下载三个阶段。
Kimi K3目前已经完成:
- 网页端和手机App上线
- Kimi Work桌面端上线
- Kimi Code接入
- Kimi API开放
- 模型架构与主要参数披露
- 开放模型发布计划公布
但截至发布初期,完整模型权重尚未同步提供下载。
因此,Kimi K3可以被称为全球首个公布并计划开放权重的3万亿级模型,但在权重正式发布前,不宜写成“开发者已经可以完整下载和本地部署”。
路透社将K3称为全球最大的开放权重模型;Kimi官方则使用“全球首个开放的3万亿级模型”这一表述。
100万Token上下文能做什么?
Kimi K3的上下文窗口达到100万Token,是上一代Kimi K2系列公开上下文规模的数倍。
100万Token并不等于100万个中文词语。Token是模型处理内容的基本单位,一个中文字符、英文单词或标点可能对应一个或多个Token。
在实际使用中,100万Token上下文可以容纳:
- 数百万字的长篇资料
- 大型软件项目的代码文件
- 多份财务报表和公司公告
- 数十篇甚至上百篇研究论文
- 长时间Agent任务产生的过程记录
- 大量网页搜索及终端执行结果
- 图片、视频与文字组成的多模态资料
- 跨文件企业知识库内容
较长的上下文窗口让模型可以在一次任务中读取更多材料,减少反复切分、总结和重新输入资料的次数。
Kimi API还会自动尝试使用上下文缓存。当多次请求具有较长且相同的输入前缀时,开发者可以按照缓存命中价格计费,降低长上下文任务的调用成本。
KDA降低长上下文计算成本
支撑100万Token上下文的重要技术之一,是Kimi Delta Attention,简称KDA。
传统全注意力机制需要计算不同Token之间的关系。随着上下文长度增长,计算量和显存需求也会快速提高。
KDA采用混合线性注意力设计,通过状态记忆保存和更新长序列中的信息,减少处理超长内容时的计算压力。
KDA并不意味着长上下文使用成本可以被完全消除,而是尝试在模型能力、信息保留和推理效率之间取得更好的平衡。
月之暗面还向vLLM社区提供了适配KDA的缓存实现,以支持K3在长上下文和大规模部署环境中的推理。
Attention Residuals改善深层信息传递
Kimi K3的另一项核心结构是Attention Residuals,也就是注意力残差。
普通Transformer主要通过逐层残差连接传递信息。随着模型层数增加,早期层中的部分信息可能在不断混合后变得难以直接利用。
Attention Residuals允许模型根据当前任务,从不同深度的历史表示中选择需要的信息,而不是简单地将所有层平均累积。
可以将两项技术的作用简单理解为:
- KDA主要解决超长序列中的信息传递效率
- Attention Residuals主要改善超深模型中的信息流动
- Stable LatentMoE负责扩大模型容量并控制激活规模
三者共同构成Kimi K3扩展至2.8万亿参数和100万Token上下文的主要架构基础。
原生视觉能力扩展任务边界
Kimi K3原生支持视觉输入,可以在同一个模型中理解文字、图片、视频、软件界面和程序运行截图。
这使其能够执行传统文本模型难以独立完成的任务,例如:
- 根据设计图生成前端页面
- 分析网页截图并调整页面布局
- 观察游戏运行画面后继续修改代码
- 理解CAD图纸和三维场景
- 分析科研图片和数据图表
- 从视频中识别内容与动作
- 根据视觉结果控制浏览器或工具
- 检查生成作品是否符合需求
Kimi K3可以在代码和实时截图之间反复迭代,形成“生成—运行—观察—修改”的视觉闭环。
Kimi官方展示了3D火箭发射模拟、开放世界游戏、GBA模拟器和黑洞可视化等案例,用于说明K3将编程、视觉理解和三维推理组合起来的能力。
长程编程成为Kimi K3重点方向
相比生成一段代码,长程编程要求模型持续完成多个相互依赖的工程步骤。
例如,开发一个完整功能可能涉及:
- 阅读代码仓库
- 分析项目结构
- 制定技术方案
- 修改多个文件
- 安装或调整依赖
- 运行测试
- 分析错误日志
- 修复代码
- 再次测试
- 输出交付说明
Kimi K3针对这类长时间、低人工干预的任务进行了重点训练,可以结合终端工具、代码执行环境和视觉反馈持续推进工作。
Kimi Code的更新日志还显示,K3上线后取消了单轮任务默认1000步的限制,减少长任务因为固定步数上限而被强制停止的情况。
24小时优化GPU内核
为了测试K3的长期工程能力,月之暗面搭建了GPU内核优化测试环境。
参评模型在独立GPU沙箱中获得相同任务、测试框架和生产负载,并可以在最多24小时内持续分析实现、重写内核和运行性能测试。
任务包括:
- NVIDIA H200上的Attention Residuals内核
- KDA线性注意力内核
- 512头维度MLA内核
- 国产GPU上的KDA任务
这类任务不仅要求模型生成正确代码,还要持续查看跑分结果、定位性能瓶颈并调整实现。
根据月之暗面披露的结果,Kimi K3在最大思考强度下取得了较强表现。不过,详细测试日志和完整评估方法仍需等待K3技术报告公布。
从零搭建MiniTriton编译器
Kimi K3还完成了一个名为MiniTriton的轻量级GPU编译器。
该系统没有直接依赖Triton IR,而是基于MLIR定义中间表示,并实现:
- 编程抽象
- 中间表示
- 编译优化Pass
- PTX代码生成
- FP32与FP64支持
- 算子编译
- 真实训练任务接入
在当前支持的算子上,MiniTriton的性能接近Triton和torch.compile。团队还使用其支持的TensorLite训练nanoGPT,并观察到正常收敛。
这一案例主要体现Kimi K3执行开放式软件工程任务的能力,而不是证明早期MiniTriton已经能够替代经过长期优化的成熟编译器。
Kimi K3尝试完成芯片设计
在另一项概念验证中,Kimi K3连续运行48小时,使用开源EDA工具和Nangate 45nm工艺库设计了一款面向nano模型的芯片。
公开数据包括:
- 芯片面积约4平方毫米
- 146万个标准单元
- 0.277MB SRAM
- INT4 MAC阵列
- 100MHz下完成时序收敛
- 仿真解码吞吐超过每秒8700个Token
这项测试展示了模型在芯片结构、逻辑实现、优化和验证流程之间持续工作的能力,但该芯片目前属于仿真和概念验证,并不代表已经完成实际流片。
科研和知识工作能力继续增强
Kimi K3不仅面向软件开发,也强调端到端知识工作和科研编程。
在计算天体物理案例中,K3围绕I-Love-Q普适关系完成了:
- 阅读和交叉验证20多篇论文
- 实现数值计算流程
- 评估300多种状态方程
- 检查已发表公式中的不一致
- 生成3000多行Python代码
- 制作交互式HTML仪表盘
月之暗面还展示了一份覆盖推理芯片行业42年历史的研究报告。该任务包含2800多次网页搜索与抓取、1100多次终端数据拉取、87份季报和99份原始PDF,总资料超过11000页。
这些案例说明,Kimi K3正在尝试把资料检索、PDF阅读、数据分析、代码执行和可视化输出连接成完整工作流。
Kimi Work增加小组件和看板
Kimi K3发布后,Kimi Work还增加了小组件和看板功能。
小组件可以在对话中生成交互式内容,并连接本地数据或外部工具。看板则可以将多个组件整理到长期保留的页面中。
用户可以围绕一个项目或主题建立:
- 行业数据看板
- 公司研究看板
- 项目进度面板
- 科研结果页面
- 销售数据组件
- 新闻监控模块
- 个人任务仪表盘
Kimi Work本身定位为本地Agent,可以读取授权的本地文件夹、操作网页、运行Python代码并执行持续性任务。
国产大模型商业化节奏正在加快
Kimi K3的意义不仅体现在参数规模,也体现在模型发布后迅速进入多个产品和收费渠道。
目前,K3已经覆盖:
- Kimi网页端
- iOS、Android及鸿蒙App
- Kimi Work桌面客户端
- Kimi Code编程工具
- Kimi API开放平台
- Kimi企业版
- 后续Kimi Hosted Agent平台
这说明月之暗面并未只把K3作为技术展示,而是同步将其用于个人订阅、开发者API、企业服务和智能体产品。
从产品布局来看,Kimi正在形成“模型—应用—开发工具—企业服务”的商业结构。这个判断属于基于公开产品和收费方式作出的行业分析。
Kimi K3 API如何收费?
Kimi K3 API按照每100万Token计费:
| Token类型 | 每100万Token价格 |
|---|---|
| 缓存命中输入 | 2元 |
| 未命中缓存输入 | 20元 |
| 模型输出 | 100元 |
相比小参数模型,K3的未命中输入和输出成本更高,但自动上下文缓存可以降低大型代码库、长报告和多轮Agent任务中重复输入的费用。
Kimi开放平台还在K3发布期间提供充值返券活动,反映出月之暗面正在通过促销、API价格和开发者生态加快K3的商业使用。
为什么超大模型仍需要低价格API?
2.8万亿总参数意味着K3的训练和部署对计算资源、显存、存储以及高速互联提出较高要求。
月之暗面建议在64个或更多加速器组成的Supernode环境中部署K3,普通个人电脑很难完整运行模型权重。
因此,开放权重并不等于低成本本地部署。多数个人开发者和中小企业更可能通过官方API或第三方推理平台使用K3。
API价格和缓存机制将直接影响K3是否能进入:
- AI编程工具
- 企业知识库
- 金融研究平台
- 科研计算系统
- 智能客服
- 文档处理工具
- 浏览器Agent
- 长任务自动化平台
国产替代逻辑应如何理解?
Kimi K3发布后,“国产替代”再次成为行业讨论重点。
在大模型领域,国产替代并不只是使用国内模型替换海外API,还包括:
- 使用国内模型服务处理企业数据
- 降低对单一海外供应商的依赖
- 获得更适合中文任务的能力
- 使用人民币结算的API服务
- 在国内云平台完成部署
- 根据企业要求进行私有化适配
- 使用开放权重进行行业微调
- 建立本地模型与Agent生态
Kimi K3提供中文服务、开放权重计划、API、企业版和开发工具,为国内团队提供了更多模型选项。
但模型选择仍应根据实际任务测试,不能只比较参数数量。开发者还需要评估:
- 真实任务成功率
- 推理速度
- API稳定性
- 数据安全
- 模型输出成本
- 工具调用能力
- 部署硬件需求
- 开放许可证
- 运维与技术支持
参数规模不等于所有任务表现最好
月之暗面在发布材料中也明确指出,Kimi K3虽然在整套评测中达到较强水平,但与顶级闭源模型相比,部分用户体验和高难度任务仍存在差距。
超大参数规模可以提高模型容量,但最终能力还受到以下因素影响:
- 训练数据质量
- 后训练方案
- 强化学习环境
- 推理计算预算
- Agent运行框架
- 工具质量
- 上下文组织方式
- 提示词和权限设置
因此,“全球最大开放模型”更多描述参数规模和开放定位,不等于K3在所有基准和真实任务中都是全球第一。
Kimi K3当前有哪些局限?
对历史思考内容敏感
K3在多轮Agent任务中需要保留完整历史消息。如果第三方框架丢弃部分思考历史,可能影响后续表现。
可能过于主动
K3主要优化长程复杂任务,遇到模糊指令时可能自行作出用户未预期的决定。
开发者应通过System Prompt或AGENTS.md明确规定文件权限、网络访问、生产环境操作和确认节点。
完整权重尚待发布
模型服务已经上线,但完整权重计划在2026年7月27日前提供。开放协议、硬件要求和社区推理适配仍需等待正式发布。
本地部署成本较高
即使权重开放,2.8万亿参数模型仍需要高性能集群部署,难以在普通消费级电脑中完整运行。
Kimi K3如何使用?
Kimi网页端
访问Kimi官方网站即可使用K3完成问答、研究和内容生成任务。
Kimi手机App
将Kimi App升级至最新版,可在iOS、Android和鸿蒙设备中体验。
Kimi Work
Kimi Work 3.1.0及以上版本支持K3,适合本地文件、行业研究、数据分析和办公工作流。
Kimi Code
开发者可以在终端中使用Kimi Code,并通过模型选择命令切换至K3。
Kimi API
开发者可通过兼容OpenAI格式的接口调用kimi-k3模型,构建代码Agent、知识工作Agent和行业信息整理工具。
总结
Kimi K3总参数规模达到2.8万亿,采用896个专家、每Token激活16个专家的混合专家架构,并结合Kimi Delta Attention和Attention Residuals支持100万Token上下文。
从已公布参数看,Kimi K3刷新了开放权重模型的规模纪录,并将视觉理解、长程编程、科研计算和知识工作纳入同一模型体系。
K3已经进入Kimi网页端、手机App、Kimi Work、Kimi Code和Kimi API,完整模型权重则计划在2026年7月27日前发布。
更值得关注的是,Kimi K3发布并非只停留在模型参数展示。月之暗面同步提供API计费、桌面Agent、编程工具和企业服务,体现出国产大模型正加快从技术能力向真实产品和商业场景延伸。
不过,2.8万亿参数也带来了较高的部署与推理门槛。K3能否在开放权重发布后形成完善的推理框架支持、开发者生态和行业应用,仍需继续观察。









评论区 (0)
最新评论登录后发布评论并参与互动。
暂无评论,欢迎抢沙发。