2026年7月27日,月之暗面正式发布Kimi K3完整模型权重、技术报告和部署资料。

image.png

Kimi K3拥有 2.8万亿总参数、1040亿激活参数,采用混合专家架构,原生支持视觉理解,并提供100万Token上下文窗口。月之暗面将其称为全球首个开放的3T级模型,目前权重已经可以通过GitHub和Hugging Face获取。

与权重一同公开的还有多项支撑Kimi K3训练和运行的底层能力,包括:

  • AgentENV:大规模智能体训练沙箱
  • MoonEP:MoE专家并行通信库
  • FlashKDA:Kimi Delta Attention高性能算子
  • Kimi K3完整技术报告
  • vLLM、SGLang和TokenSpeed部署方案

这些内容意味着,Kimi K3此次开放的不只是一个可以在线调用的API,而是包含模型权重、架构说明、推理适配和Agent训练基础设施的一套技术体系。

Kimi K3是开源模型还是开放权重模型?

中文报道经常将Kimi K3直接称为“开源大模型”,但从严格的软件许可证口径看,称其为 开放权重模型更加准确。

月之暗面已经公开:

  • 完整模型权重
  • 参数和配置文件
  • 模型技术报告
  • 推理使用说明
  • 部分训练与基础设施代码
  • 商业使用许可条款

Kimi K3使用自定义的 Kimi K3 License,而不是Apache 2.0、MIT等标准开源许可证。许可证允许用户使用、复制、修改、部署、微调、发布和分发模型,也允许创建衍生作品。

不过,许可证中还包含两项需要企业用户特别注意的条件:

  1. 如果企业运营“模型即服务”业务,并且连续12个月总收入超过2000万美元,需要与月之暗面另行签署协议。
  2. 如果使用Kimi K3的商业产品月活超过1亿,或者月收入超过2000万美元,需要在产品界面中显著展示“Kimi K3”名称。

因此,更准确的文章表述是:

Kimi K3已经完整开放模型权重,并允许研究、部署、微调及多数商业使用,但采用带有规模化商业条款的自定义许可证。

Kimi K3核心参数一览

模型规格Kimi K3
模型架构Mixture-of-Experts,MoE
总参数量2.8T,约2.8万亿
激活参数量104B,约1040亿
网络层数93层
专家总数896个
每Token选择专家16个
共享专家2个
上下文窗口1,048,576 Token
核心注意力结构KDA与Gated MLA
视觉编码器MoonViT-V2
输入模态文字、图片及视频理解
权重量化MXFP4权重、MXFP8激活
当前思考档位low、high、max

以上参数已经在Kimi K3官方模型卡和技术报告中公开。

2.8万亿参数为什么没有全部同时运行?

Kimi K3采用混合专家模型架构。

模型内部共有896个路由专家,但处理每个Token时,只会选择其中16个专家,同时还会调用2个共享专家。最终每次推理实际激活约1040亿参数,而不是运行全部2.8万亿参数。

这种结构试图同时获得两方面优势:

  • 通过大量专家扩大模型知识和能力容量
  • 通过稀疏激活控制每次推理的计算成本

不同专家可以在训练中学习代码、数学、视觉、知识工作、工具使用和科学计算等不同类型的模式。路由系统再根据当前输入,将Token分配给更适合的专家。

需要注意的是,1040亿激活参数仍然远大于大多数可以在个人电脑本地运行的模型。即使权重已经开放,完整部署仍然更适合数据中心、云计算平台和拥有多卡集群的研究机构。

KDA与Attention Residuals构成K3架构骨架

Kimi K3主要建立在两项月之暗面自研结构之上:

  • Kimi Delta Attention,简称KDA
  • Attention Residuals,简称AttnRes

Kimi Delta Attention

KDA是一种混合线性注意力机制,主要用于降低长上下文带来的计算和存储压力。

传统全注意力需要计算大量Token之间的关系。上下文越长,计算量和显存占用增长越明显。

KDA通过状态记忆和线性注意力结构处理长序列,使Kimi K3能够支持100万Token上下文,同时保留全注意力层处理复杂信息关系。

Kimi K3的93层网络由:

  • 69层KDA
  • 24层Gated MLA

共同组成。

Attention Residuals

传统残差连接通常将上一层输出持续累积到下一层。

当模型层数非常深时,早期层的重要信息可能在不断混合后变得难以直接使用。Attention Residuals允许模型从不同深度的历史表示中有选择地检索信息,而不是只进行固定累加。

可以简单理解为:

  • KDA处理长序列中的信息流动
  • Attention Residuals处理深层网络中的信息流动
  • Stable LatentMoE负责扩大专家规模并保持训练稳定

月之暗面表示,这些结构配合新的训练方法和数据配方,使Kimi K3相较Kimi K2的整体扩展效率提高约2.5倍。

原生视觉与100万Token上下文

Kimi K3是一款原生多模态Agent模型,可以在同一个模型中处理文字、图片和视频信息。

原生视觉能力可用于:

  • 根据设计图编写网页
  • 读取软件运行截图
  • 分析图表和科研图片
  • 理解视频内容
  • 根据视觉反馈修改代码
  • 处理CAD和三维开发任务
  • 从图片和文档中提取信息

这对于前端开发、游戏、设计转代码和计算机操作任务尤其重要。

模型可以先生成代码,再查看运行后的页面截图,发现布局、色彩或交互问题后继续修改,形成“代码—运行—视觉检查—继续调整”的闭环。

100万Token上下文则可以用于容纳:

  • 大型代码仓库
  • 多份研究报告
  • 长篇合同和业务材料
  • 大量网页及终端结果
  • 长时间Agent任务历史
  • 企业知识库
  • 多轮工具调用记录

不过,上下文窗口足够大并不等于模型能同等准确地利用所有内容。实际项目仍需要清晰的文件结构、检索机制和任务规划。

完整权重已经放出

Kimi K3模型权重目前已经发布至Hugging Face,并同步建立官方GitHub仓库。

开放内容包括:

  • 模型权重
  • 模型配置
  • Tokenizer
  • 技术报告
  • 许可证
  • 推理说明
  • 评测结果
  • API使用方法
  • 多轮思考历史要求
  • 部署框架适配

官方推荐使用以下推理引擎:

  • vLLM
  • SGLang
  • TokenSpeed

开发者也可以通过官方API调用kimi-k3,接口兼容OpenAI和Anthropic格式。

Kimi K3从监督微调阶段开始进行量化感知训练,使用MXFP4权重与MXFP8激活,主要目的是提高超大模型在不同硬件环境中的部署效率。

Kimi K3不是普通电脑下载后就能直接运行

开放权重并不等于低门槛本地运行。

Kimi K3拥有2.8万亿总参数,即使采用低精度权重和MoE稀疏激活,完整权重的存储、内存和通信需求依然非常高。

普通个人电脑可以下载模型资料、查看架构和使用社区量化版本,但要完整运行官方模型,通常需要多台服务器、多张高显存GPU和高速互联环境。

因此,Kimi K3开放权重主要为以下用户带来价值:

  • 大型云计算平台
  • 高校和科研机构
  • 推理服务商
  • 大型企业AI团队
  • 模型压缩与量化研究者
  • Agent后训练团队
  • 推理框架开发者

大多数个人开发者仍然更适合通过Kimi API或第三方托管平台使用模型。

AgentENV是什么?

AgentENV是月之暗面与清华大学MADSys实验室、KVCache.ai团队共同开放的分布式智能体运行环境。

该系统用于大规模运行Agent训练任务,并已经被用于Kimi K3的Agentic RL强化学习训练。

普通语言模型训练主要让模型预测下一个Token。

Agent模型还需要在真实或模拟环境中反复完成任务,例如:

  • 阅读和修改代码
  • 安装依赖
  • 执行终端命令
  • 启动服务
  • 操作数据库
  • 调用工具
  • 检查任务是否成功
  • 失败后重新规划

每个训练任务都需要一个完整、独立且可恢复的执行环境。

如果数万个Agent同时运行,环境的创建、暂停、恢复和存储成本会变得非常高。AgentENV就是为解决这一问题而设计的。

AgentENV如何提供强隔离?

AgentENV使用Firecracker MicroVM运行智能体环境,而不是只依赖普通容器。

每个Agent运行在独立的轻量虚拟机中,拥有自己的:

  • 内核
  • 内存
  • 文件系统变化
  • 运行进程
  • 网络环境
  • 软件依赖

相比共享宿主机内核的普通容器,MicroVM可以提供更强的隔离,降低一个Agent任务影响其他环境或宿主机的风险。

这对于Agent强化学习很重要,因为训练中的模型可能会:

  • 执行错误命令
  • 修改系统文件
  • 安装冲突依赖
  • 产生无限循环
  • 启动异常服务
  • 消耗过多资源

强隔离可以把错误限制在单个沙箱中。

快照、恢复与分叉为什么重要?

长程Agent任务可能持续几十分钟甚至数小时。

如果每次出现错误都必须重新创建完整环境、下载依赖并执行前面所有步骤,训练成本会非常高。

AgentENV支持:

  • 暂停环境
  • 恢复环境
  • 增量快照
  • 从快照继续执行
  • 从同一状态分叉多个沙箱
  • 保存内存和文件系统变化

官方数据显示,快照支持的环境可以在50毫秒内启动或恢复,在100毫秒内暂停;即使文件系统发生大量修改,增量快照也可在100毫秒内完成。

例如,一个Agent已经完成项目安装和代码编译后,可以从当前状态分叉出多个独立环境:

  • 一个尝试方案A
  • 一个尝试方案B
  • 一个尝试方案C

不同方案可以并行运行,不需要重复准备全部环境。

AgentENV可降低多少运行成本?

KVCache.ai公布的测试显示,在典型Agentic RL负载中,AgentENV可以将执行环境成本降低约88.6%至96.8%。

该数据来自AgentENV团队按照典型云计算和环境使用方式进行的测算,实际节省幅度会随任务持续时间、快照频率、并发量和硬件配置变化。

它的主要节省来源包括:

  • 空闲环境及时释放CPU和内存
  • 镜像按需加载
  • 本地磁盘只缓存高频数据
  • 快照避免重复初始化
  • 分叉复用已有状态
  • 多节点统一调度
  • 内存和存储页共享

AgentENV采用MIT许可证开放,开发者可以查看源码并用于自己的Agent训练或执行平台。

MoonEP解决MoE通信问题

Kimi K3拥有896个专家,训练时需要把不同Token分配到不同GPU和专家上。

如果部分专家接收到大量Token,而其他专家负载很低,就会造成:

  • GPU等待
  • 通信阻塞
  • 显存浪费
  • 训练吞吐下降

MoonEP是月之暗面开放的专家并行通信库,通过动态冗余专家等方式,让不同计算卡之间的Token负载保持更加均衡。

它主要服务于超大MoE模型训练和推理,减少专家路由不均造成的通信开销。月之暗面已将MoonEP以MIT许可证放到GitHub。

FlashKDA加速Kimi Delta Attention

FlashKDA是针对KDA架构开发的高性能GPU算子。

它基于CUTLASS实现,用于降低Kimi Delta Attention在训练和推理中的计算与内存开销。

由于KDA不是传统全注意力,现有推理框架无法直接获得最佳性能。开放FlashKDA可以帮助:

  • 云平台适配Kimi K3
  • 推理框架增加KDA支持
  • 研究者复现性能
  • 第三方服务商降低部署成本
  • 社区继续优化算子

MoonEP、FlashKDA和AgentENV分别处理专家通信、注意力计算和Agent环境运行,形成支撑Kimi K3规模化训练的三类基础设施。

Kimi K3曾以1679分登顶Arena前端榜

Kimi K3发布时,在Arena.ai的Code Arena WebDev前端盲测中取得1679分,超过Claude Fable 5和GPT-5.6 Sol,登上榜单第一。

这使Kimi K3成为首批在高关注度前端真人盲测中取得第一的中国大模型之一。

Code Arena会让两个匿名模型根据相同需求生成网页,用户只能查看实际运行结果,再选择更满意的一方。

这类评测重点衡量:

  • 需求理解
  • 页面视觉效果
  • 功能完整性
  • 交互体验
  • 参考图还原
  • 前端代码执行
  • 多步骤工具使用

与厂商自行选择题目的内部评测相比,真人匿名投票更接近用户对实际交付结果的偏好。

最新榜单已经变为第二名

Arena榜单会随着新模型加入和投票增加不断变化。

截至2026年7月27日,Kimi K3的最新分数已经提高至 1682分,但由于Claude Opus 5 Max以1725分进入榜单,Kimi K3目前位列第二,仍领先Claude Fable 5和GPT-5.6 Sol。

当前主要排名为:

排名模型得分
1Claude Opus 5 Max1725
2Kimi K3 Max1682
3Claude Opus 5 High1670
4Claude Fable 51629
5GPT-5.6 Sol xHigh1623

因此,文章中可以保留“Kimi K3曾登顶Arena前端榜”,但不宜写成“当前仍排名全球第一”。

更准确的表述是:

Kimi K3发布时以1679分登顶,最新得分升至1682分,目前随着新模型加入位列第二。

马斯克不是简单点赞,而是回复Impressive

Kimi K3发布后,马斯克在Artificial Analysis相关评测帖子下回复:

Impressive

随后,他在讨论xAI下一代2T参数模型时表示,该模型可能超过Kimi。月之暗面则回应“欢迎加入2T+俱乐部”。

因此,中文标题中的“马斯克点赞”更多是一种传播化表达。

从事实口径看,更准确的是:

马斯克公开评价Kimi K3的表现“令人印象深刻”,并把Kimi作为xAI下一代模型希望超过的参照对象。

这说明Kimi K3已经进入全球前沿模型团队和行业从业者的关注范围,但名人评价本身不能替代技术报告、真实任务和第三方测试。

Kimi K3为什么受到全球关注?

Kimi K3的关注度并不只来自2.8万亿参数。

它同时具备几项容易形成行业影响的特征:

1. 参数规模进入3T级

Kimi K3是全球首个公开完整权重的3T级模型,进一步提高了开放模型的规模上限。

2. 能力接近前沿闭源模型

官方和第三方测试显示,Kimi K3在长程编程、Agent、知识工作和前端开发等任务中已经接近部分顶级闭源模型。官方技术报告同时承认,模型整体表现仍落后于Claude Fable 5和GPT-5.6 Sol。

3. 原生支持多模态

Kimi K3可以把图片和视频理解放入代码、研究和Agent工作流,而不是仅提供纯文字推理。

4. 开放完整权重

企业和研究机构可以自行部署、微调、研究和建立第三方推理服务,不必完全依赖月之暗面官方API。

5. 同步开放底层基础设施

AgentENV、MoonEP和FlashKDA让社区可以研究K3背后的训练和部署方法,而不是只能获得一个模型文件。

Kimi K3适合哪些使用场景?

长程软件开发

适合读取大型代码仓库、修改多个文件、运行终端和测试,并持续处理数小时级任务。

前端和游戏开发

原生视觉能力可以帮助模型观察页面截图和运行结果,再继续调整代码。

科学研究与计算

可用于论文阅读、科学编程、数据分析、数值实验和可视化。

企业知识工作

适合处理大量文档、数据表格、行业资料和研究报告。

Agent训练研究

研究机构可以结合AgentENV建立大规模沙箱,训练模型的工具使用和任务完成能力。

私有化部署

拥有足够计算资源的企业可以在内部运行模型,并对行业数据进行微调。

开放权重带来了哪些实际价值?

减少对单一API供应商的依赖

企业可以自行选择部署平台和推理服务商,降低模型接口中断或价格变化带来的风险。

支持行业微调

医疗、金融、制造和科研机构可以基于内部数据训练专用模型。

推动推理成本下降

不同云平台和推理服务商可以围绕相同权重竞争,推动量化、缓存和算子优化。

提高技术透明度

技术报告、模型权重和基础设施源码可以被研究人员检查、测试和复现。

扩大国产模型生态

开发工具、Agent平台、企业应用和云服务可以快速接入Kimi K3,而不必只等待官方产品更新。

Kimi K3目前仍有哪些限制?

硬件门槛很高

2.8万亿参数使完整部署需要大规模GPU集群,普通开发者很难直接运行官方完整权重。

许可证不是标准开源许可证

大规模模型服务和超大型商业产品需要满足额外条款,企业使用前应由法务检查许可证。

Arena前端成绩不代表综合第一

Kimi K3在前端开发榜表现突出,但不能由此推导为所有数学、知识、视觉和Agent任务中的全球最强模型。

思考历史需要完整保留

Kimi K3采用保留思考历史的训练方式。多轮对话和工具调用时,API客户端需要完整回传reasoning_contenttool_calls,否则可能影响后续表现。

模型可能过度主动

长程Agent模型在指令不够明确时,可能自行补充条件或作出用户没有要求的决定。代码修改、生产环境和高风险工具调用仍需设置权限与人工确认。

如何使用Kimi K3?

使用Kimi网页端或App

普通用户可以直接通过Kimi产品使用模型,完成研究、代码、PPT、表格和网页任务。

使用Kimi API

开发者可以在Kimi开放平台选择:

kimi-k3

接口支持OpenAI和Anthropic兼容格式,并可配置:

  • low
  • high
  • max

三档思考强度。

下载完整权重

完整权重和模型卡已经发布在Hugging Face。

查看源码和技术报告

GitHub仓库提供模型说明、许可证和完整技术报告。

部署到推理集群

官方目前推荐使用vLLM、SGLang或TokenSpeed进行部署。

总结

Kimi K3已经于2026年7月27日正式开放完整模型权重和技术报告。

该模型采用2.8万亿参数MoE架构,每个Token激活约1040亿参数,拥有896个专家、100万Token上下文和原生视觉能力。

Kimi K3发布时曾以1679分登顶Arena前端代码盲测榜。随着Claude Opus 5 Max加入,截至7月27日,Kimi K3以1682分排名第二,但仍领先Claude Fable 5和GPT-5.6 Sol。

马斯克在相关评测帖下回复“Impressive”,并将Kimi作为xAI下一代2T模型希望超过的参照。

比参数和名人评价更值得关注的是,月之暗面此次同时开放了:

  • Kimi K3完整模型权重
  • Kimi K3技术报告
  • AgentENV智能体训练环境
  • MoonEP专家并行通信库
  • FlashKDA高性能注意力算子

这让Kimi K3不再只是一个可以在线使用的模型,而是一套可以被研究、部署、优化和继续开发的开放模型体系。

不过,Kimi K3使用自定义许可证,完整部署门槛也非常高。对大多数个人用户来说,API仍然是最现实的使用方式;对云平台、科研机构和大型企业而言,完整权重和Agent训练基础设施才是此次开放的主要价值。

相关链接