Kimi K3发布:2.8万亿参数开源模型,百万token上下文
月之暗面推出Kimi K3,拥有2.8万亿参数、100万token上下文和原生视觉理解能力,基于自研KDA混合线性注意力机制。作为全球首个3万亿级别开源模型,它在长程编程和推理任务上表现突出,为开源大模型阵营注入强劲动力。
Kimi K3 发布:2.8 万亿参数的开源模型来了
今天,月之暗面正式推出了 Kimi K3——目前能力最强的模型。这不是一次简单的版本迭代,而是架构和规模上的一次大跨步。
Kimi K3 拥有 2.8 万亿参数,基于自研的 KDA 混合线性注意力机制(Kimi Delta Attention)和注意力残差(Attention Residuals)技术构建。它原生支持视觉理解,上下文窗口达到 100 万 token。更重要的是,它是全球首个开源的 3 万亿级别模型,专门为长程编程、知识工作和推理这类前沿场景设计。
从整体表现看,Kimi K3 还落后于最强的闭源模型 Claude Fable 5 和 GPT-5.6 Sol。但在月之暗面自己的整套评测中,它展现出了前沿水平,稳定超过其他所有模型。
Kimi K3 的发布只是一个开始。团队表示会继续挖掘 K3 的潜力,持续提升它在真实任务中的表现。
怎么用上 Kimi K3?
即日起,你可以通过以下渠道使用 Kimi K3:
- kimi.com 网页版
- 最新版 Kimi 手机 App
- 最新版 Kimi Work 桌面客户端
- Kimi Code
- Kimi API
目前默认的思考强度为 max(极致模式)。后续更新会加入 low 和 high 两种模式,让用户根据场景灵活选择。
3 万亿级开源模型,规模持续领先
Kimi K3 是首个达到 2.8 万亿参数规模的开源模型。这背后是 Kimi 团队在模型规模上持续投入的结果:过去 12 个月里,有 9 个月 Kimi 模型都保持着开源模型的规模上限。
架构层面,Kimi K3 的核心创新来自 Kimi Delta Attention(KDA)和 Attention Residuals(AttnRes)。这两项改进的目标很直接:让信息在更长的序列和更深的模型中流动得更顺畅。同时,团队进一步扩大了 Mixture of Experts(MoE)的稀疏度。结合 Stable LatentMoE 框架后,模型可以在 896 个专家中高效激活 16 个。
再加上训练方法和数据配方的优化,这些结构性改进让 Kimi K3 相比 K2 的整体扩展效率提升了约 2.5 倍。同样的算力投入,K3 能产出更强的能力。
开源计划与后续安排
月之暗面目前正与推理合作伙伴和开源维护者密切协作,对齐技术细节,确保模型能在整个生态中可靠上线。完整模型权重计划在 2026 年 7 月 27 日前发布。关于架构、训练和评测的更多细节,将随 Kimi K3 技术报告一同公布。
对于关注大模型发展的开发者、研究者和企业用户来说,Kimi K3 的发布意味着开源阵营又多了一个重量级选手。2.8 万亿参数、100 万 token 上下文、原生视觉理解——这些参数背后,是月之暗面在模型规模和能力边界上的又一次试探。
接下来就看 K3 在实际场景中的表现了。

