news 2026/7/29 10:24:50

【月之暗面拥抱开源】KIMI K3已经开源了,一夜下载量高达2850次

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
【月之暗面拥抱开源】KIMI K3已经开源了,一夜下载量高达2850次

📰 技术博客:Tech Blog📄 完整技术报告:Full Report

1. 模型介绍

Kimi K3 是一款开源权重、原生多模态智能体大模型,也是月之暗面迄今为止能力最强的模型。该模型总参数量达2.8万亿,基于 Kimi 增量注意力(KDA)与注意力残差(AttnRes)技术构建,原生内置视觉能力,上下文窗口支持100万 Token。它是全球首款开源3万亿参数级大模型,面向长周期代码开发、知识工作与复杂推理等前沿智能场景打造。

核心特性

  • 全新自研架构:Kimi K3 依托 Kimi 增量注意力(KDA)与注意力残差(AttnRes)搭建,通过稳定隐式混合专家(Stable LatentMoE)框架拓展稀疏专家能力;模型共896个专家,单次推理激活16个,相比 Kimi K2,整体扩展效率提升约2.5倍。
  • 长周期任务处理:仅需极少人工监督,Kimi K3 即可完成长时间工程会话、解析大型代码仓库、调度终端工具;适用场景覆盖GPU内核优化、编译器开发、视觉闭环游戏开发、CAD制图乃至芯片设计。
  • 全能知识智能体:Kimi K3 可端到端完成专业知识工作,能够生成带交互式可视化组件、控件与数据看板的深度研究报告,同时支持动效设计、视频剪辑,全部能力均依托原生多模态架构实现。
  • 原生多模态+百万级超长上下文:单模型统一处理文本、图像、视频输入,上下文窗口最高支持1048576 Token(100万Token)。
  • 开源前沿完整权重:我们基于 Kimi K3 专属许可证开放完整模型权重,前沿AI能力可面向学术研究、工程部署与二次创新公开使用。

2. 模型基础参数

模型架构混合专家 MoE
总参数量2.8万亿
单次激活参数量1040亿
总层数93层
稠密层数量1层
注意力层构成69层KDA增量注意力 + 24层门控MLA注意力
注意力隐藏维度7168
注意力头数量96个
隐式MoE维度3584
单专家MoE隐藏维度3072
专家总数896个
每个Token激活专家数16个
共享专家数量2个
词表大小16万
上下文长度上限1048576 Token
注意力机制KDA增量注意力 + 门控MLA
激活函数SiTU-GLU
视觉编码器MoonViT-V2
视觉编码器参数量4.01亿
量化方案权重MXFP4 / 激活值MXFP8
全程量化感知训练
支持模态文本、图像

3. 评测结果

评测基准Kimi K3
(最大推理强度)
Claude Fable 5
(最高强度,含降级兜底)
GPT-5.6 Sol
(最高强度)
Claude Opus 4.8
(最高强度)
GPT-5.5
(超高强度)
GLM-5.2
(最高强度)
推理与知识能力
GPQA Diamond 专业知识问答93.592.694.191.093.591.2
CritPt 深度批判性推理23.428.632.320.927.120.9
AA-LCR 长文本逻辑推理74.770.073.767.774.371.3
HLE-Full 高阶长文本问答43.5 / 56.053.3 / 63.044.5 / 58.049.8 / 57.941.4 / 52.2
代码能力
DeepSWE 真实仓库代码修复67.570.073.059.067.046.2
ProgramBench 通用程序生成77.876.877.671.970.863.7
Terminal-Bench 2.1 终端命令自动化88.388.088.884.683.482.7
FrontierSWE 前沿大型代码项目修复81.286.671.366.764.967.3
SWE-Marathon 长周期代码马拉松42.035.039.040.014.013.0
PostTrainBench 模型微调代码36.641.434.634.128.434.3
MLS-Bench-Lite 机器学习脚本48.349.946.242.835.540.4
SciCode 科研代码生成58.760.256.153.556.150.5
Kimi Code Bench 2.0 月之暗面自研代码基准72.976.964.871.769.064.2
智能体工具调用能力
BrowseComp 网页浏览综合任务91.288.090.484.384.4
DeepSearchQA 深度检索问答(F1值)95.094.293.1
ResearchRubrics 专业研究报告生成76.273.873.564.071.1
GDPval-AA v2 通用智能体Elo评分168617471736159314911510
Toolathlon-Verified 工具调用综合挑战赛76.577.974.976.273.559.9
MCPMark-Verified 多工具协作评测94.587.492.976.492.9
MCP-Atlas 多轮复杂工具交互84.284.783.683.682.882.6
AutomationBench 系统自动化任务30.829.129.727.222.712.9
JobBench 职场办公自动化54.357.445.448.438.343.4
AA-Briefcase 商业办公智能体Elo评分154815831495135411581260
Agents' Last Exam 高阶智能体综合大考28.325.729.627.026.620.4
APEX-Agents 复杂专业智能体任务41.043.339.939.438.535.6
OfficeQA Pro 图文文档办公问答63.369.963.263.960.941.4
SpreadsheetBench 2 表格数据处理34.834.732.431.629.128.1
OSWorld-Verified 操作系统操控验证集84.885.083.083.479.0
OSWorld 2.0 全版本操作系统操控58.366.162.655.749.5
SaaS-Bench 软件平台自动化操作60.161.456.143.8
τ³-Banking 银行金融智能体33.426.833.027.631.326.8
Harvey Lab-AA 实验室科研智能体94.693.687.291.186.391.0
CorpFin v2 企业财务分析71.671.864.466.768.466.1
Finance Agent v2 通用金融智能体54.456.353.853.951.849.7
Legal Research Bench 法律检索与文书44.249.548.143.840.431.3
视觉多模态能力
WorldVQA ForceAnswer 开放世界视觉问答51.056.741.839.138.5
OmniDocBench 全类型图文文档解析91.189.885.887.989.4
PerceptionBench 基础视觉感知(自研基准)58.557.259.747.255.8
Video-MME(带字幕视频理解)90.089.586.089.3
MMVU 通用多模态视频理解82.181.279.281.7
BabyVision 视觉+Python代码推理85.790.588.981.283.6
MMMU-Pro 专业多模态综合问答81.6 / 83.481.2 / 86.583.0 / 84.678.9 / 82.781.2 / 83.2
CharXiv (RQ) 图表数据分析84.8 / 91.388.9 / 93.584.6 / 89.180.5 / 89.984.1 / 89.0
MathVision 数学图像解题94.3 / 97.894.8 / 98.695.8 / 97.886.7 / 97.192.2 / 96.8
ZeroBench (pass@5) 零样本视觉复杂任务23.0 / 41.023.0 / 46.017.0 / 35.017.0 / 34.022.0 / 41.0
注释说明所有Kimi K3评测结果均采用推理强度设为“max(最大)”、温度参数1.0;单步任务(如GPQA Diamond、HLE-Full、无工具视觉基准)top-p=0.95;智能体多工具任务top-p=1.0。 HLE-Full、MMMU-Pro、CharXiv (RQ)、MathVision、ZeroBench单元格内两组分数格式为:无工具得分 / 启用工具后得分(HLE-Full使用通用工具,视觉类基准使用Python工具)。
  1. 推理与知识类基准

    • CritPt、AA-LCR:数据来源为 Artificial Analysis 平台2026年7月23日榜单。
  2. 代码类基准

    • DeepSWE:Kimi K3使用自研Kimi Code评测框架;GLM-5.2分数取自官方发布博客;其余模型数据来自DeepSWE官方榜单,Kimi K3搭配mini-SWE-agent框架得分67.3,评测基于DeepSWE v1.1任务集。
    • Terminal-Bench 2.1:Kimi K3使用自研Kimi Code评测框架;其他模型取各框架最优分:GLM-5.2搭配Claude Code;Claude Opus 4.8、Claude Fable 5搭配Terminus 2;GPT-5.5、GPT-5.6 Sol搭配Codex框架。
    • ProgramBench:Kimi K3使用自研Kimi Code评测框架;GLM-5.2分数取自官方博客;其余模型数据来自Vals AI平台。
    • SWE-Marathon:Kimi K3、Claude Opus 4.8、Claude Fable 5使用Claude Code框架;GPT-5.6 Sol使用Codex框架;GLM-5.2分数取自官方博客。评测基于2026年7月9日H20显卡校准分支(正式v1.1发布前版本),GPU任务镜像、校验标准已适配H20,正确性校验与反作弊逻辑不变。评测中Claude Fable 5有35%任务触发降级兜底,一定程度拉低最终得分。
    • FrontierSWE:Kimi K3使用Kimi Code框架,GPT-5.6 Sol使用Codex框架;其余模型数据来自FrontierSWE官网,榜单优势分数由官方脚本基于原始分数重新计算,数据更新至2026年7月16日。
    • PostTrainBench:GLM-5.2、GPT-5.5、Claude Opus 4.8采用官方榜单原始分数;Kimi K3、Claude Fable 5、GPT-5.6 Sol使用官方Harbor实现、最大推理强度,在H20 GPU上重复三次取均值(官方标准为H100);Kimi K3与Claude Fable 5搭配Claude Code框架,GPT-5.6 Sol搭配Codex框架。
    • MLS-Bench-Lite:Kimi K3使用Kimi Code框架;GLM、Claude系列使用Claude Code框架;GPT系列使用Codex框架。
    • SciCode:数据来源 Artificial Analysis 2026年7月23日榜单。
    • Kimi Code Bench 2.0(月之暗面自研基准):Kimi K3使用Kimi Code框架(搭配Claude Code框架得分73.7);GLM-5.2、Claude Opus 4.8、Claude Fable 5使用Claude Code框架;GPT-5.5、GPT-5.6 Sol使用Codex框架。全部模型开启最大推理强度,GPT-5.5除外(使用超高强度xhigh)。基准包含网络安全与安全校验任务,各模型拒绝/兜底任务数量:Claude Fable 5共80题,13题兜底、1题拒绝;GPT-5.6 Sol安全拦截10题;GPT-5.5拒绝3题。
  3. 智能体工具类基准

    • OfficeQA Pro:全部测试用例仅提供PDF图片渲染文件,无机器可读文本。
    • OfficeQA Pro、SpreadsheetBench 2:Kimi K3、GLM-5.2、Claude Opus 4.8、Claude Fable 5使用Claude Code框架;GPT-5.5、GPT-5.6 Sol使用Codex框架。
    • MCP-Atlas:评测采用公开500任务子集,单任务最大交互轮次100,使用Gemini 3.1 Pro作为结果裁判。
    • AutomationBench:评测采用公开600任务子集,其余配置严格遵循官方GitHub标准。
    • BrowseComp:开启30万Token上下文压缩策略;若直接使用完整100万上下文、无压缩策略,Kimi K3得分可达90.4。Claude Fable 5、Claude Opus 4.8、GPT-5.6 Sol、GPT-5.5分数取自Anthropic、OpenAI官方发布内容。
    • GDPval-AA v2、AA-Briefcase、τ³-Banking、Harvey Lab-AA、APEX-Agents:数据来源 Artificial Analysis、APEX-Agents官方榜单,更新至2026年7月23日;Harvey Lab-AA报告任务通过率。
    • CorpFin v2、Finance Agent v2、Legal Research Bench:数据来源Vals AI平台。
    • Agents’ Last Exam:分数取自官方榜单(2026年7月23日),指标为任务通过率;各模型固定搭配评测框架:Kimi K3搭配Kimi Code;GPT-5.6 Sol/GPT-5.5搭配Codex;Claude Fable 5/Claude Opus 4.8/GLM-5.2搭配Claude Code。†标记:Claude Fable 5采用超高推理强度,40%任务结果降级。
  4. 多模态视觉基准
    除ZeroBench重复五次取结果外,其余多模态评测均运行三次取平均分。MMMU-Pro严格遵循官方评测协议,原图前置输入文本。

    • PerceptionBench:月之暗面自研基准,聚焦基础原子级视觉感知能力。

4. 原生MXFP4量化方案

Kimi K3从监督微调(SFT)阶段即全程采用量化感知训练,权重使用MXFP4格式、激活值使用MXFP8格式,适配广泛硬件推理环境。

5. 部署指南

注意:你可前往 Kimi 开放平台 https://platform.kimi.ai 选择模型kimi-k3调用API,同时提供兼容OpenAI、Anthropic格式的标准接口。当前推荐使用以下推理引擎部署Kimi K3:

  • vLLM — 部署教程:https://recipes.vllm.ai/moonshotai/Kimi-K3
  • SGLang — 使用手册:https://docs.sglang.io/cookbook/autoregressive/Moonshotai/Kimi-K3
  • TokenSpeed — 部署脚本:https://lightseek.org/tokenspeed/recipes/models#kimi-k3

6. 模型调用使用说明

Kimi K3默认开启深度思考输出,接口会返回独立字段reasoning_content(思考过程)。
推理强度通过请求顶层参数reasoning_effort配置,可选值:low(低)、high(高)、max(最大,默认)。

Kimi K3训练时保留完整思考历史;多轮对话、工具调用场景下,必须将接口返回的完整助手消息原样传入messages数组,包括思考内容reasoning_content与工具调用tool_calls,不能仅传入最终回答content

importopenaidefchat_with_preserved_thinking(client:openai.OpenAI,model_name:str):messages=[{"role":"user","content":"给我三个随机数字。"},{"role":"assistant","reasoning_content":"我先列出五个数字:473、921、235、215、222,然后告诉你前三个。","content":"473、921、235"},{"role":"user","content":"你心里剩下另外两个数字是什么?"}]response=client.chat.completions.create(model=model_name,messages=messages,stream=False,max_tokens=4096,reasoning_effort="max",)# 模型会读取上一轮思考内容,输出215和222print(f"模型思考过程:{response.choices[0].message.reasoning}")returnresponse.choices[0].message.content

图文输入、结构化输出、增量模式、工具选择、动态工具加载、上下文缓存等完整教程与示例,详见官方文档:
Kimi K3 快速上手文档、推理强度配置指南

代码智能体配套框架

Kimi K3搭配 Kimi Code CLI 智能体框架效果最佳。欢迎在终端运行Kimi Code,输入/model命令切换至Kimi K3。期待你的使用反馈!

7. 开源许可证

代码仓库与模型权重均遵循 Kimi K3 专属许可证 开放。

8. 联系我们

如有任何问题,可发送邮件至 support@moonshot.ai 咨询。

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/7/29 10:23:58

IaaS,PaaS,SaaS

整体类比:租房子全流程 你想要安家办公,有三种租房模式,对应三层云服务;O-Cloud、CU/DU 云化全是基于这三层。 表格 分层 全称 租房类比 谁来管硬件、系统、软件 IaaS 基础设施即服务 租一块空地 水电网线 运营商 / 云厂商负责&a…

作者头像 李华
网站建设 2026/7/29 10:23:57

射频通信距离调试指南:从链路预算到天线调谐的工程实践

1. 项目概述:当你的无线信号“跑不远”时,该怎么办?做无线产品,最让人头疼的问题之一,就是通信距离不达标。你辛辛苦苦画好板子、写好代码,满怀期待地拿着样机去测试,结果发现信号在几十米外就断…

作者头像 李华
网站建设 2026/7/29 10:21:46

分布式模型预测控制在多智能体协同中的Matlab实现

1. 项目背景与核心价值 多智能体系统的协同控制在无人机编队、自动驾驶车队、工业机器人集群等领域有着广泛的应用前景。点对点转移问题(Point-to-Point Transfer)作为其中的基础性课题,要求多个智能体在避免碰撞的前提下,从初始位…

作者头像 李华
网站建设 2026/7/29 10:19:56

Windows平台Frida逆向实战:从Hook到主动调用的完整指南

1. 项目概述:为什么要在Windows上玩Frida逆向? 如果你对移动安全或者应用逆向有点兴趣,那“Frida”这个名字你肯定不陌生。它就像一把瑞士军刀,能让你在运行时动态地探查、修改甚至控制目标应用的行为。不过,很多教程和…

作者头像 李华
网站建设 2026/7/29 10:19:43

炉石传说终极优化指南:HsMod跨平台插件50+功能全解析

炉石传说终极优化指南:HsMod跨平台插件50功能全解析 【免费下载链接】HsMod Hearthstone Modification Based on BepInEx 项目地址: https://gitcode.com/GitHub_Trending/hs/HsMod 炉石传说玩家是否厌倦了重复繁琐的操作?HsMod炉石传说优化插件为…

作者头像 李华
网站建设 2026/7/29 10:18:56

风云荡声色

风云荡声色种了因果天,得来果因地。悠然见南山,良辰竖正气。谓之境界了,诚矣仁心兮。莫忧千古愁,仅行如今思。力慰不平度,水静一面辞。多少辛酸事,长短欢喜戏。记上尘俗飞,立下阡陌起。草色怕秋…

作者头像 李华