📰 技术博客:Tech Blog📄 完整技术报告:Full Report
1. 模型介绍
Kimi K3 是一款开源权重、原生多模态智能体大模型,也是月之暗面迄今为止能力最强的模型。该模型总参数量达2.8万亿,基于 Kimi 增量注意力(KDA)与注意力残差(AttnRes)技术构建,原生内置视觉能力,上下文窗口支持100万 Token。它是全球首款开源3万亿参数级大模型,面向长周期代码开发、知识工作与复杂推理等前沿智能场景打造。
核心特性
- 全新自研架构:Kimi K3 依托 Kimi 增量注意力(KDA)与注意力残差(AttnRes)搭建,通过稳定隐式混合专家(Stable LatentMoE)框架拓展稀疏专家能力;模型共896个专家,单次推理激活16个,相比 Kimi K2,整体扩展效率提升约2.5倍。
- 长周期任务处理:仅需极少人工监督,Kimi K3 即可完成长时间工程会话、解析大型代码仓库、调度终端工具;适用场景覆盖GPU内核优化、编译器开发、视觉闭环游戏开发、CAD制图乃至芯片设计。
- 全能知识智能体:Kimi K3 可端到端完成专业知识工作,能够生成带交互式可视化组件、控件与数据看板的深度研究报告,同时支持动效设计、视频剪辑,全部能力均依托原生多模态架构实现。
- 原生多模态+百万级超长上下文:单模型统一处理文本、图像、视频输入,上下文窗口最高支持1048576 Token(100万Token)。
- 开源前沿完整权重:我们基于 Kimi K3 专属许可证开放完整模型权重,前沿AI能力可面向学术研究、工程部署与二次创新公开使用。
2. 模型基础参数
| 模型架构 | 混合专家 MoE |
| 总参数量 | 2.8万亿 |
| 单次激活参数量 | 1040亿 |
| 总层数 | 93层 |
| 稠密层数量 | 1层 |
| 注意力层构成 | 69层KDA增量注意力 + 24层门控MLA注意力 |
| 注意力隐藏维度 | 7168 |
| 注意力头数量 | 96个 |
| 隐式MoE维度 | 3584 |
| 单专家MoE隐藏维度 | 3072 |
| 专家总数 | 896个 |
| 每个Token激活专家数 | 16个 |
| 共享专家数量 | 2个 |
| 词表大小 | 16万 |
| 上下文长度上限 | 1048576 Token |
| 注意力机制 | KDA增量注意力 + 门控MLA |
| 激活函数 | SiTU-GLU |
| 视觉编码器 | MoonViT-V2 |
| 视觉编码器参数量 | 4.01亿 |
| 量化方案 | 权重MXFP4 / 激活值MXFP8 全程量化感知训练 |
| 支持模态 | 文本、图像 |
3. 评测结果
| 评测基准 | Kimi K3 (最大推理强度) | Claude Fable 5 (最高强度,含降级兜底) | GPT-5.6 Sol (最高强度) | Claude Opus 4.8 (最高强度) | GPT-5.5 (超高强度) | GLM-5.2 (最高强度) |
|---|---|---|---|---|---|---|
| 推理与知识能力 | ||||||
| GPQA Diamond 专业知识问答 | 93.5 | 92.6 | 94.1 | 91.0 | 93.5 | 91.2 |
| CritPt 深度批判性推理 | 23.4 | 28.6 | 32.3 | 20.9 | 27.1 | 20.9 |
| AA-LCR 长文本逻辑推理 | 74.7 | 70.0 | 73.7 | 67.7 | 74.3 | 71.3 |
| HLE-Full 高阶长文本问答 | 43.5 / 56.0 | 53.3 / 63.0 | 44.5 / 58.0 | 49.8 / 57.9 | 41.4 / 52.2 | — |
| 代码能力 | ||||||
| DeepSWE 真实仓库代码修复 | 67.5 | 70.0 | 73.0 | 59.0 | 67.0 | 46.2 |
| ProgramBench 通用程序生成 | 77.8 | 76.8 | 77.6 | 71.9 | 70.8 | 63.7 |
| Terminal-Bench 2.1 终端命令自动化 | 88.3 | 88.0 | 88.8 | 84.6 | 83.4 | 82.7 |
| FrontierSWE 前沿大型代码项目修复 | 81.2 | 86.6 | 71.3 | 66.7 | 64.9 | 67.3 |
| SWE-Marathon 长周期代码马拉松 | 42.0 | 35.0 | 39.0 | 40.0 | 14.0 | 13.0 |
| PostTrainBench 模型微调代码 | 36.6 | 41.4 | 34.6 | 34.1 | 28.4 | 34.3 |
| MLS-Bench-Lite 机器学习脚本 | 48.3 | 49.9 | 46.2 | 42.8 | 35.5 | 40.4 |
| SciCode 科研代码生成 | 58.7 | 60.2 | 56.1 | 53.5 | 56.1 | 50.5 |
| Kimi Code Bench 2.0 月之暗面自研代码基准 | 72.9 | 76.9 | 64.8 | 71.7 | 69.0 | 64.2 |
| 智能体工具调用能力 | ||||||
| BrowseComp 网页浏览综合任务 | 91.2 | 88.0 | 90.4 | 84.3 | 84.4 | — |
| DeepSearchQA 深度检索问答(F1值) | 95.0 | 94.2 | — | 93.1 | — | — |
| ResearchRubrics 专业研究报告生成 | 76.2 | — | 73.8 | 73.5 | 64.0 | 71.1 |
| GDPval-AA v2 通用智能体Elo评分 | 1686 | 1747 | 1736 | 1593 | 1491 | 1510 |
| Toolathlon-Verified 工具调用综合挑战赛 | 76.5 | 77.9 | 74.9 | 76.2 | 73.5 | 59.9 |
| MCPMark-Verified 多工具协作评测 | 94.5 | 87.4 | 92.9 | 76.4 | 92.9 | — |
| MCP-Atlas 多轮复杂工具交互 | 84.2 | 84.7 | 83.6 | 83.6 | 82.8 | 82.6 |
| AutomationBench 系统自动化任务 | 30.8 | 29.1 | 29.7 | 27.2 | 22.7 | 12.9 |
| JobBench 职场办公自动化 | 54.3 | 57.4 | 45.4 | 48.4 | 38.3 | 43.4 |
| AA-Briefcase 商业办公智能体Elo评分 | 1548 | 1583 | 1495 | 1354 | 1158 | 1260 |
| Agents' Last Exam 高阶智能体综合大考 | 28.3 | 25.7† | 29.6 | 27.0 | 26.6 | 20.4 |
| APEX-Agents 复杂专业智能体任务 | 41.0 | 43.3 | 39.9 | 39.4 | 38.5 | 35.6 |
| OfficeQA Pro 图文文档办公问答 | 63.3 | 69.9 | 63.2 | 63.9 | 60.9 | 41.4 |
| SpreadsheetBench 2 表格数据处理 | 34.8 | 34.7 | 32.4 | 31.6 | 29.1 | 28.1 |
| OSWorld-Verified 操作系统操控验证集 | 84.8 | 85.0 | 83.0 | 83.4 | 79.0 | — |
| OSWorld 2.0 全版本操作系统操控 | 58.3 | 66.1 | 62.6 | 55.7 | 49.5 | — |
| SaaS-Bench 软件平台自动化操作 | 60.1 | — | 61.4 | 56.1 | 43.8 | — |
| τ³-Banking 银行金融智能体 | 33.4 | 26.8 | 33.0 | 27.6 | 31.3 | 26.8 |
| Harvey Lab-AA 实验室科研智能体 | 94.6 | 93.6 | 87.2 | 91.1 | 86.3 | 91.0 |
| CorpFin v2 企业财务分析 | 71.6 | 71.8 | 64.4 | 66.7 | 68.4 | 66.1 |
| Finance Agent v2 通用金融智能体 | 54.4 | 56.3 | 53.8 | 53.9 | 51.8 | 49.7 |
| Legal Research Bench 法律检索与文书 | 44.2 | 49.5 | 48.1 | 43.8 | 40.4 | 31.3 |
| 视觉多模态能力 | ||||||
| WorldVQA ForceAnswer 开放世界视觉问答 | 51.0 | 56.7 | 41.8 | 39.1 | 38.5 | — |
| OmniDocBench 全类型图文文档解析 | 91.1 | 89.8 | 85.8 | 87.9 | 89.4 | — |
| PerceptionBench 基础视觉感知(自研基准) | 58.5 | 57.2 | 59.7 | 47.2 | 55.8 | — |
| Video-MME(带字幕视频理解) | 90.0 | — | 89.5 | 86.0 | 89.3 | — |
| MMVU 通用多模态视频理解 | 82.1 | — | 81.2 | 79.2 | 81.7 | — |
| BabyVision 视觉+Python代码推理 | 85.7 | 90.5 | 88.9 | 81.2 | 83.6 | — |
| MMMU-Pro 专业多模态综合问答 | 81.6 / 83.4 | 81.2 / 86.5 | 83.0 / 84.6 | 78.9 / 82.7 | 81.2 / 83.2 | — |
| CharXiv (RQ) 图表数据分析 | 84.8 / 91.3 | 88.9 / 93.5 | 84.6 / 89.1 | 80.5 / 89.9 | 84.1 / 89.0 | — |
| MathVision 数学图像解题 | 94.3 / 97.8 | 94.8 / 98.6 | 95.8 / 97.8 | 86.7 / 97.1 | 92.2 / 96.8 | — |
| ZeroBench (pass@5) 零样本视觉复杂任务 | 23.0 / 41.0 | 23.0 / 46.0 | 17.0 / 35.0 | 17.0 / 34.0 | 22.0 / 41.0 | — |
推理与知识类基准
- CritPt、AA-LCR:数据来源为 Artificial Analysis 平台2026年7月23日榜单。
代码类基准
- DeepSWE:Kimi K3使用自研Kimi Code评测框架;GLM-5.2分数取自官方发布博客;其余模型数据来自DeepSWE官方榜单,Kimi K3搭配mini-SWE-agent框架得分67.3,评测基于DeepSWE v1.1任务集。
- Terminal-Bench 2.1:Kimi K3使用自研Kimi Code评测框架;其他模型取各框架最优分:GLM-5.2搭配Claude Code;Claude Opus 4.8、Claude Fable 5搭配Terminus 2;GPT-5.5、GPT-5.6 Sol搭配Codex框架。
- ProgramBench:Kimi K3使用自研Kimi Code评测框架;GLM-5.2分数取自官方博客;其余模型数据来自Vals AI平台。
- SWE-Marathon:Kimi K3、Claude Opus 4.8、Claude Fable 5使用Claude Code框架;GPT-5.6 Sol使用Codex框架;GLM-5.2分数取自官方博客。评测基于2026年7月9日H20显卡校准分支(正式v1.1发布前版本),GPU任务镜像、校验标准已适配H20,正确性校验与反作弊逻辑不变。评测中Claude Fable 5有35%任务触发降级兜底,一定程度拉低最终得分。
- FrontierSWE:Kimi K3使用Kimi Code框架,GPT-5.6 Sol使用Codex框架;其余模型数据来自FrontierSWE官网,榜单优势分数由官方脚本基于原始分数重新计算,数据更新至2026年7月16日。
- PostTrainBench:GLM-5.2、GPT-5.5、Claude Opus 4.8采用官方榜单原始分数;Kimi K3、Claude Fable 5、GPT-5.6 Sol使用官方Harbor实现、最大推理强度,在H20 GPU上重复三次取均值(官方标准为H100);Kimi K3与Claude Fable 5搭配Claude Code框架,GPT-5.6 Sol搭配Codex框架。
- MLS-Bench-Lite:Kimi K3使用Kimi Code框架;GLM、Claude系列使用Claude Code框架;GPT系列使用Codex框架。
- SciCode:数据来源 Artificial Analysis 2026年7月23日榜单。
- Kimi Code Bench 2.0(月之暗面自研基准):Kimi K3使用Kimi Code框架(搭配Claude Code框架得分73.7);GLM-5.2、Claude Opus 4.8、Claude Fable 5使用Claude Code框架;GPT-5.5、GPT-5.6 Sol使用Codex框架。全部模型开启最大推理强度,GPT-5.5除外(使用超高强度xhigh)。基准包含网络安全与安全校验任务,各模型拒绝/兜底任务数量:Claude Fable 5共80题,13题兜底、1题拒绝;GPT-5.6 Sol安全拦截10题;GPT-5.5拒绝3题。
智能体工具类基准
- OfficeQA Pro:全部测试用例仅提供PDF图片渲染文件,无机器可读文本。
- OfficeQA Pro、SpreadsheetBench 2:Kimi K3、GLM-5.2、Claude Opus 4.8、Claude Fable 5使用Claude Code框架;GPT-5.5、GPT-5.6 Sol使用Codex框架。
- MCP-Atlas:评测采用公开500任务子集,单任务最大交互轮次100,使用Gemini 3.1 Pro作为结果裁判。
- AutomationBench:评测采用公开600任务子集,其余配置严格遵循官方GitHub标准。
- BrowseComp:开启30万Token上下文压缩策略;若直接使用完整100万上下文、无压缩策略,Kimi K3得分可达90.4。Claude Fable 5、Claude Opus 4.8、GPT-5.6 Sol、GPT-5.5分数取自Anthropic、OpenAI官方发布内容。
- GDPval-AA v2、AA-Briefcase、τ³-Banking、Harvey Lab-AA、APEX-Agents:数据来源 Artificial Analysis、APEX-Agents官方榜单,更新至2026年7月23日;Harvey Lab-AA报告任务通过率。
- CorpFin v2、Finance Agent v2、Legal Research Bench:数据来源Vals AI平台。
- Agents’ Last Exam:分数取自官方榜单(2026年7月23日),指标为任务通过率;各模型固定搭配评测框架:Kimi K3搭配Kimi Code;GPT-5.6 Sol/GPT-5.5搭配Codex;Claude Fable 5/Claude Opus 4.8/GLM-5.2搭配Claude Code。†标记:Claude Fable 5采用超高推理强度,40%任务结果降级。
多模态视觉基准
除ZeroBench重复五次取结果外,其余多模态评测均运行三次取平均分。MMMU-Pro严格遵循官方评测协议,原图前置输入文本。- PerceptionBench:月之暗面自研基准,聚焦基础原子级视觉感知能力。
4. 原生MXFP4量化方案
Kimi K3从监督微调(SFT)阶段即全程采用量化感知训练,权重使用MXFP4格式、激活值使用MXFP8格式,适配广泛硬件推理环境。
5. 部署指南
注意:你可前往 Kimi 开放平台 https://platform.kimi.ai 选择模型
kimi-k3调用API,同时提供兼容OpenAI、Anthropic格式的标准接口。当前推荐使用以下推理引擎部署Kimi K3:
- vLLM — 部署教程:https://recipes.vllm.ai/moonshotai/Kimi-K3
- SGLang — 使用手册:https://docs.sglang.io/cookbook/autoregressive/Moonshotai/Kimi-K3
- TokenSpeed — 部署脚本:https://lightseek.org/tokenspeed/recipes/models#kimi-k3
6. 模型调用使用说明
Kimi K3默认开启深度思考输出,接口会返回独立字段reasoning_content(思考过程)。
推理强度通过请求顶层参数reasoning_effort配置,可选值:low(低)、high(高)、max(最大,默认)。
Kimi K3训练时保留完整思考历史;多轮对话、工具调用场景下,必须将接口返回的完整助手消息原样传入messages数组,包括思考内容reasoning_content与工具调用tool_calls,不能仅传入最终回答content。
importopenaidefchat_with_preserved_thinking(client:openai.OpenAI,model_name:str):messages=[{"role":"user","content":"给我三个随机数字。"},{"role":"assistant","reasoning_content":"我先列出五个数字:473、921、235、215、222,然后告诉你前三个。","content":"473、921、235"},{"role":"user","content":"你心里剩下另外两个数字是什么?"}]response=client.chat.completions.create(model=model_name,messages=messages,stream=False,max_tokens=4096,reasoning_effort="max",)# 模型会读取上一轮思考内容,输出215和222print(f"模型思考过程:{response.choices[0].message.reasoning}")returnresponse.choices[0].message.content图文输入、结构化输出、增量模式、工具选择、动态工具加载、上下文缓存等完整教程与示例,详见官方文档:
Kimi K3 快速上手文档、推理强度配置指南
代码智能体配套框架
Kimi K3搭配 Kimi Code CLI 智能体框架效果最佳。欢迎在终端运行Kimi Code,输入/model命令切换至Kimi K3。期待你的使用反馈!
7. 开源许可证
代码仓库与模型权重均遵循 Kimi K3 专属许可证 开放。
8. 联系我们
如有任何问题,可发送邮件至 support@moonshot.ai 咨询。