moonshotai/Kimi-K3 · 上手攻略
- 仓库:MoonshotAI/Kimi-K3
- 链接:https://github.com/MoonshotAI/Kimi-K3
- 分类:大模型 / 开源权重 / MoE / Agent
- 作者:Jay
- 更新:2026-07-29
是什么
Kimi K3 是 Moonshot AI(MiniMax)推出的开源权重多模态 Agent 大模型,总参数量 2.8T(激活 104B),是全球首个开放的 3T 级开源模型。K3 基于两项自研架构:Kimi Delta Attention(KDA) 和 Attention Residuals(AttnRes),采用 MoE(Mixture-of-Experts)稀疏架构(896 个专家,每次激活 16 个),原生支持视觉理解,上下文窗口达 100 万 token。模型权重以 Kimi K3 License 开源发布,可在 Hugging Face 和 ModelScope 获取。
解决什么问题
当前开源大模型生态存在几个重要缺口:
- 参数量断档:2T 以上开源模型长期空白,OpenAI、Anthropic 的顶级模型只有闭源选项,学术界和中小企业无法自由研究和微调
- Agent 能力天花板:多数开源模型在真实 Agent 任务(长程编码、工具调用、多步推理)上与闭源差距明显
- 视觉理解与长上下文割裂:很多模型要么不支持视觉,要么视觉版和纯文本版分开,百万 token 上下文与视觉合一更为罕见
Kimi K3 的目标是成为第一个在所有这些维度上同时达到前沿水平(Frontier-level)的开源模型。
快速安装
Kimi K3 权重托管在 Hugging Face 和 ModelScope,完整模型体积较大(原始 FP8 约 2.8TB),建议使用量化版本部署。
在线体验(无需部署)
- Kimi 官网:https://kimi.com — 默认使用 K3(Launch 时以 max thinking effort 为默认)
- Kimi Work / Kimi Code:产品化入口,适合直接使用
下载权重(Hugging Face)
# 安装 huggingface_hubo
pip install huggingface_hub
# 登录(需要先在 huggingface.co 获取有权限的 token)
huggingface-cli login
# 下载完整模型(需要 ~2.8TB 存储,建议用镜像或量化版)
huggingface-cli download moonshotai/Kimi-K3 --local-dir ./kimi-k3
⚠️ 注意:完整权重于 2026 年 7 月 27 日正式发布(release blog 提到),请确认下载页面显示的版本完整性。Hugging Face 下载页面地址:
https://huggingface.co/moonshotai/Kimi-K3
ModelScope 下载
# ModelScope 镜像下载(适合国内用户)
pip install modelscope
modelscope download --repo_id moonshotai/Kimi-K3 --local_dir ./kimi-k3
本地推理(量化版,参考)
⚠️ 以下为基于官方架构描述的合理推断,具体推理框架支持请以官方 README 最新说明为准。
# 使用 vLLM(需确认 vLLM 版本是否已支持 KDA/AttnRes 架构)
# (注意:KDA/Gated MLA 为自定义 attention,vLLM 社区支持之前可能需要 fork 或等待 upstream)
# 使用 SGLang(推荐,支持 MoE)
# 参考 https://github.com/sgl-project/sglang
# 示例(待官方确认):
python -m sglang.launch_server \
--model-path moonshotai/Kimi-K3 \
--tokenizer-path moonshotai/Kimi-K3 \
--host 0.0.0.0 \
--port 30000 \
--max-total-token 1048576
API 方式调用
# 通过 Moonshot AI API(需 API Key)
curl -X POST https://api.moonshot.ai/v1/chat/completions \
-H "Authorization: Bearer $MOONSHOT_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "kimi-k3",
"messages": [{"role": "user", "content": "解释一下 KDA 架构的原理"}],
"max_tokens": 2048,
"temperature": 0.7
}'
核心用法
1. 长程编码(Long-Horizon Coding)
Kimi K3 在 Terminal-Bench 2.1(88.3)、SWE-Marathon(42.0)、FrontierSWE(81.2)等编码基准上达到开源顶尖水平。它能: - 在大型代码仓库中自主导航和多文件编辑 - 调用终端工具(shell、git、docker)完成完整工程任务 - 结合视觉理解做前端/游戏/CAD 相关的视觉 in-the-loop 调试 - 自助开发 GPU 编译器(官方展示:K3 48 小时内从零构建了 MiniTriton 编译器,性能持平 Triton)
2. 深度 Agent 任务
Kimi K3 在 MCP-Atlas(84.2)、BrowseComp(91.2)、Toolathlon-Verified(76.5)等 Agent 基准上表现出色:
# Agent 调用示例(伪代码,待官方 SDK 确认)
from moonshot import Moonshot
client = Moonshot(api_key="your-key")
response = client.chat.completions.create(
model="kimi-k3",
messages=[
{"role": "user", "content": "帮我调研最近三年的 RAG 技术进展,做成 PPT 大纲"}
],
# K3 支持 reasoning effort 控制
# thinking_effort: "low" | "medium" | "max"
thinking_effort="max"
)
print(response.choices[0].message.content)
3. 百万 token 上下文
支持 1,048,576 token 上下文窗口,可以一次性处理整本书籍、超长代码库或视频帧序列:
# 超长上下文示例
with open("large_codebase.txt", "r") as f:
context = f.read() # 可以是超长文本
response = client.chat.completions.create(
model="kimi-k3",
messages=[
{"role": "system", "content": "你是一个代码审查助手"},
{"role": "user", "content": f"请审查以下代码:\n{context}"}
],
max_tokens=4096
)
4. 多模态理解
原生视觉_encoder MoonViT-V2(401M 参数)支持图像输入,同一模型处理图文混合:
response = client.chat.completions.create(
model="kimi-k3",
messages=[
{
"role": "user",
"content": [
{"type": "text", "text": "这张架构图有什么问题?"},
{"type": "image_url", "image_url": {"url": "https://example.com/arch.png"}}
]
}
]
)
典型适用场景
| 场景 | 为什么选 K3 |
|---|---|
| 需要私有化部署的前沿大模型 | 2.8T 开源权重,可完全私有,不依赖任何云服务 |
| 超长代码库理解/修改 | 百万 token 上下文 + 顶级编码能力,超越大多数开源模型 |
| AI Agent 开发 | MCP-Atlas、Toolathlon 等基准领先,适合需要强工具调用和多步推理的 Agent 系统 |
| GPU 内核/编译器/芯片设计研究 | K3 自己可以写 Triton 类编译器、做 GPU kernel 优化,官方展示用 48 小时从零构建了可用的 MiniTriton |
| 本地知识库问答 | 百万 token 上下文可直接把整个知识库放进 prompt,无需 RAG 切分 |
| 需要视觉理解的长程任务 | 前端自动化、游戏开发 CAD 等视觉 in-the-loop 场景 |
坑与注意
-
推理硬件要求高:2.8T 参数,即使激活 104B,也需要多卡部署(建议 A100/H100 集群),单卡无法运行。量化版(MXFP4)可以降低到更少显存,但仍需要专业硬件。
-
vLLM/SGLang 支持待确认:自定义 KDA/Gated MLA 架构可能尚未被主流推理框架完全支持,部署前请查阅 vLLM 和 SGLang 的最新 Release Note 或官方 README 中的部署说明。不确定处:具体推理框架支持情况请以官方 README 为准。
-
API 配额与定价:通过 Moonshot API 调用 K3 的计费方式、速率限制和具体定价需查阅 platform.kimi.ai 最新文档(截至发稿,官方尚未公开 K3 的具体 API 定价页面链接)。
-
Kimi K3 License:非标准开源 License(自定义 License),明确禁止的用途包括:开发危害人类安全的武器、军事用途、进行模型能力评测并与 Kimi K3 直接竞争等,部署前请仔细阅读 License全文。
-
Thinking Effort 默认 max:Launch 时默认使用 max thinking effort,输出较慢且 token 消耗大;低/中模式正在开发中(非 100% 确定,请以官方为准)。
-
量化精度:官方采用 MXFP4 权重量化 + MXFP8 激活量化(有 QAT 训练),相比 FP16 会有一定精度损失,在极端任务上可能与全精度有差距。
-
视觉暂时不支持视频帧以外的视频理解:README 显示支持 Text 和 Image,Video-MME 基准(90.0)是通过 subtitle 辅助达成,视频原生理解能力有限。
与同类对比
| 维度 | Kimi K3 | Qwen3-72B | GLM-5.2 | Llama-4-Scout | GPT-5.6 Sol |
|---|---|---|---|---|---|
| 参数量 | 2.8T(激活 104B) | 146B(MoE) | ~300B | ~1T | 闭源 |
| 是否开源 | ✅ 完整权重 | ✅ 完整权重 | ✅ 完整权重 | ✅ 权重 | ❌ |
| 上下文 | 1M | 128K(部分版本 1M) | 128K | 128K | 128K |
| 视觉 | 原生 MoonViT-V2 | Qwen2-VL | GLM-4V | 否 | 原生 |
| Terminal-Bench | 88.3 | ~83 | ~82 | ~78 | 88.8 |
| SWE-Marathon | 42.0 | ~35 | ~13 | ~20 | 39.0 |
| GPQA Diamond | 93.5 | ~89 | ~91 | ~88 | 94.1 |
| OSWorld | 84.8 | ~80 | N/A | ~75 | 83.0 |
一句话推荐结论:Kimi K3 是当前开源生态中参数量最大(2.8T)、编码能力最强、在多个前沿 Agent 基准上达到或接近顶级闭源模型水平的开源大模型,适合需要最强开源 Agent 能力且具备相应硬件条件的研究团队和企业。