moonshotai/Kimi-K3 · 上手攻略

  • 仓库:MoonshotAI/Kimi-K3
  • 链接:https://github.com/MoonshotAI/Kimi-K3
  • 分类:大模型 / 开源权重 / MoE / Agent
  • 作者:Jay
  • 更新:2026-07-29

是什么

Kimi K3 是 Moonshot AI(MiniMax)推出的开源权重多模态 Agent 大模型,总参数量 2.8T(激活 104B),是全球首个开放的 3T 级开源模型。K3 基于两项自研架构:Kimi Delta Attention(KDA)Attention Residuals(AttnRes),采用 MoE(Mixture-of-Experts)稀疏架构(896 个专家,每次激活 16 个),原生支持视觉理解,上下文窗口达 100 万 token。模型权重以 Kimi K3 License 开源发布,可在 Hugging Face 和 ModelScope 获取。

解决什么问题

当前开源大模型生态存在几个重要缺口:

  1. 参数量断档:2T 以上开源模型长期空白,OpenAI、Anthropic 的顶级模型只有闭源选项,学术界和中小企业无法自由研究和微调
  2. Agent 能力天花板:多数开源模型在真实 Agent 任务(长程编码、工具调用、多步推理)上与闭源差距明显
  3. 视觉理解与长上下文割裂:很多模型要么不支持视觉,要么视觉版和纯文本版分开,百万 token 上下文与视觉合一更为罕见

Kimi K3 的目标是成为第一个在所有这些维度上同时达到前沿水平(Frontier-level)的开源模型

快速安装

Kimi K3 权重托管在 Hugging Face 和 ModelScope,完整模型体积较大(原始 FP8 约 2.8TB),建议使用量化版本部署。

在线体验(无需部署)

  • Kimi 官网:https://kimi.com — 默认使用 K3(Launch 时以 max thinking effort 为默认)
  • Kimi Work / Kimi Code:产品化入口,适合直接使用

下载权重(Hugging Face)

# 安装 huggingface_hubo
pip install huggingface_hub

# 登录(需要先在 huggingface.co 获取有权限的 token)
huggingface-cli login

# 下载完整模型(需要 ~2.8TB 存储,建议用镜像或量化版)
huggingface-cli download moonshotai/Kimi-K3 --local-dir ./kimi-k3

⚠️ 注意:完整权重于 2026 年 7 月 27 日正式发布(release blog 提到),请确认下载页面显示的版本完整性。Hugging Face 下载页面地址:https://huggingface.co/moonshotai/Kimi-K3

ModelScope 下载

# ModelScope 镜像下载(适合国内用户)
pip install modelscope
modelscope download --repo_id moonshotai/Kimi-K3 --local_dir ./kimi-k3

本地推理(量化版,参考)

⚠️ 以下为基于官方架构描述的合理推断,具体推理框架支持请以官方 README 最新说明为准。

# 使用 vLLM(需确认 vLLM 版本是否已支持 KDA/AttnRes 架构)
# (注意:KDA/Gated MLA 为自定义 attention,vLLM 社区支持之前可能需要 fork 或等待 upstream)

# 使用 SGLang(推荐,支持 MoE)
# 参考 https://github.com/sgl-project/sglang

# 示例(待官方确认):
python -m sglang.launch_server \
  --model-path moonshotai/Kimi-K3 \
  --tokenizer-path moonshotai/Kimi-K3 \
  --host 0.0.0.0 \
  --port 30000 \
  --max-total-token 1048576

API 方式调用

# 通过 Moonshot AI API(需 API Key)
curl -X POST https://api.moonshot.ai/v1/chat/completions \
  -H "Authorization: Bearer $MOONSHOT_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "kimi-k3",
    "messages": [{"role": "user", "content": "解释一下 KDA 架构的原理"}],
    "max_tokens": 2048,
    "temperature": 0.7
  }'

核心用法

1. 长程编码(Long-Horizon Coding)

Kimi K3 在 Terminal-Bench 2.1(88.3)、SWE-Marathon(42.0)、FrontierSWE(81.2)等编码基准上达到开源顶尖水平。它能: - 在大型代码仓库中自主导航和多文件编辑 - 调用终端工具(shell、git、docker)完成完整工程任务 - 结合视觉理解做前端/游戏/CAD 相关的视觉 in-the-loop 调试 - 自助开发 GPU 编译器(官方展示:K3 48 小时内从零构建了 MiniTriton 编译器,性能持平 Triton)

2. 深度 Agent 任务

Kimi K3 在 MCP-Atlas(84.2)、BrowseComp(91.2)、Toolathlon-Verified(76.5)等 Agent 基准上表现出色:

# Agent 调用示例(伪代码,待官方 SDK 确认)
from moonshot import Moonshot

client = Moonshot(api_key="your-key")
response = client.chat.completions.create(
    model="kimi-k3",
    messages=[
        {"role": "user", "content": "帮我调研最近三年的 RAG 技术进展,做成 PPT 大纲"}
    ],
    # K3 支持 reasoning effort 控制
    # thinking_effort: "low" | "medium" | "max"
    thinking_effort="max"
)
print(response.choices[0].message.content)

3. 百万 token 上下文

支持 1,048,576 token 上下文窗口,可以一次性处理整本书籍、超长代码库或视频帧序列:

# 超长上下文示例
with open("large_codebase.txt", "r") as f:
    context = f.read()  # 可以是超长文本

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[
        {"role": "system", "content": "你是一个代码审查助手"},
        {"role": "user", "content": f"请审查以下代码:\n{context}"}
    ],
    max_tokens=4096
)

4. 多模态理解

原生视觉_encoder MoonViT-V2(401M 参数)支持图像输入,同一模型处理图文混合:

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[
        {
            "role": "user",
            "content": [
                {"type": "text", "text": "这张架构图有什么问题?"},
                {"type": "image_url", "image_url": {"url": "https://example.com/arch.png"}}
            ]
        }
    ]
)

典型适用场景

场景 为什么选 K3
需要私有化部署的前沿大模型 2.8T 开源权重,可完全私有,不依赖任何云服务
超长代码库理解/修改 百万 token 上下文 + 顶级编码能力,超越大多数开源模型
AI Agent 开发 MCP-Atlas、Toolathlon 等基准领先,适合需要强工具调用和多步推理的 Agent 系统
GPU 内核/编译器/芯片设计研究 K3 自己可以写 Triton 类编译器、做 GPU kernel 优化,官方展示用 48 小时从零构建了可用的 MiniTriton
本地知识库问答 百万 token 上下文可直接把整个知识库放进 prompt,无需 RAG 切分
需要视觉理解的长程任务 前端自动化、游戏开发 CAD 等视觉 in-the-loop 场景

坑与注意

  1. 推理硬件要求高:2.8T 参数,即使激活 104B,也需要多卡部署(建议 A100/H100 集群),单卡无法运行。量化版(MXFP4)可以降低到更少显存,但仍需要专业硬件。

  2. vLLM/SGLang 支持待确认:自定义 KDA/Gated MLA 架构可能尚未被主流推理框架完全支持,部署前请查阅 vLLM 和 SGLang 的最新 Release Note 或官方 README 中的部署说明。不确定处:具体推理框架支持情况请以官方 README 为准。

  3. API 配额与定价:通过 Moonshot API 调用 K3 的计费方式、速率限制和具体定价需查阅 platform.kimi.ai 最新文档(截至发稿,官方尚未公开 K3 的具体 API 定价页面链接)。

  4. Kimi K3 License:非标准开源 License(自定义 License),明确禁止的用途包括:开发危害人类安全的武器、军事用途、进行模型能力评测并与 Kimi K3 直接竞争等,部署前请仔细阅读 License全文。

  5. Thinking Effort 默认 max:Launch 时默认使用 max thinking effort,输出较慢且 token 消耗大;低/中模式正在开发中(非 100% 确定,请以官方为准)。

  6. 量化精度:官方采用 MXFP4 权重量化 + MXFP8 激活量化(有 QAT 训练),相比 FP16 会有一定精度损失,在极端任务上可能与全精度有差距。

  7. 视觉暂时不支持视频帧以外的视频理解:README 显示支持 Text 和 Image,Video-MME 基准(90.0)是通过 subtitle 辅助达成,视频原生理解能力有限。

与同类对比

维度 Kimi K3 Qwen3-72B GLM-5.2 Llama-4-Scout GPT-5.6 Sol
参数量 2.8T(激活 104B) 146B(MoE) ~300B ~1T 闭源
是否开源 ✅ 完整权重 ✅ 完整权重 ✅ 完整权重 ✅ 权重
上下文 1M 128K(部分版本 1M) 128K 128K 128K
视觉 原生 MoonViT-V2 Qwen2-VL GLM-4V 原生
Terminal-Bench 88.3 ~83 ~82 ~78 88.8
SWE-Marathon 42.0 ~35 ~13 ~20 39.0
GPQA Diamond 93.5 ~89 ~91 ~88 94.1
OSWorld 84.8 ~80 N/A ~75 83.0

一句话推荐结论:Kimi K3 是当前开源生态中参数量最大(2.8T)、编码能力最强、在多个前沿 Agent 基准上达到或接近顶级闭源模型水平的开源大模型,适合需要最强开源 Agent 能力且具备相应硬件条件的研究团队和企业。