7月27日,月之暗面如约将 Kimi K3 的完整模型权重扔上了 Hugging Face。2.8 万亿参数、MoE 架构、896 个专家、原生百万 token 上下文——这是目前全球最大的开放权重模型,没有之一。
更值得开发者关注的是三个数字:MXFP4 原生量化、1.4TB 最小显存占用、vLLM/SGLang Day-0 支持。K3 不是那种「看看就好」的论文模型,它是一套可以直接上生产的推理系统。
这篇指南不聊评测分数,直接拆解怎么跑起来。
一、K3 架构快览:为什么部署逻辑不一样
K3 的部署参数和一般模型不同,三个关键点决定了你的集群配置:
1. 总参数 vs 激活参数
总参数 2.8T,但每 token 只激活 16/896 个专家,激活参数约 104B。问题是——显存里必须装下全部 896 个专家的权重,因为你不知道路由会把谁激活。
2. MXFP4 原生精度
K3 从 SFT 阶段开始就做了量化感知训练(QAT),MXFP4 不是后量化产物,而是原厂出厂设置。这意味着你不需要额外跑量化校准步骤。
| 精度 | Bytes/参数 | 权重显存 |
|---|---|---|
| BF16/FP16 | 2 | ~5.6 TB |
| MXFP8 | 1 | ~2.8 TB |
| MXFP4(推荐) | 0.5 | ~1.4 TB |
3. 注意力机制:KDA + AttnRes
KDA(Kimi Delta Attention)是混合线性注意力,配合 Attention Residuals 跨层残差检索,让百万 token 上下文的计算成本不再随序列长度二次增长。vLLM 和 SGLang 已在 7月27日前完成了适配。
二、集群配置方案
以下基于 MXFP4(推荐精度)给出三档集群配置:
方案 A:B300 × 8(最小可行配置)
# 单节点 8×B300(每卡 192GB VRAM)
# 理论可用显存:8 × 192 = 1536 GB > 1400 GB ✅
# 实际考虑 KV Cache + 激活内存,建议添加少许余量
# vLLM 启动示例
python -m vllm.entrypoints.openai.api_server \
--model moonshotai/Kimi-K3 \
--tensor-parallel-size 8 \
--expert-parallel-size 8 \
--max-model-len 131072 \
--dtype auto \
--gpu-memory-utilization 0.95 \
--trust-remote-code方案 B:B200 × 16(生产推荐)
# 双节点,每节点 8×B200(每卡 144GB VRAM)
# 理论显存:16 × 144 = 2304 GB ✅ 余量充裕
# 支持更大 batch size 和上下文窗口
# SGLang 启动示例
python -m sglang.launch_server \
--model-path moonshotai/Kimi-K3 \
--tp 16 \
--ep 16 \
--context-length 524288 \
--quantization mxfp4 \
--trust-remote-code \
--host 0.0.0.0 \
--port 8000方案 C:GB200 NVL72 × 1(满血版)
# 单机柜 72 卡,每卡 BF16 等效算力 ~2.5× H100
# 可直接上 BF16 精度,无需量化降级
# 支持 1M 上下文 + 大 batch 生产流量
# 启用 expert-parallel + 流水线并行 + tensor-parallel 三层并行
python -m vllm.entrypoints.openai.api_server \
--model moonshotai/Kimi-K3 \
--tensor-parallel-size 8 \
--pipeline-parallel-size 3 \
--expert-parallel-size 72 \
--max-model-len 1048576 \
--dtype bfloat16 \
--enable-chunked-prefill \
--gpu-memory-utilization 0.9三、开源的三大 Infra 组件
K3 这次还附带了三个训练/推理基础设施的开源:
MoonEP
面向超大规模细粒度 MoE 的高性能通信库。专家并行场景下,不均衡负载时仍保持极致通信效率。可以直接复用在自己的 MoE 模型部署中。
git clone https://github.com/MoonshotAI/MoonEP
# 集成进 vLLM 的自定义 expert-parallel 后端FlashKDA
KDA 的高性能 CUDA 算子,在 H20 上 prefill 速度比 flash-linear-attention 基线快 1.72–2.22 倍。可直接作为替换后端集成。
AgentEnv
与 KVCache.ai 合作的沙箱系统,为大规模 Agent 训练提供高保真隔离环境。支持快照、恢复、分叉,适合并行 Agent 工作流。
# AgentEnv 沙箱启动示例
# 提供隔离的 Python 运行环境,支持快速快照
pip install agent-env
agent-env run --snapshot --max-concurrency 128四、API 调用示例
部署完成后,Kimi K3 暴露标准 OpenAI 兼容 API:
# 文本推理
curl http://localhost:8000/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "Kimi-K3",
"messages": [{"role": "user", "content": "写一个 Python 函数,实现快速排序"}],
"max_tokens": 1024,
"temperature": 0.7
}'
# 多模态(图片理解)
curl http://localhost:8000/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "Kimi-K3",
"messages": [
{"role": "user", "content": [
{"type": "text", "text": "这张图中有什么?"},
{"type": "image_url", "image_url": {"url": "https://example.com/photo.jpg"}}
]}
],
"max_tokens": 512
}'五、实践建议
- 别用 BF16 跑:5.6TB 的显存需求意味着至少 30 张 H100,性价比极低。MXFP4 是官方推荐,训练时就做好了 QAT,精度损失极小
- H20 用户注意:华为昇腾 CANN 已在 7月27日完成 MXFP4 的 Day-0 原生支持,参考昇腾 950PR/DT 系列部署文档
- 上下文长度按需裁剪:不需要 1M 上下文的话,把
max-model-len降到 131072,KV Cache 显存占用直接减到 1/8 - MoonEP + FlashKDA 值得单独关注:这两个库不绑定 K3,可以移植到任意 MoE 模型的部署管线中
