今天上午 Qwen3.8-27B 正式开源(Apache 2.0):270 亿参数稠密模型,原生支持图像/视频理解,262K 原生上下文可外推到 1M,编程和办公能力相比上一代明显提升。今早的开源公告讲了它改了什么,这篇直接讲怎么把它跑在自己电脑上。全精度 BF16 权重约 55GB,但本地跑没人用全精度——量化之后 16–24GB 显存就够。先把显存账算清楚,再给三条部署路线。
先算显存账
27B 稠密是个「甜点」尺寸:能力够用,量化后又能塞进消费级显卡。参考数字:
- BF16 全精度:约 54GB 显存 → 需要 80GB 级别(H100、RTX Pro 6000)
- FP8:约 27GB → 48GB 级别(L40S、RTX Pro 6000;5090 短上下文也可以)
- 4-bit GGUF:约 14–16GB → 24GB 级别(RTX 4090/3090);Unsloth 预告 Q4 整体约 17GB
这些数字之上还要叠加 KV cache。上下文长度是另一个调节杆:24GB 卡跑 94K 上下文没问题,16GB 卡建议缩短。社区实测:RTX 5060 Ti 16GB + UD-IQ3_XXS,开 MTP(多 token 预测)+ 量化 KV cache,94K 上下文下能到 50–55 tokens/s。16GB 卡真的够用。
路线一:Ollama(最快)
ollama run qwen3.8:27b一行搞定,Ollama 会根据显存自动选合适的量化档位。16GB 以下的显卡从这条开始。Apple Silicon 用户改用 qwen3.8:27b-mlx。看图功能和别的 Ollama 模型一样,把图片路径丢进 prompt 即可。
路线二:llama.cpp(完全可控)
下载 GGUF 并启动服务:
hf download unsloth/Qwen3.8-27B-GGUF --local-dir Qwen3.8-27B-GGUF --include "UD-Q4_K_XL"
llama-server -m Qwen3.8-27B-GGUF/Qwen3.8-27B-UD-Q4_K_XL.gguf \
--ctx-size 8192 --host 127.0.0.1 --port 8080llama-server 会暴露 OpenAI 兼容端点 http://127.0.0.1:8080/v1,任何支持 OpenAI API 的工具都能直接接。不想起服务、只想命令行验证:
llama-cli -m Qwen3.8-27B-GGUF/Qwen3.8-27B-UD-Q4_K_XL.gguf \
--ctx-size 8192 --temp 1.0 --top-p 0.95 --top-k 20路线三:LM Studio(图形界面)
lmstudio-community/Qwen3.8-27B-GGUF 仓库提供了开箱即用的量化版本。在 LM Studio 里搜索 Qwen3.8-27B,按显存选一个量化档,直接用内置聊天或本地 OpenAI 兼容服务。
官方推荐的采样参数
通用场景:
temperature=1.0, top_p=0.95, top_k=20, min_p=0.0
presence_penalty=0.0, repetition_penalty=1.0编程/结构化任务:
temperature=0.7, top_p=0.80, top_k=20, min_p=0.0
presence_penalty=1.5, repetition_penalty=1.0另外模型带 reasoning_effort 和 preserve_thinking 两个控制:要快就把 reasoning_effort 调低;做多步任务时保持 thinking 开着更稳。
量化档位怎么选
- 16GB:UD-IQ3_XXS 或 Q4_K_M,上下文别开太大
- 24GB(RTX 3090/4090):Q4_K_XL 或 Q5,94K 上下文无压力
- 32GB(RTX 5090):Q6,或走 SGLang/vLLM 的 NVFP4
- 纯 CPU:Q3/Q4 + 32GB 以上内存,能跑但慢,兜底方案
服务跑起来之后,想给它套一个 Agent 壳,可以参考我们之前的 DeepSeek Harness 上手指南——模型无关的 Harness,接本地 OpenAI 兼容端点即可。
