说实话,Qwen3.6-27B 发布那天我就坐不住了。27B 稠密模型,编程能力干翻上一代 397B 的 MoE 旗舰,关键是稠密架构部署起来比 MoE 省心太多——不用折腾路由,显存利用更实在。我手头刚好有两块 48GB 的 4090,心想这不得赶紧拉下来跑一把?

折腾了大半天,踩了几个坑,记录一下,免得下次又忘。
硬件环境先交代一下
GPU:4090(48GB)× 2,内存:512GB。用 Docker 跑多个模型实例,主要为了复用显存。

第一步:把模型拉下来
用 modelscope 下载 FP8 量化版,省显存且精度损失可以忽略:
modelscope download --model Qwen/Qwen3.6-27B-FP8
下载完大概几十个 G,耐心等着就行。

第二步:用 vLLM 起服务,然后立刻翻车
镜像选的 vllm/vllm-openai:nightly,想着 nightly 版对新模型支持应该最好。启动命令长这样:
docker run -d --name qwen3.6-27b-fp8-vllm \
--gpus '"device=0"' \
-v /home/ls/.cache/modelscope/hub/models/Qwen/Qwen3.6-27B-FP8:/app/models \
--ipc=host \
-p 8009:8000 \
vllm/vllm-openai:nightly \
--model /app/models


341

被折叠的 条评论
为什么被折叠?



