Qwen3.6-27B 本地部署踩坑实录:两块 4090 折腾一天的真实记录

说实话,Qwen3.6-27B 发布那天我就坐不住了。27B 稠密模型,编程能力干翻上一代 397B 的 MoE 旗舰,关键是稠密架构部署起来比 MoE 省心太多——不用折腾路由,显存利用更实在。我手头刚好有两块 48GB 的 4090,心想这不得赶紧拉下来跑一把?
在这里插入图片描述

折腾了大半天,踩了几个坑,记录一下,免得下次又忘。

硬件环境先交代一下

GPU:4090(48GB)× 2,内存:512GB。用 Docker 跑多个模型实例,主要为了复用显存。
在这里插入图片描述

第一步:把模型拉下来

用 modelscope 下载 FP8 量化版,省显存且精度损失可以忽略:

modelscope download --model Qwen/Qwen3.6-27B-FP8

下载完大概几十个 G,耐心等着就行。
在这里插入图片描述

第二步:用 vLLM 起服务,然后立刻翻车

镜像选的 vllm/vllm-openai:nightly,想着 nightly 版对新模型支持应该最好。启动命令长这样:

docker run -d --name qwen3.6-27b-fp8-vllm \
  --gpus '"device=0"' \
  -v /home/ls/.cache/modelscope/hub/models/Qwen/Qwen3.6-27B-FP8:/app/models \
  --ipc=host \
  -p 8009:8000 \
  vllm/vllm-openai:nightly \
  --model /app/models 
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值