一、介绍
今天介绍个超厉害的遮罩提取的王炸,我们以前也分享过一次关于遮罩这块的介绍,里面有提到手动根据提示词来获取遮罩对吧,但是之前这种有个问题,就是无法非常精准的识别,你只能给物体名词。
那今天这个方案就是让你的提示词更加智能,接入了大模型Qwen2.5-VL,它可以对输入图像运行检测提示,这样我们就可以用自然语言很轻松的告诉它你要识别的物体,比如:左侧第二个女人、腰间有枪的男人、所有文字等等,再配合 SAM2,算是目前遮罩提取的王炸组合。
以上就是 TTPlanetPig 大佬开发的这个智能遮罩抠图的插件 Comfyui_Object_Detect_QWen_VL,非常强,绝对是精品插件,收藏+1。
但是这个我安装的时候折腾了一天,今天才搞定,这不马上就给大家分享我踩过的坑。
二、相关安装
安装这个插件真的是一波三折,这里就给大家分享下遇到的问题以及解决方案
插件地址:https://github.com/TTPlanetPig/Comfyui_Object_Detect_QWen_VL
节点管理器里面无法安装搜到,用命令安装
git clone https://github.com/TTPlanetPig/Comfyui_Object_Detect_QWen_VL.git
模型在运行的时候会自动下载,不过很慢,我建议你提前下载好。
模型地址:https://huggingface.co/collections/Qwen/qwen25-vl-6795ffac22b334a837c0f9a5
官方是推荐用这个BF16版本的,太低的话可能会影响质量

网盘已经提供了这个模型下载,下载后放到路径 models/Qwen下面即可。

将选定的 Qwen 2.5-VL 模型下载到 models/Qwen 中,并返回加载的模型和处理器。您可以选择将模型加载到哪个设备上(例如,如果您有多个 GPU,则为 cuda:1)、检查点的精度(INT4、INT8、BF16、FP16 或 FP32)以及是使用 FlashAttention 还是 SDPA。选择 FP32 精度时,FlashAttention 会自动替换为 SDPA,因为 FlashAttention 不支持它。
<

1159

被折叠的 条评论
为什么被折叠?



