VLM相关论文推荐

一、视觉编码器基础(2020-2023 经典)

论文年份/出处核心贡献端侧关联
ViT: An Image is Worth 16x16 WordsDosovitskiy et al., ICLR 2021图像切 patch 送 Transformer 的开山作所有 VLM 视觉基座鼻祖
DeiT: Data-efficient Image TransformersTouvron et al., ICML 2021Distillation 训小模型,端侧友好轻量 ViT 训练范式
MAE: Masked Autoencoders Are ScalableHe et al., CVPR 2022自监督重建训 ViT,数据效率极高InternViT 训练基础
DINOv2: Learning Robust Visual FeaturesOquab et al., 20231.42 亿图像自监督训通用视觉特征端侧特征提取备选,22M-1.1B 多尺寸

二、对比学习/语义编码器

论文年份/出处核心贡献端侧关联
CLIP: Learning Transferable Visual ModelsRadford et al., OpenAI 2021图文对比学习开山,zero-shot 能力强早期 VLM 基座,现被 SigLIP 替代
SigLIP: Sigmoid Loss for Language Image Pre-TrainingZhai et al., Google 2023用 sigmoid 替代 softmax,训练更快更准端侧 VLM 主流基座
SigLIP 2: Multilingual Vision-Language EncodersTschannen et al., Google 2025.02多语言 + captioning 预训练 + 自监督损失 + 在线数据筛选,支持多分辨率保持宽高比Qwen3-VL 采用 SigLIP-2 作为视觉编码器,ViT-B(86M)/L(303M)/So400m(400M)/g(1B) 四尺寸
OpenCLIP: Reproducible scaling lawsGadre et al., 2023CLIP 开源复现 + 大规模数据配方社区 SigLIP/CLIP 主要来源
EVA-CLIP: Improved Training TechniquesSun et al., 2023MAE 初始化 + 知识蒸馏训 CLIPLLaVA-NeXT 4V 基座选择之一

三、聚合视觉编码器(2025 新方向)

论文年份/出处核心贡献端侧关联
RADIOv2.5: Agglomerative Vision Foundation ModelsNVIDIA, 2025融合 DFN_CLIP + DINOv2 + SAM + SigLIP + ToMe,一个 encoder 多任务“One Encoder to Rule Them All”,VLM benchmark 超越 SigLIP
DINOv2 Meets TextCVPR 2025DINOv2 + 文本对齐,统一图像和像素级理解自监督编码器 + 文本对齐新范式

四、多模态连接器架构

论文年份/出处核心贡献端侧关联
Flamingo: A Visual Language ModelAlayrac et al., DeepMind 2022Perceiver Resampler + Gated Cross-Attention视觉 token 固定数压缩,内存友好
BLIP-2: Bootstrapping Language-Image Pre-trainingLi et al., Salesforce 2023Q-Former:32 个 learnable query 压缩视觉极致 token 压缩但训练复杂
LLaVA: Large Language and Vision AssistantLiu et al., 2023简单 2-layer MLP 连接 ViT 和 LLM⭐ 端侧 VLM 连接器首选方案
LLaVA-1.5: Improved BaselinesLiu et al., 2023MLP 比 Q-Former 好,数据配方更重要训练范式参考
InstructBLIPDai et al., 2023指令感知的视觉特征提取多任务场景借鉴

五、视觉 token 压缩 / 高分辨率(端侧核心)

论文年份/出处核心贡献端侧关联
NaViT: Patch n’ PackDehghani et al., Google 2023任意分辨率/比例直接输入 ViTQwen2-VL 核心,端侧动态分辨率方案
LLaVA-UHD / AnyResLi et al., 2024切图成网格 + 全局压缩视图高分辨率理解,patch 数可控
MiniCPM-V 2.6: C-AbstractorYao et al., 2024网格化压缩 576 → 64 token⭐ 端侧 KV cache 节省关键技术
Cambrian-1: Vision-Centric LLMTong et al., MIT 2024系统对比多个视觉编码器 + Spatial Vision Aggregator⭐ 视觉编码器选型必读
Vision Token Reduction via Attention-Driven Self-Compression2026注意力驱动的自压缩视觉 token最新 token 压缩方法
Prune Redundancy, Preserve Essence: Vision Token CompressionICLR 2026重要性-多样性协同压缩2026 年 token 压缩新方向

六、综合 VLM 大模型

论文年份/出处核心贡献端侧关联
Qwen-VLBai et al., 2023中文 VLM + 多模态对话 + groundingQwen 系列 VLM 开山
Qwen2-VLWang et al., 2024NaViT 动态分辨率 + M-RoPE 位置编码Qwen3.5 的视觉基座来源
Qwen3-VL Technical ReportQwen Team, 2025.11三模块架构(vision encoder + MLP-based merger + LLM),采用 SigLIP-2,支持 256K tokens 上下文,增强 interleaved-MRoPE多模态,端侧版值得关注
InternVLChen et al., 2024自研 InternViT-6B + InternLMInternVL3 的基座
InternVL 1.5Chen et al., 2024高分辨率切图 + 数据配方0.5B-26B 全系列端侧可选
InternVL 2.5Chen et al., 2024RL 训练 + 长上下文最新一代
CogVLMWang et al., 2023视觉专家模块(独立 attention)另一种连接思路
Phi-3-VisionAbdin et al., Microsoft 20243.8B 小 VLM + CLIP ViTMoondream2 的 LLM 底座
MolmoDeitke et al., AI2 2024完全开源(数据+代码+模型)的强 VLM工程复现最佳参考

七、端侧/轻量 VLM⭐ 重点

论文年份/出处核心贡献端侧关联
MobileVLM: A Fast, Strong and Open VLMChu et al., MTK 20231.7B-3B,端侧部署实战手机 NPU 部署参考
MobileVLM v2: Better and FasterChu et al., MTK 2024多阶段训练 + token 压缩端侧 VLM 性能优化
TinyLLaVAZhang et al., 20241B 以下 VLM 训练框架轻量训练参考
PaliGemma 3MSteiner et al., Google 20243B 模型 + SigLIP,端侧友好Google 端侧方案
JanusWu et al., DeepSeek 2024统一理解和生成的自回归 VLM图像生成场景参考
SmolVLM: Redefining Small and Efficient Multimodal ModelsHuggingFace, 2025.04重新定义小型高效多模态模型,探索最优容量分配⭐⭐⭐⭐⭐ 端侧 VLM 工程参考首选
NanoVLMs: How Small Can We Go?HuggingFace, 2025.02探索 VLM 能多小,纯 PyTorch 轻量实现⭐⭐⭐⭐⭐ 极致轻量端侧方案
Small Vision-Language Models: A Survey on Compact Architectures2025.03小型 VLM 综述,Transformer-based / Mamba-based 架构分类端侧 VLM 选型参考
Vision-Language Models for Edge Networks: A Comprehensive Survey2025.02边缘 VLM 综述,模型压缩(剪枝/量化/蒸馏)端侧部署必读综述

八、训练数据与对齐

论文年份/出处核心贡献端侧关联
ShareGPT4VChen et al., 2023GPT-4V 生成的 100K 高质量图文对指令微调核心数据
ALLaVA: Harnessing Diverse Data for VLMsLi et al., 2024700K 多样 caption + VQA 数据提升泛化能力
LLaVA-Instruct-150K/665KLiu et al., 2023经典对话指令数据集SFT 起步数据

九、2025-2026 年关键趋势总结

趋势 1:SigLIP 2 成为新标准

  • Google 2025 年 2 月发布,Qwen3-VL 已采用
  • 多语言支持、多分辨率、保持宽高比
  • 端侧 VLM 视觉基座首选从 SigLIP 升级到 SigLIP 2

趋势 2:聚合视觉编码器兴起

  • RADIOv2.5 融合多个编码器(DFN_CLIP + DINOv2 + SAM + SigLIP)
  • "One Encoder to Rule Them All"理念
  • 端侧场景可能受益于统一特征提取

趋势 3:端侧 VLM 探索更小尺寸

  • NanoVLMs 探索 VLM 能多小
  • SmolVLM 2025 版重新定义小型高效模型
  • 目标:256M-500M 参数的 VLM 在端侧可用

趋势 4:视觉 token 压缩成为研究热点

  • 2026 年 ICLR/NeurIPS 多篇相关论文
  • 注意力驱动自压缩、重要性-多样性协同
  • 端侧 KV cache 节省的关键

趋势 5:从"粘合时代"到"原生多模态"

  • 2023-2024:ViT + Adapter + LLM 粘合
  • 2025-2026:Qwen3-VL / InternVL3.5 原生多模态架构
  • 端侧部署需要关注原生多模态的端侧版本

十、⭐ 强烈推荐精读 Top 8

如果时间有限,这 8 篇优先级最高:

  1. SigLIP 2 (2025.02) —— 最新视觉编码器标准,Qwen3-VL 采用
  2. RADIOv2.5 (2025) —— 聚合视觉编码器新方向
  3. SmolVLM 2025 (2025.04) —— 端侧 VLM 工程参考首选
  4. NanoVLMs (2025.02) —— 极致轻量端侧方案
  5. Cambrian-1 (2024) —— 视觉编码器选型必读
  6. LLaVA-1.5 (2023) —— 最简单有效的 VLM 架构范式
  7. MiniCPM-V 2.6 (2024) —— C-Abstractor token 压缩
  8. Qwen3-VL Technical Report (2025.11) —— 最新多模态架构参考

十一、端侧 VLM 选型建议(2026 年 8 月更新)

视觉基座首选

  • SigLIP 2-SO400M(400M)—— 端侧主力,Qwen3-VL 验证
  • SigLIP 2-B(86M)—— 极致轻量场景
  • RADIOv2.5 —— 如果需要多任务统一特征(但端侧部署复杂度更高)

语言基座首选

  • Qwen3-1.7B / 0.6B —— 中文端侧首选,支持 thinking
  • Qwen2.5-1.5B / 0.5B —— 稳定可靠,社区支持好
  • SmolLM2-1.7B —— HuggingFace 生态

连接器

  • 2-layer MLP —— 简单有效,端侧部署友好
  • C-Abstractor —— 需要 token 压缩时(MiniCPM-V 方案)

部署框架

  • MLC LLM —— 端侧效果最好
  • llama.cpp —— 跨平台,GGUF 量化
  • ExecuTorch —— PyTorch 原生,Android/iOS

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

JoannaJuanCV

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值