一、视觉编码器基础(2020-2023 经典)
| 论文 | 年份/出处 | 核心贡献 | 端侧关联 |
|---|---|---|---|
| ViT: An Image is Worth 16x16 Words | Dosovitskiy et al., ICLR 2021 | 图像切 patch 送 Transformer 的开山作 | 所有 VLM 视觉基座鼻祖 |
| DeiT: Data-efficient Image Transformers | Touvron et al., ICML 2021 | Distillation 训小模型,端侧友好 | 轻量 ViT 训练范式 |
| MAE: Masked Autoencoders Are Scalable | He et al., CVPR 2022 | 自监督重建训 ViT,数据效率极高 | InternViT 训练基础 |
| DINOv2: Learning Robust Visual Features | Oquab et al., 2023 | 1.42 亿图像自监督训通用视觉特征 | 端侧特征提取备选,22M-1.1B 多尺寸 |
二、对比学习/语义编码器
| 论文 | 年份/出处 | 核心贡献 | 端侧关联 |
|---|---|---|---|
| CLIP: Learning Transferable Visual Models | Radford et al., OpenAI 2021 | 图文对比学习开山,zero-shot 能力强 | 早期 VLM 基座,现被 SigLIP 替代 |
| SigLIP: Sigmoid Loss for Language Image Pre-Training | Zhai et al., Google 2023 | 用 sigmoid 替代 softmax,训练更快更准 | 端侧 VLM 主流基座 |
| SigLIP 2: Multilingual Vision-Language Encoders ⭐ | Tschannen et al., Google 2025.02 | 多语言 + captioning 预训练 + 自监督损失 + 在线数据筛选,支持多分辨率保持宽高比 | Qwen3-VL 采用 SigLIP-2 作为视觉编码器,ViT-B(86M)/L(303M)/So400m(400M)/g(1B) 四尺寸 |
| OpenCLIP: Reproducible scaling laws | Gadre et al., 2023 | CLIP 开源复现 + 大规模数据配方 | 社区 SigLIP/CLIP 主要来源 |
| EVA-CLIP: Improved Training Techniques | Sun et al., 2023 | MAE 初始化 + 知识蒸馏训 CLIP | LLaVA-NeXT 4V 基座选择之一 |
三、聚合视觉编码器(2025 新方向)
| 论文 | 年份/出处 | 核心贡献 | 端侧关联 |
|---|---|---|---|
| RADIOv2.5: Agglomerative Vision Foundation Models ⭐ | NVIDIA, 2025 | 融合 DFN_CLIP + DINOv2 + SAM + SigLIP + ToMe,一个 encoder 多任务 | “One Encoder to Rule Them All”,VLM benchmark 超越 SigLIP |
| DINOv2 Meets Text | CVPR 2025 | DINOv2 + 文本对齐,统一图像和像素级理解 | 自监督编码器 + 文本对齐新范式 |
四、多模态连接器架构
| 论文 | 年份/出处 | 核心贡献 | 端侧关联 |
|---|---|---|---|
| Flamingo: A Visual Language Model | Alayrac et al., DeepMind 2022 | Perceiver Resampler + Gated Cross-Attention | 视觉 token 固定数压缩,内存友好 |
| BLIP-2: Bootstrapping Language-Image Pre-training | Li et al., Salesforce 2023 | Q-Former:32 个 learnable query 压缩视觉 | 极致 token 压缩但训练复杂 |
| LLaVA: Large Language and Vision Assistant | Liu et al., 2023 | 简单 2-layer MLP 连接 ViT 和 LLM | ⭐ 端侧 VLM 连接器首选方案 |
| LLaVA-1.5: Improved Baselines | Liu et al., 2023 | MLP 比 Q-Former 好,数据配方更重要 | 训练范式参考 |
| InstructBLIP | Dai et al., 2023 | 指令感知的视觉特征提取 | 多任务场景借鉴 |
五、视觉 token 压缩 / 高分辨率(端侧核心)
| 论文 | 年份/出处 | 核心贡献 | 端侧关联 |
|---|---|---|---|
| NaViT: Patch n’ Pack | Dehghani et al., Google 2023 | 任意分辨率/比例直接输入 ViT | Qwen2-VL 核心,端侧动态分辨率方案 |
| LLaVA-UHD / AnyRes | Li et al., 2024 | 切图成网格 + 全局压缩视图 | 高分辨率理解,patch 数可控 |
| MiniCPM-V 2.6: C-Abstractor | Yao et al., 2024 | 网格化压缩 576 → 64 token | ⭐ 端侧 KV cache 节省关键技术 |
| Cambrian-1: Vision-Centric LLM | Tong et al., MIT 2024 | 系统对比多个视觉编码器 + Spatial Vision Aggregator | ⭐ 视觉编码器选型必读 |
| Vision Token Reduction via Attention-Driven Self-Compression | 2026 | 注意力驱动的自压缩视觉 token | 最新 token 压缩方法 |
| Prune Redundancy, Preserve Essence: Vision Token Compression | ICLR 2026 | 重要性-多样性协同压缩 | 2026 年 token 压缩新方向 |
六、综合 VLM 大模型
| 论文 | 年份/出处 | 核心贡献 | 端侧关联 |
|---|---|---|---|
| Qwen-VL | Bai et al., 2023 | 中文 VLM + 多模态对话 + grounding | Qwen 系列 VLM 开山 |
| Qwen2-VL | Wang et al., 2024 | NaViT 动态分辨率 + M-RoPE 位置编码 | Qwen3.5 的视觉基座来源 |
| Qwen3-VL Technical Report ⭐ | Qwen Team, 2025.11 | 三模块架构(vision encoder + MLP-based merger + LLM),采用 SigLIP-2,支持 256K tokens 上下文,增强 interleaved-MRoPE | 多模态,端侧版值得关注 |
| InternVL | Chen et al., 2024 | 自研 InternViT-6B + InternLM | InternVL3 的基座 |
| InternVL 1.5 | Chen et al., 2024 | 高分辨率切图 + 数据配方 | 0.5B-26B 全系列端侧可选 |
| InternVL 2.5 | Chen et al., 2024 | RL 训练 + 长上下文 | 最新一代 |
| CogVLM | Wang et al., 2023 | 视觉专家模块(独立 attention) | 另一种连接思路 |
| Phi-3-Vision | Abdin et al., Microsoft 2024 | 3.8B 小 VLM + CLIP ViT | Moondream2 的 LLM 底座 |
| Molmo | Deitke et al., AI2 2024 | 完全开源(数据+代码+模型)的强 VLM | 工程复现最佳参考 |
七、端侧/轻量 VLM⭐ 重点
| 论文 | 年份/出处 | 核心贡献 | 端侧关联 |
|---|---|---|---|
| MobileVLM: A Fast, Strong and Open VLM | Chu et al., MTK 2023 | 1.7B-3B,端侧部署实战 | 手机 NPU 部署参考 |
| MobileVLM v2: Better and Faster | Chu et al., MTK 2024 | 多阶段训练 + token 压缩 | 端侧 VLM 性能优化 |
| TinyLLaVA | Zhang et al., 2024 | 1B 以下 VLM 训练框架 | 轻量训练参考 |
| PaliGemma 3M | Steiner et al., Google 2024 | 3B 模型 + SigLIP,端侧友好 | Google 端侧方案 |
| Janus | Wu et al., DeepSeek 2024 | 统一理解和生成的自回归 VLM | 图像生成场景参考 |
| SmolVLM: Redefining Small and Efficient Multimodal Models ⭐ | HuggingFace, 2025.04 | 重新定义小型高效多模态模型,探索最优容量分配 | ⭐⭐⭐⭐⭐ 端侧 VLM 工程参考首选 |
| NanoVLMs: How Small Can We Go? ⭐ | HuggingFace, 2025.02 | 探索 VLM 能多小,纯 PyTorch 轻量实现 | ⭐⭐⭐⭐⭐ 极致轻量端侧方案 |
| Small Vision-Language Models: A Survey on Compact Architectures | 2025.03 | 小型 VLM 综述,Transformer-based / Mamba-based 架构分类 | 端侧 VLM 选型参考 |
| Vision-Language Models for Edge Networks: A Comprehensive Survey | 2025.02 | 边缘 VLM 综述,模型压缩(剪枝/量化/蒸馏) | 端侧部署必读综述 |
八、训练数据与对齐
| 论文 | 年份/出处 | 核心贡献 | 端侧关联 |
|---|---|---|---|
| ShareGPT4V | Chen et al., 2023 | GPT-4V 生成的 100K 高质量图文对 | 指令微调核心数据 |
| ALLaVA: Harnessing Diverse Data for VLMs | Li et al., 2024 | 700K 多样 caption + VQA 数据 | 提升泛化能力 |
| LLaVA-Instruct-150K/665K | Liu et al., 2023 | 经典对话指令数据集 | SFT 起步数据 |
九、2025-2026 年关键趋势总结
趋势 1:SigLIP 2 成为新标准
- Google 2025 年 2 月发布,Qwen3-VL 已采用
- 多语言支持、多分辨率、保持宽高比
- 端侧 VLM 视觉基座首选从 SigLIP 升级到 SigLIP 2
趋势 2:聚合视觉编码器兴起
- RADIOv2.5 融合多个编码器(DFN_CLIP + DINOv2 + SAM + SigLIP)
- "One Encoder to Rule Them All"理念
- 端侧场景可能受益于统一特征提取
趋势 3:端侧 VLM 探索更小尺寸
- NanoVLMs 探索 VLM 能多小
- SmolVLM 2025 版重新定义小型高效模型
- 目标:256M-500M 参数的 VLM 在端侧可用
趋势 4:视觉 token 压缩成为研究热点
- 2026 年 ICLR/NeurIPS 多篇相关论文
- 注意力驱动自压缩、重要性-多样性协同
- 端侧 KV cache 节省的关键
趋势 5:从"粘合时代"到"原生多模态"
- 2023-2024:ViT + Adapter + LLM 粘合
- 2025-2026:Qwen3-VL / InternVL3.5 原生多模态架构
- 端侧部署需要关注原生多模态的端侧版本
十、⭐ 强烈推荐精读 Top 8
如果时间有限,这 8 篇优先级最高:
- SigLIP 2 (2025.02) —— 最新视觉编码器标准,Qwen3-VL 采用
- RADIOv2.5 (2025) —— 聚合视觉编码器新方向
- SmolVLM 2025 (2025.04) —— 端侧 VLM 工程参考首选
- NanoVLMs (2025.02) —— 极致轻量端侧方案
- Cambrian-1 (2024) —— 视觉编码器选型必读
- LLaVA-1.5 (2023) —— 最简单有效的 VLM 架构范式
- MiniCPM-V 2.6 (2024) —— C-Abstractor token 压缩
- Qwen3-VL Technical Report (2025.11) —— 最新多模态架构参考
十一、端侧 VLM 选型建议(2026 年 8 月更新)
视觉基座首选
- SigLIP 2-SO400M(400M)—— 端侧主力,Qwen3-VL 验证
- SigLIP 2-B(86M)—— 极致轻量场景
- RADIOv2.5 —— 如果需要多任务统一特征(但端侧部署复杂度更高)
语言基座首选
- Qwen3-1.7B / 0.6B —— 中文端侧首选,支持 thinking
- Qwen2.5-1.5B / 0.5B —— 稳定可靠,社区支持好
- SmolLM2-1.7B —— HuggingFace 生态
连接器
- 2-layer MLP —— 简单有效,端侧部署友好
- C-Abstractor —— 需要 token 压缩时(MiniCPM-V 方案)
部署框架
- MLC LLM —— 端侧效果最好
- llama.cpp —— 跨平台,GGUF 量化
- ExecuTorch —— PyTorch 原生,Android/iOS

1525

被折叠的 条评论
为什么被折叠?



