在多智能体(Multi-Agent)或智能体(Agent)系统中,agent-skill 和 subagent 是两个不同维度的概念
核心区别在于:agent-skill 是智能体的能力组件,是 “技能”;subagent 是智能体的层级子单元,是 “子个体”。
定义
agent-skill(智能体技能)
是智能体完成特定任务的能力模块或函数集合,是智能体的 “功能属性”
本质是无自主决策能力的执行单元,需要依附于智能体的核心调度逻辑才能发挥作用
示例:文本摘要 skill、图像识别 skill、代码生成 skill、GUI 操作 skill(如 Qwen3-VL 的视觉智能体技能)
subagent(子智能体)
是在主智能体(Main Agent)管控下的独立子智能体单元,是智能体系统的 “层级子个体”
本质是具备轻量化自主决策能力的迷你智能体,拥有自己的感知、规划、执行逻辑,可独立完成细分任务
示例:在一个 “多模态内容创作主智能体” 中,负责文本撰写的 subagent、负责配图生成的 subagent、负责排版优化的 subagent

subagent 可以包含多个 agent-skill,一个 subagent 为了完成其细分任务,会集成多种 agent-skill
例如:“代码审查 subagent” 可能包含 语法检测 skill、漏洞扫描 skill、性能分析 skill 三个技能模块
agent-skill 是 subagent 能力的基础,没有具体的 agent-skill,subagent 就失去了执行任务的 “工具”
而 subagent 则是这些 skill 的调度与整合载体
主智能体的两种能力扩展方式
轻量扩展:直接给主智能体挂载新的 agent-skill(如新增 “PDF 解析 skill”)
复杂扩展:拆分出独立的 subagent 处理复杂任务(如将 “多语言翻译” 拆分为独立 subagent)
典型应用场景
agent-skill 适用场景
智能体功能轻量化扩展:给问答智能体新增 “表格生成 skill”
高频单一任务执行:Qwen3-VL 的 “OCR 识别 skill”、“GUI 元素定位 skill”
资源受限环境:边缘设备上的智能体,通过挂载核心 skill 降低开销
subagent 适用场景
复杂任务拆解:科研论文写作主智能体,拆分出 “文献检索 subagent”“实验数据分析 subagent”“结论撰写 subagent”
多模态协同任务:多模态内容生成系统,用不同 subagent 分别处理文本、图像、音频
分布式任务处理:云端智能体集群,通过多个 subagent 并行处理不同子任务
Qwen3-VL
Qwen3-VL 的全称是Qwen3 Vision-Language Model,即通义千问 3 代视觉 - 语言模型
“Qwen” 是通义千问的英文名称
“3” 代表其为 Qwen 系列第三代模型
“VL” 是 “Vision-Language”(视觉 - 语言)的缩写
Qwen3-VL 是阿里云 Qwen(通义千问)团队开发的新一代视觉-语言多模态大模型(VLM)
采用 “视觉编码器 + 多模态融合模块 + LLM 解码器” 架构,原生支持文本、图像、视频的交错输入与统一建模
兼具强大的纯文本能力、长上下文理解、视觉感知推理及视觉智能体执行能力,覆盖从边缘到云端的多种部署需求
核心架构
Qwen3-VL 采用模块化分层设计,确保视觉与语言模态的深度融合:
视觉编码器(Vision Encoder):
基于 SigLIP2 持续预训练,支持动态分辨率输入,采用绝对位置编码 + 2D-RoPE 组合方案,将图像 / 视频帧编码为视觉 tokens,不强制缩放或裁剪,保留完整视觉细节
多模态融合模块(VL-Merger+DeepStack):
含两层 MLP 的 VL-Merger(压缩视觉特征为 visual token)与 DeepStack(将视觉 tokens 深度注入 LLM 多个层级),实现视觉特征与文本特征的深度交互
LLM 解码器:
Qwen3 语言基座,分 Dense(全参数参与推理)和 MoE(动态激活部分专家)架构,支持自回归生成,原生处理文本-视觉交错 token 序列
关键特性
特性 说明
纯文本能力强势 预训练早期融合文本与视觉模态协同训练,纯文本任务表现媲美同规模顶级 LLM
超长上下文 原生支持 256K tokens,可扩展至 1M,能处理整本书籍或数小时视频,支持秒级索引与完整回忆
高级空间感知 具备 2D/3D Grounding 能力,可判断物体位置、遮挡关系、视角,支撑 3D 建模与具身 AI
视觉智能体(Visual Agent) 能识别 PC / 移动端 GUI 元素、理解功能并调用工具完成任务,在 OSWorld 等基准测试达顶尖水平
视觉编码增强 可从图像 / 视频生成 Draw.io、HTML/CSS/JS 等代码,适配设计图转前端实现等场景
视频理解升级 引入基于显式文本的视频时间对齐机制,支持数小时长视频的时序分析与关键帧定位
多语言 OCR 强化 支持 32 种语言,优化低光、模糊、倾斜图像的文字提取,提升复杂场景文本识别准确率
STEM 推理提升 在数学、物理等领域具备因果分析与证据链推理能力,适合复杂逻辑与数理问题求解
版本规格
Qwen3-VL 提供多样化版本,适配不同算力与场景需求,区分 Instruct(指令遵循)和 Thinking(推理增强)版本:
架构类型 模型规格 适用场景
Dense(密集型) 2B/4B/8B/32B 边缘设备、本地部署、低延迟任务
MoE(专家混合) 30B-A3B/235B-A22B 云端部署、高复杂度推理、大规模多模态任务
MoE 的全称是 Mixture of Experts,中文译为专家混合模型
典型应用场景
长文档 / 长视频处理: 解析千页书籍、数小时视频,生成摘要、问答或关键信息检索
视觉智能体与自动化: GUI 界面操作、自动化测试、智能运维(如识别设备异常)
内容创作与开发: 图像生成代码(前端 / 流程图)、图文内容生成、多语言 OCR 与翻译
STEM 教育与科研: 复杂图表解析、数理逻辑推理、3D 空间问题可视化分析
具身 AI 与机器人: 基于视觉的空间规划、物体交互与任务执行
部署与使用
Qwen3-VL 已开源并提供 ModelScope、GitHub 等渠道的调用接口与部署指南
支持本地私有化部署、云端 API 调用及 WebUI 快速上手
适配 Python/Go 等主流开发语言,便于二次开发与集成

5206

被折叠的 条评论
为什么被折叠?



