《大模型应用开发 鲍亮,李倩 清华大学出版社》【摘要 书评 试读】- 京东图书
3.1.1 多模态大模型的定义与特征
多模态大模型是指具备大规模参数量、强表达能力和统一表示机制,能够同时处理两种及以上模态信息(如文本、图像、音频、视频等)的预训练模型或基础模型(foundation models)[4],其基本形式如图3.1所示。这类模型通过对大规模多模态数据的联合建模和对齐学习,实现跨模态的信息理解、表达生成与任务泛化,被视为AGI实现路径中的关键技术之一[5]。
早期关于“多模态学习”的概念,可追溯Graham W. Taylor教授团队于2017年发表的综述文章[6],文中多模态学习是指利用来自多个模态的协同信息(coordinated information),对认知任务建模的一种方式,其核心任务包括模态对齐(alignment)、模态融合(fusion)、模态迁移(co-learning)和模态生成(generation)等。随着大模型技术的发展,该理念进一步被扩展为“多模态大模型”。根据Stanford CRFM提出的定义,Bommasani等人[4]在On the Opportunities and Risks of Foundation Models中提出了“foundation model”的概念,并指出此类模型是在大规模异构数据(如文本、图像、语音、视频等)上通过自监督预训练获得统一表示,具备强泛化能力,并能在多种下游任务中实现高效迁移。其中,能够同时处理文本、图像、音频等多种模态的模型,即被视为多模态基础模型的典型代表。在上述基础上,OpenAI提出的基于对比学习的多模态预训练模型(Contrastive Language–Image Pre-training,CLIP)[7]模


19万+

被折叠的 条评论
为什么被折叠?



