多模态Embedding
ColPali: Efficient Document Retrieval with Vision Language Models
https://arxiv.org/abs/2407.01449
法国Illuin Technology,202407
- 创建并公开发布 ViDoRe,这是一个综合基准,用于评估系统在页面级文档检索方面的能力,涵盖广泛的领域、视觉元素和语言。
- 提出了一种基于视觉语言模型(VLM)的新颖概念和模型架构,以仅从文档的视觉特征有效地索引文档,从而可以通过后期交互机制进行后续的快速查询匹配。ColPali 在 ViDoRe 上显著优于所有其他检索系统,同时具有快速且端到端可训练的特点。
动机

文档通过文本以及图形、页面布局、表格甚至字体来传递信息。由于现代检索系统的性能瓶颈并非是嵌入模型的性能而是前置的数据获取过程。对于一个PDF,需要通过OCR从页面提取单词,然后通过文档布局检测来分割段落、标题、表格等对象,随后通过分块将文本段落分组为语义连贯性的单元,对于图片信息通过image caption来提取描述。
ColPali是一个视觉语言模型,经过训练可以从文档页面的图像中生成高质量的多向量嵌入,更加简单、快速且可端到端训练。
方法
ViDoRe Benchmark
定义
论文认为目前大多数检索系统可以分解为:
- (1)离线索引阶段,在该阶段构建文档索引;
- (2)在线查询阶段,在该阶段将查询与索引中的文档进行匹配,并且低延迟对于用户体验至关重要。
并确定一个高效的文档检索系统应具备:
- (R1)强大的检索性能,以标准检索指标衡量;
- (R2)快速的在线查询,通过平均延迟衡量;
- (R3)高吞吐量的语料库索引,即在给定的时间范围内可以嵌入的页面数量。
ViDoRe目标是全面评估检索系统在页面级别上将查询与相关文档进行匹配的能力。包含多个正交子任务,包括不同模态:文本、图表等,不同领域:医学、商业、科学等,不同语言:英语、法语。
评估指标
论文将 n D C G @ 5 nDCG@5 nDCG@5值作为主要的性能指标(需求R1对应的指标)。
n D C G nDCG nDCG (Normalized Discounted cumulative gain): D C G DCG DCG是一种衡量搜索或推荐系统中返回结果相关性的指标。它考虑了相关性评分 和 位置惩罚(discount):越靠前的结果权重越大。假设我们有一个查询,系统返回了 k k k个结果,每个结果的相关性评分为 r e l _ i rel\_i rel_i,那么 D C G DCG DCG的计算公式为: DCG _ k = ∑ _ i = 1 k 2 rel _ i − 1 log _ 2 ( i + 1 ) \text{DCG}\_k = \sum\_{i=1}^{k} \frac{2^{\text{rel}\_i} - 1}{\log\_2(i + 1)} DCG_k=∑_i=1klog_2(i+1)2rel_i−1, I D C G IDCG IDCG表示在理想情况下(即结果按从高到低完美排序时)的 D C G DCG DCG 值,则: n D C G @ 5 = D C G _ 5 I D C G _ 5 nDCG@5=\frac{DCG\_5}{IDCG\_5} nDCG@5=IDCG_5DCG_5
ColPali

图像embedding的流程如下:
-
Doc侧建立索引:
- Vision LLM (采用PaliGemma-3B) 通过将图像分割成一系列patch来对图像


1335

被折叠的 条评论
为什么被折叠?



