百度PaddleOCR-VL调研报告

本人实测结果

开宗明义:本人基于部署的paddleocr-vl模型,简单开发了一个前端进行效果展示,如下图所示,针对包含红章和倾斜的表格,paddleocr-vl模型的识别效果还是不错的。
在这里插入图片描述

一、引言

在数字化时代,文档作为核心信息载体,其复杂度与体量呈指数级增长,文档解析技术已成为信息提取与管理的关键支撑。文档解析的核心目标是实现对文档布局的深度结构与语义理解,包括识别文本块、区分公式、表格等元素、确定阅读顺序等,为高效信息检索、数据管理及大语言模型(LLMs)与检索增强生成(RAG)的结合提供高质量知识输入。

当前文档解析领域主要存在两类技术路径:一类是基于专用模块化专家模型的流水线方法,虽性能尚可,但面临集成复杂、误差累积及处理复杂文档能力有限的问题;另一类是基于多模态模型的端到端方法,虽简化了流程,但在长文本或复杂布局下易出现文本顺序错误、幻觉现象,且计算开销大,限制了实际部署。

在此背景下,百度PaddlePaddle团队推出的PaddleOCR-VL,作为一款高性能、资源高效的文档解析解决方案,有效突破了现有技术瓶颈。该方案基于视觉语言模型(VLM)构建,兼具高精度与高效率,支持109种语言及多种复杂元素识别,为多模态文档解析的规模化应用提供了新路径。本报告将从关键技术、实测效果及引用文献等方面,对PaddleOCR-VL进行全面剖析。

二、关键技术介绍

2.1 核心架构设计

PaddleOCR-VL采用两阶段架构设计,将复杂的文档解析任务拆解为布局分析与元素识别两个核心环节,配合轻量级后处理模块实现结构化输出,整体架构兼具灵活性与高效性。

2.1.1 布局分析模块(PP-DocLayoutV2)

针对端到端VLM方法存在的延迟高、内存消耗大及布局分析不稳定等问题,PaddleOCR-VL专门设计了轻量化的PP-DocLayoutV2模块负责布局分析。该模块由两部分组成:一是基于RT-DETR的目标检测模型,实现布局元素的定位与分类;二是包含6个Transformer层的轻量级指针网络,精准预测布局元素的阅读顺序。

在技术实现上,PP-DocLayoutV2通过类内阈值筛选前景候选区域,结合绝对2D位置编码与类别标签编码生成特征嵌入,并在编码器注意力中融入Relation-DETR的几何偏置机制,显性建模元素间的几何关系。通过成对关系头生成元素间的相对顺序矩阵,最终利用确定性窗口累积解码算法得到拓扑一致的阅读顺序,在保证精度的同时提升了稳定性。

2.1.2 元素识别模块(PaddleOCR-VL-0.9B)

作为核心识别组件,PaddleOCR-VL-0.9B以“高精度+低开销”为设计目标,采用“视觉编码器-投影层-语言模型”的架构范式。其视觉编码器采用NaViT风格的动态高分辨率结构,基于Keye-VL预训练模型初始化,支持原生分辨率输入,可处理任意尺寸图像而无失真,显著提升了密集文本识别能力;投影层为随机初始化的2层MLP,采用GELU激活函数,通过2×2补丁合并实现视觉特征与语言模型嵌入空间的高效衔接;语言模型选用轻量级ERNIE-4.5-0.3B,引入3D-RoPE增强位置表示,在保证语义理解能力的同时降低了解码延迟。

2.1.3 后处理模块

该模块负责聚合布局分析与元素识别的输出结果,将非结构化文档数据转化为结构化的Markdown与JSON格式,为后续信息应用提供标准化数据接口。

2.2 训练方法与数据集构建

2.2.1 分阶段训练策略

PaddleOCR-VL针对不同模块采用差异化训练策略:对于PP-DocLayoutV2,采用“先检测后排序”的两阶段训练,先基于PP-DocLayout_Plus-L预训练权重训练RT-DETR检测模型100轮,再冻结检测模型参数独立训练指针网络200轮,使用广义交叉熵损失提升标注数据混合场景下的鲁棒性;对于PaddleOCR-VL-0.9B,分为预训练对齐与指令微调两个阶段,第一阶段基于2900万图文对实现视觉与语言特征空间对齐,第二阶段利用270万专用样本针对OCR、表格识别等具体任务进行微调,通过调整学习率与分辨率提升模型专项性能。

2.2.2 高质量数据集构建

为支撑模型训练,PaddleOCR-VL构建了系统化的高质量数据集生成流程:数据来源涵盖开源数据集(如CASIA-HWDB、ChartQA)、合成数据集、网络可获取数据及百度内部数据集,确保数据广度与多样性;标注环节通过“专家模型初标+大模型精标+幻觉过滤”实现自动化高质量标注,先由PP-StructureV3生成伪标签,再通过提示工程引导ERNIE-4.5-VL等大模型优化标签,最后过滤模型幻觉标注;针对性能瓶颈,设计评估引擎分类识别薄弱环节,通过数据合成生成大量难例样本,并结合少量人工标注完善数据集,提升模型鲁棒性。

三、官方测试结果

为验证PaddleOCR-VL的性能,研发团队在OmniDocBench、olmOCR-Bench等多个公开基准测试及内部测试集上,从页面级解析、元素级识别及推理效率三个维度进行了全面评估,其表现均达到业界领先水平。

3.1 页面级解析性能

在OmniDocBench v1.5基准测试中,PaddleOCR-VL以0.9B参数量实现了92.56的综合得分,超越MinerU2.5(1.2B参数量,90.67分)等一众竞品,在文本编辑距离(0.035)、公式CDM得分(91.43)、表格TEDS得分(89.76)及阅读顺序编辑距离(0.043)等关键指标上均刷新SOTA。

在包含1402份PDF文档的olmOCR-Bench测试中,PaddleOCR-VL以80.0±1.0的综合得分位居第一,在ArXiv文档(85.7)、页眉页脚识别(97.0)等场景表现突出,在多列文本(79.9)、长小文本(85.7)场景排名第二,充分体现了对不同类型文档的适配能力。

3.2 元素级识别性能

3.2.1 文本识别

在OmniDocBench-OCR-block测试中,PaddleOCR-VL在PPT2PDF(0.049)、学术文献(0.021)、杂志(0.020)等9类文档的文本编辑距离指标上均排名第一。内部构建的In-house-OCR测试集(含107452个样本、109种语言)中,其在阿拉伯语(0.122)、泰米尔语(0.043)等多语言场景,以及手写中文(0.089)、生僻字(0.001)、艺术字体(0.165)等复杂文本类型上均实现最低编辑距离。在Ocean-OCR-Handwritten手写识别测试中,其中文编辑距离0.034,英文编辑距离0.118,各项metrics均领先。

3.2.2 表格识别

OmniDocBench-Table-block测试中,PaddleOCR-VL的综合TEDS得分0.9195,结构TEDS得分0.9543,编辑距离0.0561,全面超越MinerU2.5等竞品。内部In-house-Table测试集(含20类表格类型)中,其综合TEDS得分0.8699,结构TEDS得分0.9066,展现了对复杂表格结构的解析能力。

3.2.3 公式识别

在OmniDocBench-Formula-block测试中,PaddleOCR-VL的综合CDM得分0.9453,其中英文公式CDM得分0.9751,中文公式0.8623。内部In-house-Formula测试集(34816个样本)中,其综合CDM得分高达0.9882,英文公式0.9914,中文公式0.9849,显著优于Qwen2.5-VL-72B等大模型。

3.2.4 图表识别

内部In-house-Chart测试集(1801个样本,11类图表)中,PaddleOCR-VL的RMS-F1综合得分0.8440,其中中文图表0.8549,英文图表0.8222,不仅超越PP-StructureV3等专业OCR模型,还优于Qwen2.5-VL-72B(0.7300)等大参数量多模态模型。

3.3 推理效率表现

在NVIDIA A100 GPU、批量处理512份PDF的测试中,PaddleOCR-VL基于vLLM后端实现1.2241页/秒的处理速度,1881.2令牌/秒的输出效率,相比MinerU2.5分别提升15.8%和14.2%;GPU内存占用仅43.7GB,较dots.ocr(78.5GB)节省约44%。基于SGLang后端时,其处理速度达1.0684页/秒,内存占用49.8GB,在效率与资源消耗间实现优异平衡,满足实际部署需求。

四、引用文献

在这里插入图片描述

(注:文档部分内容可能由 AI 生成)

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

碧绿的竹叶

互联网要饭:)

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值