使用 Dynamsoft Barcode Reader 11.6 的多模态 PDF 处理功能,更快地从任何 PDF 文件中读取条形码
【即将推出的功能】使用多模态 PDF 处理从任何 PDF 中读取条形码
PDF 文件中的条形码并非以单一、可预测的方式存储。根据文档的生成方式,同一个条形码在 PDF 中可以以矢量图形、嵌入式图像、文本对象或完全栅格化页面的一部分的形式存在。如果阅读器只能处理其中一种表示形式,则要么会错过条形码,要么会浪费时间渲染不需要的页面。
为了解决这个问题,我们即将发布的Dynamsoft Barcode Reader 11.6版本引入了多模态 PDF 处理功能。该引擎不再依赖单一的提取策略,而是分析 PDF 结构并自动选择访问条形码内容的最有效方法。这意味着开发人员可以从不同的 PDF 表示形式中读取条形码,而无需选择或维护单独的预处理路径。

要点总结
- PDF 文件以四种不同的方式嵌入条形码:矢量图形、嵌入式图像、文本对象和完全栅格化页面。
- Dynamsoft Barcode Reader 11.6 内置了多模态 PDF 处理功能,可自动处理不同的 PDF 内容类型。
- 引擎首先检查 PDF 结构,然后选择最快的有效提取路径,而不是总是渲染整个页面。
- 直接从矢量和图像对象读取条形码内容,避免了不必要的全页栅格化,从而减少了处理时间并保持了分辨率。
- 基准测试将之前的 PDF 读取方法与 11.6 版本中的新多模态 PDF 处理方法进行了比较。
条形码如何在PDF中嵌入
PDF 文件是一个容器,而不是图像。同一个可见条形码可以采用以下任何一种编码形式:
- 矢量图形——条形码以与分辨率无关的路径和形状绘制。
- 嵌入式图像——条形码是放置在页面上的光栅图像,而页面上的其他内容是真正的文本。
- 文本对象——条形码值以可选择的文本或字体字形形式存在。
- 完全栅格化页面——整个页面,包括条形码,都是一个扁平化的图像。
由于这些表示方法本质上不同,因此对一种方法来说是最优的策略,对另一种方法来说往往速度较慢或不可靠。
多模态 PDF 处理如何读取条形码内容
多模态PDF处理取代了“渲染每一页然后查找条形码”的传统做法,转而采用结构感知决策步骤。它会检查PDF的实际内容,并将每一页路由到最高效的提取方法。
工作流程包括四个步骤:
- 引擎解析 PDF 结构,以确定每页内容的表示方式。
- 它将带有条形码的区域分类为矢量图形、嵌入式图像、文本对象或栅格化内容。
- 它会根据具体情况选择最有效的访问方法——尽可能直接从矢量或图像对象读取数据,而不是对整个页面进行栅格化。
- 它对提取的内容进行解码,并返回合并后的结果。
通过以原始形式访问条形码数据,该引擎避免了全页渲染带来的成本和分辨率损失,只要 PDF 结构提供了更直接的路径即可。
基准测试:以往的PDF读取方法与多模态PDF处理方法的比较
以下比较衡量了四种最常见的 PDF 条形码场景的处理时间,将之前的版本与 Dynamsoft Barcode Reader 11.6 中使用该ReadRateFirst模板的新型多模态 PDF 处理进行了比较。
| PDF类型 | 先前版本 | Dynamsoft 条码阅读器 11.6 |
|---|---|---|
| 嵌入式条形码图像 | 249毫秒 | 115毫秒 |
| 矢量条形码 PDF | 174毫秒 | 3毫秒 |
| 混合内容发票 | 276毫秒 | 34毫秒 |
| 条形码字体 | 313毫秒 | 5毫秒 |
这四份测试文档代表了开发人员最常遇到的模式:一页以嵌入式光栅图像形式存储的条形码、一张与分辨率无关的矢量条形码,以及一张真实的发票,该发票在同一页上混合了文本、嵌入式支付二维码和矢量跟踪条形码。
最适合的应用场景
多模态 PDF 处理可提高各种 PDF 条形码应用场景下的速度和可靠性,尤其在以下情况下效果最为显著:
- 存在矢量条形码,否则需要进行全页栅格化才能读取它们。
- 嵌入式条形码图像位于基于文本的页面上,因此渲染整个页面会造成浪费。
- 发票、装运清单和实验室报告等混合内容文档结合了文本、图像和矢量条形码。
- 高容量 PDF 流水线处理大量文件,每页渲染成本会迅速累积。
更快的渲染流程。更高的可靠性。更少的渲染浪费。
通过在 Dynamsoft Barcode Reader 11.6 中添加多模态 PDF 处理功能,团队可以:
- 无需预先选择策略,即可从任何 PDF 文档中读取条形码。
- 避免不必要的全页栅格化及其增加的处理时间。
- 直接读取矢量和图像内容,保持条形码分辨率。
- 提高大批量 PDF 工作流程的吞吐量。
- 无需自定义预处理即可可靠地处理混合内容文档。
开发者常见问题
- Dynamsoft条码阅读器中的多模态PDF处理是什么?它是11.6版本中内置的PDF处理方法,可以分析PDF的结构并自动选择访问条码内容的最有效方法。
- 为什么不能用单一策略高效地读取所有 PDF 条形码?因为条形码嵌入 PDF 的方式从根本上来说各不相同——矢量图形、嵌入式图像、文本对象或栅格化页面——每种方式都需要不同的访问方法。
- 多模态 PDF 处理需要修改代码吗?不需要。它是内置的,因此现有的 PDF 阅读工作流程会自动受益。
- Dynamsoft 如何展示新 PDF 方法的影响?基准测试对比了先前版本和 Dynamsoft Barcode Reader 11.6 在嵌入式条形码图像、矢量条形码 PDF、混合内容发票和条形码字体 PDF 上的表现。
- 哪些场景最能从中受益?矢量条形码 PDF、文本页面上的嵌入式条形码图像、混合内容发票和大批量 PDF 处理流程。
439

被折叠的 条评论
为什么被折叠?



