使用 Dynamsoft Barcode Reader 11.6 多模态PDF处理功能

使用 Dynamsoft Barcode Reader 11.6 的多模态 PDF 处理功能,更快地从任何 PDF 文件中读取条形码

【即将推出的功能】使用多模态 PDF 处理从任何 PDF 中读取条形码

PDF 文件中的条形码并非以单一、可预测的方式存储。根据文档的生成方式,同一个条形码在 PDF 中可以以矢量图形、嵌入式图像、文本对象或完全栅格化页面的一部分的形式存在。如果阅读器只能处理其中一种表示形式,则要么会错过条形码,要么会浪费时间渲染不需要的页面。

为了解决这个问题,我们即将发布的Dynamsoft Barcode Reader 11.6版本引入了多模态 PDF 处理功能。该引擎不再依赖单一的提取策略,而是分析 PDF 结构并自动选择访问条形码内容的最有效方法。这意味着开发人员可以从不同的 PDF 表示形式中读取条形码,而无需选择或维护单独的预处理路径。

要点总结

  • PDF 文件以四种不同的方式嵌入条形码:矢量图形、嵌入式图像、文本对象和完全栅格化页面。
  • Dynamsoft Barcode Reader 11.6 内置了多模态 PDF 处理功能,可自动处理不同的 PDF 内容类型。
  • 引擎首先检查 PDF 结构,然后选择最快的有效提取路径,而不是总是渲染整个页面。
  • 直接从矢量和图像对象读取条形码内容,避免了不必要的全页栅格化,从而减少了处理时间并保持了分辨率。
  • 基准测试将之前的 PDF 读取方法与 11.6 版本中的新多模态 PDF 处理方法进行了比较。

条形码如何在PDF中嵌入

PDF 文件是一个容器,而不是图像。同一个可见条形码可以采用以下任何一种编码形式:

  • 矢量图形——条形码以与分辨率无关的路径和形状绘制。
  • 嵌入式图像——条形码是放置在页面上的光栅图像,而页面上的其他内容是真正的文本。
  • 文本对象——条形码值以可选择的文本或字体字形形式存在。
  • 完全栅格化页面——整个页面,包括条形码,都是一个扁平化的图像。

由于这些表示方法本质上不同,因此对一种方法来说是最优的策略,对另一种方法来说往往速度较慢或不可靠。

多模态 PDF 处理如何读取条形码内容

多模态PDF处理取代了“渲染每一页然后查找条形码”的传统做法,转而采用结构感知决策步骤。它会检查PDF的实际内容,并将每一页路由到最高效的提取方法。

工作流程包括四个步骤:

  1. 引擎解析 PDF 结构,以确定每页内容的表示方式。
  2. 它将带有条形码的区域分类为矢量图形、嵌入式图像、文本对象或栅格化内容。
  3. 它会根据具体情况选择最有效的访问方法——尽可能直接从矢量或图像对象读取数据,而不是对整个页面进行栅格化。
  4. 它对提取的内容进行解码,并返回合并后的结果。

通过以原始形式访问条形码数据,该引擎避免了全页渲染带来的成本和分辨率损失,只要 PDF 结构提供了更直接的路径即可。

基准测试:以往的PDF读取方法与多模态PDF处理方法的比较

以下比较衡量了四种最常见的 PDF 条形码场景的处理时间,将之前的版本与 Dynamsoft Barcode Reader 11.6 中使用该ReadRateFirst模板的新型多模态 PDF 处理进行了比较。

PDF类型先前版本Dynamsoft 条码阅读器 11.6
嵌入式条形码图像249毫秒115毫秒
矢量条形码 PDF174毫秒3毫秒
混合内容发票276毫秒34毫秒
条形码字体313毫秒5毫秒

这四份测试文档代表了开发人员最常遇到的模式:一页以嵌入式光栅图像形式存储的条形码、一张与分辨率无关的矢量条形码,以及一张真实的发票,该发票在同一页上混合了文本、嵌入式支付二维码和矢量跟踪条形码。

最适合的应用场景

多模态 PDF 处理可提高各种 PDF 条形码应用场景下的速度和可靠性,尤其在以下情况下效果最为显著:

  • 存在矢量条形码,否则需要进行全页栅格化才能读取它们。
  • 嵌入式条形码图像位于基于文本的页面上,因此渲染整个页面会造成浪费。
  • 发票、装运清单和实验室报告等混合内容文档结合了文本、图像和矢量条形码。
  • 高容量 PDF 流水线处理大量文件,每页渲染成本会迅速累积。

更快的渲染流程。更高的可靠性。更少的渲染浪费。

通过在 Dynamsoft Barcode Reader 11.6 中添加多模态 PDF 处理功能,团队可以:

  • 无需预先选择策略,即可从任何 PDF 文档中读取条形码。
  • 避免不必要的全页栅格化及其增加的处理时间。
  • 直接读取矢量和图像内容,保持条形码分辨率。
  • 提高大批量 PDF 工作流程的吞吐量。
  • 无需自定义预处理即可可靠地处理混合内容文档。

开发者常见问题

  • Dynamsoft条码阅读器中的多模态PDF处理是什么?它是11.6版本中内置的PDF处理方法,可以分析PDF的结构并自动选择访问条码内容的最有效方法。
  • 为什么不能用单一策略高效地读取所有 PDF 条形码?因为条形码嵌入 PDF 的方式从根本上来说各不相同——矢量图形、嵌入式图像、文本对象或栅格化页面——每种方式都需要不同的访问方法。
  • 多模态 PDF 处理需要修改代码吗?不需要。它是内置的,因此现有的 PDF 阅读工作流程会自动受益。
  • Dynamsoft 如何展示新 PDF 方法的影响?基准测试对比了先前版本和 Dynamsoft Barcode Reader 11.6 在嵌入式条形码图像、矢量条形码 PDF、混合内容发票和条形码字体 PDF 上的表现。
  • 哪些场景最能从中受益?矢量条形码 PDF、文本页面上的嵌入式条形码图像、混合内容发票和大批量 PDF 处理流程。
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值