叶彦辛《扣子编程从一句话到产品上线:零门槛AI心流开发》全书案例分享~_扣子编程从一句话到产品上线:零门槛ai心流开发-CSDN博客
10.1.1 从一位证券研究员的清晨说起
周二上午八点,某券商研究所的化工行业研究员打开邮箱,发现助理刚刚发来一份新公司的尽调材料压缩包:32 家细分领域的中小盘公司、每家公司的最新两期年度报告,全部是扫描件——大多由公司 IR 部门用复印机扫描后压缩成 PDF,分辨率不高、轻微倾斜、个别页面甚至带有手写批注。研究员的任务是:在午餐前把这 32 家公司的核心财务指标(营业收入、归母净利润、ROE、EPS、研发投入占比、资产负债率、经营性现金流净额)整理成一张 Excel,准备下午更新内部行业看板。
这位研究员的请求看似只是“把表格里的数字抄出来”,背后却隐藏了一条至少需要 4~6 个小时的高强度手工链路:先把每一份 PDF 用 OCR 工具粗转一遍文本(识别率参差不齐),再人工对照原图核对表格的每一个数字,然后把“扣除非经常性损益的净利润”等长字段映射到目标 Excel 的简称列、最后做加总核对发现勾稽关系不上时还要回头逐一定位错误。32 家公司、每家两期、每期约 15 个指标,意味着接近 1000 个数字需要被人工“看准”。一名熟练的研究员大约需要 5~6 小时;一名实习生则可能需要一整天。结果是,原本应该用于“研究”的时间,被大量浪费在“采数”上。
10.1.2 非结构化数据的四重困境
把上述工作进一步抽象,可以看到从扫描型 PDF 中提取结构化数据的过程,至少需要跨越四重困境。
第一重是 OCR 精度。扫描质量参差不齐导致识别错误率显著上升——金额中的小数点被识别成顿号、千分位逗号被丢失、数字 8 被误识为 0 或 B、负号被吞掉。一次小的字符错误,往往会让一个亿元级的净利润数字变成完全错误的另一个数字。
第二重是表格语义。扫描后的 PDF 表格只是像素阵列,没有任何行列结构信息。合并单元格、跨页表格、嵌套表格、多列对齐等情形会让朴素的“切行+切列”算法迅速失效。更困难的是中文财报常见的“项目栏+多期数据栏”的横向结构,识别成纯文本后变得难以还原。
第三重是字段映射。同一个会计指标在不同公司的表格中,可能有数十种文字表达——“归母净利润”“归属于上市公司股东的净利润”“归属于母公司所有者的净利润”指的是同一指标;“基本每股收益”与“基本每股收益(元/股)”也是同一指标。若没有强大的语义映射能力,OCR 出来的文字根本无法对齐到下游目标 Schema 的字段。
第四重是数值校验。即便 OCR 与字段映射都准确,仍需要校验数字本身的合理性——资产合计是否等于负债加权益、毛利率是否等于(营收-营业成本)/营收、归属于上市公司股东的净利润是否能与每股收益及股本数对齐。任何一处校验不通过,往往意味着 OCR 出错或字段映射出错。校验闭环是数据可信度的最后一道防线。
这四重困境共同指向一个事实:从扫描型 PDF 提取结构化数据,不是简单的“OCR +写 CSV”两步问题,而是需要 OCR 识别、视觉表格理解、字段语义映射、数值校验四种专业能力同步在线的复合任务。
10.1.3 传统应对方案的三种姿态
在大模型成熟之前,行业内主要有三种应对扫描型财务文档数字化的姿态。
第一种是纯人工录入。把扫描件直接交给数据录入员,由人工逐字逐行敲到表格里。这条路径精度最高(前提是录入员认真),但工时成本极高;据数据外包行业的公开报价,一份 8 页财报的核心 50 个字段录入加双人复核,市场报价大约在 80~150 元区间。对每月需要处理上千份财报的金融机构而言,纯人工方案几乎不可承受。
第二种是商用 OCR+模板匹配。引入 ABBYY、Hyland Brainware、Kofax 等专业 OCR 软件,先识别文字,再为每一种财报版式预先制作匹配模板,由模板把文字片段映射到结构化字段。这条路径在面对版式统一的发票、银行流水时效果良好,但面对中文上市公司年报这种“每家公司版式都不同、每年都还会微调”的场景时,模板维护成本会快速失控。一些机构甚至养着专门的“模板工程师”团队,每月处理数百个模板的新增与修改。
第三种是 RPA+半自动校对。用 RPA(Robotic Process Automation)脚本去自动化“打开 PDF → 调 OCR → 复制到 Excel”的鼠标键盘动作,再由人工校对最后一环。这条路径相比前两种在效率上有提升,但本质仍是把人力嵌在流程中做最后兜底,规模化时人力依然是瓶颈。
这三种姿态共同的结构性问题在于:它们都把“非结构化数据提取”当作“识别问题”而非“理解问题”来处理。在识别框架下,工程师追求的是更准的 OCR;在理解框架下,工程师追求的是更准的语义对齐与更严的校验闭环。大模型的到来,使得后者成为可能。
10.1.4 AI数据采集时代的新答案
本章案例提供了应对上述问题的第四条路径——研究员只需把扫描型财报 PDF 上传到工作流,扣子编程会自主完成 OCR 识别、表格区域定位、字段语义锚定、数值校验、异常标注,最终输出一份结构化的 CSV 文件,并附带一份“提取摘要”与“待复核字段清单”。整条链路的人工介入降到最低,能力沉淀做到最大。
与前三种方案相比,这一新路径在四个层面带来了价值跃迁。第一是交付效率:从一份扫描 PDF 到一行可入库的 CSV 记录,时间从小时级压缩到分钟级,且单位成本可降低 90% 以上。第二是质量稳定:多模态大模型的语义理解能力,使得字段映射的准确率显著高于模板匹配,特别是在新版式、变种科目名称等长尾场景中。第三是可解释性:每一个被提取出的数字都伴随置信度、来源页号、校验结果三类元信息,便于审计追溯。第四是无模板维护:工作流不再依赖任何预先制作的版式模板,新公司、新版式、新年份都可以无缝跑通。
10.1.5 典型应用场景
AI 数据采集工作流的价值远不止于上市公司财报。在实践中,凡是涉及“扫描件/图像输入+结构化字段输出”的复合需求,这一范式都具备适用性。表 10-1 列出了若干典型应用场景。
表 10-1 AI数据采集工作流的典型应用场景
| 应用领域 | 输入素材 | 输出形态 | 目标用户 |
| 投研机构 | 上市公司财报扫描件 | 财务指标 CSV/数据库表 | 行业研究员 |
| 银行风控 | 客户企业信贷材料 | 风控指标结构化数据 | 信贷审批岗 |
| 会计师事务所 | 客户审计底稿 | 审计抽样字段表 | 审计经理 |
| 医疗机构 | 纸质病历扫描件 | 病历结构化字段 | 临床信息岗 |
| 法律事务所 | 合同与法律文书扫描件 | 关键条款结构化表 | 法务 |
| 政府监管部门 | 企业上报材料 | 监管指标库 | 行业监管员 |
| 制造业供应链 | 历史纸质采购单据 | 供应商绩效数据 | 供应链分析师 |
本章选取上市公司年度报告作为示范案例。原因有三:第一,年度报告是金融行业最典型、最常见的非结构化数据源,几乎每家投研机构都有此需求;第二,年度报告中既有数字密集的财务表格(验证 OCR 精度与表格语义还原),也有文字密集的业务概况段落(验证字段语义锚定),还有跨页的财务报表(验证跨页合并),是检验工作流综合能力的最佳载体;第三,财务数据本身具有严格的勾稽关系(如资产=负债+权益、毛利率=1-营业成本/营业收入),为数值校验闭环提供了天然的检验点。

&spm=1001.2101.3001.5002&articleId=163917338&d=1&t=3&u=9fe0709a9d4a40219a97791b014f254b)
1239

被折叠的 条评论
为什么被折叠?



