多模态大模型在表格识别中的应用调研报告
1. 引言
表格作为结构化信息的重要载体,广泛存在于财务报表、科研文献、政府公文等场景中。传统表格识别方法通常分为两个步骤:表结构识别(Table Structure Recognition, TSR)与OCR文字识别。近年来,随着多模态大模型(Multimodal Large Language Models, MLLMs)的迅速发展,端到端、一体化的表格理解能力成为可能。本报告系统梳理当前主流方法,重点分析多模态大模型在表格识别中的能力边界与技术路径。
2. 传统方法与多模态大模型的范式演进
传统表格识别依赖 OCR 引擎(如 Tesseract、PaddleOCR)先提取文字,再通过规则或轻量级模型(如 TableNet、Lore)恢复表格结构。该流程存在误差累积、对复杂版式泛化能力弱等问题。
多模态大模型通过统一的视觉-语言编码器与解码器,可同时完成视觉感知、结构理解与语义生成,实现“看图说话”式的表格解析。这类模型通常在大规模图文对数据上预训练,并在特定任务(如表格识别)上微调或通过提示工程(Prompting)激发能力。
3. 代表性多模态大模型方法
3.1 通用多模态大模型的表格能力
研究表明,GPT-4V、Gemini 等通用多模态大模型虽具备基础 OCR 能力,但在复杂表格结构恢复(如合并单元格、跨页表)上表现有限,且缺乏标准化输出格式。为此,研究者开始构建任务导向的专用多模态模型。
3.2 专用表格识别多模态模型
- TableVLM / TableLVM<


984

被折叠的 条评论
为什么被折叠?



