← 返回题目列表

OCR 和多模态大模型在文档理解中怎么配合?

高频 中等 第 11 / 25 题 更新于 2026/09/18
多模态OCRVLM文档理解

简化版

OCR 擅长把文字及坐标稳定、低成本地抽取出来,便于搜索、校验和审计;VLM 擅长结合版面、图形和语义做跨区域推理。生产系统通常不是二选一,而是 OCR 提供可检索文本与置信度,VLM 查看原图和关键 crop 处理布局、歧义与低置信字段,最后用规则或人工复核高风险答案。

详细版

OCR-first 适合文字密集、字段固定、要求精确值和高吞吐的票据合同;VLM-first 适合图表、截图、复杂版式和开放问答。混合链路可以先做版面分析与 OCR,保留 token、Bounding Box、页码和置信度;检索召回相关页后,把文本与原图区域一起交给 VLM,并要求输出答案、证据区域和不确定性。

关键在错误分工:OCR 可能错字、漏字、排错阅读顺序,VLM 可能视觉幻觉、读不清小字且成本较高。低置信 OCR 不应直接删除,而应触发放大 crop、替代 OCR 或 VLM 复读;金额、日期等结果还要做格式与业务规则校验。评测需同时覆盖字符/字段准确率、证据召回、端到端问答、延迟和单页成本。

文档 -> 布局/OCR -> 可搜索索引 -> 召回页与框 -> VLM结合原图推理 -> 规则/人工复核
             └──────── 文本、坐标、置信度 ────────────┘

完整版教学

一、两类能力解决的问题不同

OCR 的输出目标是字符序列以及文字所在位置,它追求可复制、可检索和字段级精确。VLM 的目标更宽,可以理解表格、图标、图片与文字的关系,并根据问题生成答案。把两者直接比较“谁更强”忽略了输出形式和成本差异。

例如合同全文检索需要精确找到“不可抗力”,OCR 文本索引很合适;问题“这张流程图中审批失败后回到哪一步”需要理解箭头与图形,VLM 更自然。一个成熟系统让确定性强的组件承担可结构化部分,把开放语义留给 VLM。

二、OCR-first 的优势与边界

OCR 结果体积小,可一次抽取后服务多次查询,并能用 BM25、正则和数据库规则处理。字符与坐标便于展示证据、审计和人工修订。在百万页文档库中,先索引 OCR 比每次把整页图像交给 VLM 更经济。

但 OCR 容易在扫描噪声、小字、手写、公式和复杂表格上失败。线性文本还会丢失二维关系:同一个数字属于哪一列表头,常由位置决定。系统必须保存 Bounding Box 和版面区域,不能只留下拼接后的纯文本。

三、VLM-first 何时更合适

当页面以图表、界面截图、印章或自由布局为主,OCR 抽到的字符不足以表达语义,直接让 VLM 看图更有效。OCR-free 模型还减少多级管线中的误差传播,并能对开放问题做联合理解。代价是高分辨率带来大量视觉 Token,输出也较难保证逐字精确。

对于 50 页合同,VLM-first 若每页消耗 1500 视觉 Token,一次问题就可能输入 75000 Token;先用 OCR 检索到 3 页后,只需处理约 4500 视觉 Token。这个算例说明,大文档通常需要检索或路由,即使最终阅读者是 VLM。

记忆钩子:OCR 把页面变成“可查的数据”,VLM 把页面变成“可问的语义”;两者通过坐标和原图证据连接。

四、混合架构怎样串起来

预处理阶段完成旋转校正、布局检测、OCR 和页级索引,保存原图与结构化中间结果。查询阶段先用文本、视觉或混合检索召回候选页,再按 OCR 置信度、任务类型和风险决定是否调用 VLM。VLM 输入应包含局部原图、相关上下文和明确坐标协议。

离线:PDF -> 页面图 -> OCR/布局 -> 文本索引 + 区域索引
在线:问题 -> 混合召回 -> 候选页面
                    -> 高置信结构字段 -> 规则抽取
                    -> 复杂/低置信区域 -> VLM复核

输出最好是结构化的 {answer, page, bbox, confidence}。用户可直接查看答案来源,后端也能检查坐标是否存在、答案是否能在 OCR 或图像区域中得到支持。

五、如何进行置信度路由

路由可综合 OCR 字符置信度、版面类型、字体像素高度、问题风险和规则冲突。比如普通摘要可接受少量字符误差,而转账金额必须逐字符核验。阈值要在领域验证集上校准,OCR 自报 0.9 不一定真的有 90% 正确率。

条件推荐路径原因
高置信正文检索OCR 文本直接使用快且可追溯
复杂表格/图表OCR + 原图交给 VLM需要二维关系
小字低置信字段放大 crop + 双模型复读防止关键字符错
高风险金额多源一致 + 规则/人工错误损失高
手写或印章遮挡专用模型或人工通用能力不稳定

路由本身要被监控:多少请求走了昂贵路径、低置信样本是否真的更难、升级后质量提高多少。否则阈值可能长期保守,导致成本失控。

六、错误如何交叉验证

OCR 与 VLM 并非独立真值,它们可能同时受模糊图像影响。可以比较两者的字段结果,冲突时查看原始 crop、运行第二 OCR 引擎或请求人工。领域规则也很有用,例如发票“价税合计≈金额+税额”,日期必须落在合同有效期内。

若 OCR 读为 1080.00,VLM 读为 1030.00,而像素清晰度很低,系统不应选择更“自信”的一个。应输出冲突状态并放大重读;仍无法确定时拒答。可靠性来自显式处理冲突,不是让语言模型把矛盾圆成通顺解释。

七、评测与成本核算

组件层测 CER、字段 Exact Match、表格结构和 OCR 置信度校准;检索层测 Recall@k;问答层测答案正确率、证据定位与拒答;工程层测每页处理时间、在线 P95 和调用成本。测试集要按扫描质量、文档类型、语言和关键字段切片。

可做四组消融:仅 OCR、仅 VLM、OCR+LLM、OCR+VLM 原图。若混合方案准确率 91%、每问成本 0.03 元,而全量 VLM 是 92%、0.20 元,应根据风险场景决定是否为 1 个百分点支付六倍成本。还要测 OCR 错误注入,确认 VLM 是否真的能纠错而不是盲从文本。

八、常见误区与追问

  • 误区:VLM 出现后 OCR 已经过时。 大规模检索、精确转写和审计仍需要结构化 OCR。
  • 误区:OCR 文本正确就不需要布局。 表格、双栏和键值对的含义依赖二维位置。
  • 误区:把 OCR 与图片都输入就一定更准。 两路冲突会造成干扰,需要置信度与来源标记。
  • 追问:什么时候只用 OCR? 版式稳定、字段明确、图像质量高且规则可验证时。
  • 追问:如何让答案可追溯? 保存页码和 Bounding Box,并让回答返回证据区域供回显。
  • 追问:如何控制 VLM 成本? 离线 OCR 建索引,在线只给召回页与关键 crop,并缓存页面表示。

九、加强记忆

OCR 与 VLM 的协作可记成“抽、搜、看、验”:OCR 抽出文本、位置和置信度供检索;查询只召回相关页面;VLM 查看原图处理布局和歧义;规则、多模型或人工验证关键结果。回答时明确各自擅长点、冲突路由和分层指标,就不会落入“用新模型完全替代旧组件”的简单结论。