可以识别,但扫描版 PDF 本质上是图片,必须经过 OCR 才能得到可搜索、可抽取的文字。识别效果受清晰度、方向、印章遮挡、表格结构和手写内容影响,因此 OCR 结果应作为录入辅助,不能不经复核直接成为最终合同数据。
文本型 PDF 和扫描型 PDF 有什么区别
文本型 PDF 通常可以直接选中文字,系统能够先提取文本;扫描型 PDF 是纸质文件拍照或扫描后形成的图片,无法直接读取字符。还有一类混合 PDF,部分页面有文字层,部分页面需要 OCR。
肇新合同管理系统支持配置文本提取与 OCR 策略。自动模式会先尝试提取文本,当文字密度或有效字符数不足时再降级到 OCR;也可以根据项目需要配置强制 OCR。管理员可以设置 OCR 服务地址、密钥和识别阈值。
哪些因素影响识别效果
- 扫描分辨率过低或图片严重压缩;
- 页面倾斜、旋转、阴影或背景杂乱;
- 印章覆盖金额、日期或签字;
- 复杂表格、双栏排版和页眉页脚干扰;
- 手写补充、涂改或模糊复印;
- 文件设置密码、损坏或页面异常。
上传前尽量使用正向、清晰、完整的扫描件,避免用聊天软件多次转发压缩。
OCR 与 AI 字段抽取是什么关系
OCR 负责把图片变成文字;AI 字段抽取再从文字中识别合同名称、签约方、金额、期限和扩展字段。OCR 识别错一个数字,后续抽取就可能得到错误金额或日期。
系统可以配置 AI 起草需要识别的基础字段和动态表单字段,并为字段设置补充提示。但在提交审批前,用户仍应对照原文件核对签约主体、相对方、金额、币种、生效日期、截止日期和付款节点。
推荐的人工复核顺序
先检查主体和合同编号,再检查金额、币种和税率,然后检查所有日期,最后检查付款、交付和验收节点。对印章遮挡、手写内容和复杂表格应重点查看原页。
识别失败怎么办
先确认文件可正常打开、没有密码且页面方向正确;再检查 OCR 服务配置和网络;必要时重新扫描或拆分异常页面。如果系统提取结果明显不完整,应停止自动提交并转人工录入,而不是通过反复生成猜测缺失内容。
OCR 对合同管理的实际价值
企业引入 OCR,并不是为了把一份 PDF 变成可复制文字,而是为了减少历史合同录入和新合同登记时的机械工作。识别后的合同名称、主体、金额和日期可以进入台账,进一步支持查询、审批、到期提醒和履约计划。
如果识别结果只停留在一个文本框中,员工仍要重新填写系统字段,OCR 的业务价值就很有限。肇新的做法是将 OCR 作为文档解析基础,再与 AI 字段抽取和动态表单结合。
肇新支持怎样的识别策略
管理员可以根据文件特点选择自动提取或强制 OCR,并通过文字密度和最小有效字符等阈值判断扫描件。AI 抽取字段还可以按合同类型配置,既识别系统基础字段,也可覆盖启用的扩展字段。
这种配置适合不同质量的合同来源:电子生成 PDF 优先直接取文本,纸质扫描件再调用 OCR,避免所有文件都走成本更高的识别服务。
不要只用一份清晰样本测试
评估系统时应准备正常电子 PDF、低清扫描件、印章遮挡文件、复杂表格合同和一份混合 PDF。记录关键字段的正确、缺失和错误情况,而不是只看页面上是否成功显示文字。
还要测试识别失败后能否人工修正、原文件是否始终可查看、修正结果是否进入后续审批。企业真正需要的不是一次“看起来很智能”的演示,而是一个可复核、可纠错的录入过程。
如需验证肇新的合同识别能力,可以提供若干脱敏样本,并说明最关注的字段。团队可在目标 OCR 与 AI 配置下演示抽取过程,帮助企业判断哪些文件适合自动处理、哪些仍应人工录入。
进一步了解:肇新 AI 合同管理能力|申请合同识别样本演示
