Skip to content
查看 GitHub 源文件

源文件:https://github.com/lennonli/licheng-AI-tutorials/blob/main/docs/agent-practice-07-scanned-pdfs-ABL-20260831-V1.md

AI实战07|一堆扫描PDF怎么处理?让Agent先识别,再整理,再提取

实际工作里的PDF,并不都是干净的电子文件。

经常会遇到:

扫描合同;

盖章版协议;

证照扫描件;

法院材料;

发票;

截图;

图片版公告。

这些文件打开以后看得见,但文字可能根本无法直接复制。

以前处理这类材料,通常需要人工:

一页一页看;

手动录入;

再整理成表格。

现在如果Agent具备图片和PDF识别能力,可以把这一整套工作先交给它做第一轮处理。

一、先判断是不是扫描件

电子PDF和扫描PDF虽然都叫PDF,但处理方式不一样。

电子PDF通常本身就有文字层。

Agent可以直接:

搜索;

复制;

提取;

定位。

扫描PDF本质上更像:

很多张图片装进一个PDF。

这时候AI需要先“看懂图片”,再提取内容。

所以遇到一批PDF时,可以先让Agent判断:

哪些是正常文本PDF;

哪些是扫描件;

哪些页面识别质量比较差。

不要默认所有PDF都一样。

二、扫描件最适合先做“结构化提取”

比如有50份营业执照。

人工真正需要的通常不是:

把整张营业执照重新转成文字。

而是几个字段:

公司名称;

统一社会信用代码;

法定代表人;

注册资本;

成立日期;

住所。

所以扫描件处理最实用的方法是:

不要先追求全文OCR,而是先明确你到底要提取什么。

字段越明确,Agent越容易得到可用结果。

三、合同扫描件可以先提取关键信息

比如几十份盖章合同。

可以先批量提取:

合同名称;

签约主体;

签署日期;

金额;

期限;

盖章情况。

再把结果形成Excel。

如果后面发现某几份合同有风险,再进一步读取全文。

没必要一开始把几千页扫描件全部转成完整文字。

这样速度和准确性通常都会更好。

四、图片质量会直接影响结果

扫描件最常见的问题包括:

倾斜;

模糊;

阴影;

印章遮挡;

页面缺角;

分辨率太低;

手写内容;

复印件反复复印。

所以不要要求AI:

“必须识别出来。”

识别不清楚时,更可靠的处理方式应该是:

标记:

“无法确认”。

特别是:

金额;

日期;

身份证号;

统一社会信用代码;

合同编号

这类字段,不能靠猜。

五、重要字段最好保留“原始页码”

比如AI告诉你:

合同金额是500万元。

你最好还能知道:

这个数字来自第几页。

这样人工复核时可以直接跳到对应位置。

所以专业材料整理时,我通常建议同时保留:

文件名;

页码;

提取结果。

如果条件允许,还可以保存对应原文片段。

这样结构化结果才真正可以复核。

六、扫描材料特别适合做“资料盘点”

比如一个尽调文件夹里有200份扫描材料。

第一轮根本不需要逐份深度分析。

可以先让Agent回答:

有什么材料;

分别属于什么类别;

关键日期是什么;

哪些文件重复;

哪些文件明显缺页;

哪些材料看不清。

最终得到一张:

资料清单。

这一步完成以后,人再决定哪些材料需要重点审查。

这比一开始就让AI:

“全面分析200份文件”

实际得多。

七、证据材料也可以先做初步目录

比如一批:

合同;

转账记录;

聊天截图;

发票;

通知;

照片。

可以先让Agent按照文件内容形成:

文件名称;

日期;

涉及主体;

材料类型;

主要内容;

可能证明的事项。

形成一份初步证据目录。

之后律师再进行:

取舍;

调整顺序;

确认真实性;

确定最终证明目的。

AI负责第一轮整理,人负责最终判断。

八、不要让识别结果直接替代原件

这一点很重要。

不管AI识别得多准确:

提取结果始终只是加工结果。

真正需要确认的重要事实,仍然应该回到:

原始PDF;

原始图片;

原始证据材料。

尤其是涉及:

金额;

签字;

盖章;

日期;

主体身份;

关键条款。

所以Agent的价值主要是:

帮助人快速定位和整理,而不是让原始文件失去意义。

直接复制的实战提示词

请处理【扫描PDF/图片文件夹路径】中的全部材料。先识别文件类型和可读情况,再按统一字段提取【公司名称、日期、金额、主体、合同编号等需要的字段】,同时保留原始文件名和对应页码;无法清晰识别的内容标记“待人工核对”,不得猜测。最终生成【资料清单.xlsx/证据目录.xlsx】,并单独列出无法读取、疑似缺页或需要人工核验的文件,保存至【输出文件夹】,不得修改原始材料。

最后记住一句话

处理扫描材料时,不要一上来就要求AI:

“把所有内容全部识别出来。”

先问:

“我真正需要从这些材料里提取什么?”

字段定义清楚以后,

大量原本需要人工逐页翻看的扫描材料,就可以先让Agent完成第一轮整理。

内容同步自 GitHub 仓库,仅作为工具教程与工作流说明。

CONTACT

联系李成律师

扫描二维码添加微信,沟通法律 AI、非诉业务及相关合作事项。

手机端可点击二维码查看原图并长按识别。

李成律师微信二维码扫码添加微信