Skip to content
查看 GitHub 源文件

源文件:https://github.com/lennonli/licheng-AI-tutorials/blob/main/docs/agent-practice-14-auto-classify-materials-ABL-20260831-V1.md

AI实战14|尽调目录建好了,再让Agent按清单自动归类客户材料

上一项工作解决的是:

根据尽调清单,把文件夹先建好。

接下来真正麻烦的事情来了。

客户可能一次性发来:

营业执照;

章程;

工商档案;

增资协议;

股权转让协议;

劳动合同;

知识产权证书;

重大合同;

诉讼材料;

各种扫描件。

如果是几百份,人工逐个判断:

“这个文件应该放到哪个目录?”

本身就会花很多时间。

这一步也可以继续交给Agent。

但我不建议一上来就让Agent直接归档。

更稳妥的做法是:

归档前先盘点,归档时只复制,归档后再核对。

一、归档前,先把原始资料保护好

第一原则是:

客户原始资料不要动。

最好保留一个独立目录,例如:

00-客户原始资料/

后面的:

分类;

重命名;

整理;

生成底稿

都不要直接在这个目录里操作。

Agent归档时,应当从原始资料中读取文件,然后:

复制到尽调目录,而不是移动原文件。

这样即使后面发现分类错误,也始终可以回到客户最初提供的材料。

二、正式归档前,先做一次文件盘点

不要拿到几百份文件就直接开始复制。

先让Agent回答几个最基础的问题:

总共有多少个文件;

分别是什么格式;

哪些文件无法读取;

哪些文件可能重复;

哪些文件存在多个版本;

有没有压缩包、加密文件、损坏文件或者空文件。

最好先形成一份简单的:

归档前文件清单。

这样你至少知道:

“我开始的时候到底有多少份材料。”

这个数字后面非常重要。

三、确认尽调目录已经正确建立

正式归档以前,还应该检查上一项工作生成的尽调目录。

重点看:

有没有漏掉尽调清单事项;

序号是否正确;

一级、二级、三级目录是否对应;

有没有重复编号;

有没有Agent自行增加的目录。

确认:

尽调清单和文件夹结构已经一一对应

以后,再开始归档。

四、归档标准还是原来的尽调清单

这里最重要的一点是:

不要再让Agent自己重新分类。

前面已经按照尽调清单建立了目录,那么现在归档材料时,也应该继续按照这一套编号。

也就是说:

先看文件内容,再判断它对应尽调清单里的哪一个序号。

而不是让AI重新创造另一套分类。

五、不要只根据文件名归类

客户提供的文件名经常并不规范。

比如:

扫描件1.pdf

微信文件_20260820.pdf

最终版.docx

附件3.pdf

如果只看文件名,根本不知道是什么。

Agent应该实际读取文件内容,再判断:

这是营业执照;

这是股权转让协议;

这是专利证书;

还是重大销售合同。

所以任务应该要求:

以文件实际内容为主要判断依据,文件名只能作为辅助。

六、归档时只复制,不直接移动原文件

正式归档时,Agent执行的动作应该是:

读取原始材料;

判断对应尽调序号;

复制到相应文件夹。

而不是:

剪切;

移动;

删除;

覆盖。

如果客户以后又补了一批材料,也继续放进:

00-客户原始资料/

然后对新增材料执行同样的归档流程。

七、一个文件可能同时对应多个尽调事项

比如一份股东协议里可能同时涉及:

股权结构;

公司治理;

优先购买权;

董事会安排;

重大事项表决机制。

更好的方式是:

确定一个主要归档位置,同时在材料索引表中标记其他关联事项。

后面制作对应底稿时,再根据索引找到原文件。

八、无法判断的文件不要强行塞进去

有些材料可能:

内容不完整;

扫描模糊;

只有签字页;

缺少正文;

文件名称和内容都无法确认。

这时候最危险的做法是:

AI为了完成任务,硬找一个目录放进去。

正确做法应该是:

单独放到:

待确认/

并进入:

未归类文件清单。

所以自动归档有一个基本原则:

宁可暂时不分类,也不要错误分类。

九、归档时可以顺手识别重复和版本

Agent归档的时候,还可以同时发现:

两份文件完全相同;

同一合同有扫描版和Word版;

同一章程存在多个版本;

文件名不同但内容基本一致。

这类文件不要直接删除。

只需要标记:

疑似重复

或者:

存在多个版本。

十、文件名可以规范,但必须保留原始文件名

比如客户提供:

附件2.pdf

Agent识别出来其实是:

2025年第一次股权转让协议。

复制到尽调目录以后,可以命名成:

2025年第一次股权转让协议.pdf

这样后面查找会方便很多。

但材料索引表里必须同时保留:

原始文件名。

十一、归档以后,先生成“材料索引表”

Agent完成归档后,不要只告诉你:

“归档完成。”

最好同时生成:

材料索引表.xlsx

至少列明:

原文件名;

文件内容;

对应尽调序号;

归档路径;

关联事项;

版本/重复情况;

备注。

以后找材料、整理底稿、做缺失清单,都可以直接使用这张表。

十二、归档完成后,一定要做数量核对

这是整个流程最后非常重要的一步。

比如归档前一共有:

286个文件。

归档完成以后,Agent应该告诉你:

成功归档:260个;

待确认:12个;

疑似重复:8个;

无法读取:6个。

合计仍然应该能够对应:

286个原始文件。

如果前后数量对不上,就说明:

可能有文件遗漏;

某些文件没有被处理;

或者统计规则出了问题。

十三、最后再检查几类异常材料

归档后尤其应该单独查看:

无法读取的文件;

未归类文件;

疑似重复文件;

存在多个版本的文件;

一个文件关联多个事项的文件;

Agent判断置信度较低的文件。

正常材料可以交给Agent批量处理。

真正需要人工时间的,应该集中在这些:

异常项。

十四、完整流程其实只有四步

第一步:保护原件

客户原始资料单独保存,不修改、不移动。

第二步:归档前盘点

统计文件总数,识别重复、版本、损坏和无法读取文件。

第三步:按照尽调清单归档

读取文件实际内容,按照既有尽调序号复制到相应目录。

第四步:归档后核对

生成材料索引表、异常清单,并核对归档前后的文件数量。

直接复制的实战提示词

请对【客户原始资料文件夹】执行尽调材料归档。归档前先盘点全部文件,统计总数,并识别无法读取、疑似重复、多版本及其他异常文件;客户原始资料不得修改、移动或删除。随后以文件实际内容为主要依据,严格按照已经建立的【尽调目录】及尽调清单原有序号进行归类,将文件复制至对应目录,不得自行重新分类。无法确定归属的文件放入【待确认】;涉及多个事项的,确定主要归档位置并记录关联序号。完成后生成【材料索引表.xlsx】和【异常文件清单.xlsx】,并核对归档前文件总数与“已归档、待确认、无法读取等”处理结果是否一致,发现遗漏或数量不一致时单独说明。

最后记住一句话

自动归档不是:

把文件塞进文件夹就结束。

真正完整的流程应该是:

归档前知道自己有什么,归档中知道每份材料去了哪里,归档后确认一份都没有丢。

这样Agent整理出来的尽调资料,后面才敢真正拿来做报告。

内容同步自 GitHub 仓库,仅作为工具教程与工作流说明。

CONTACT

联系李成律师

扫描二维码添加微信,沟通法律 AI、非诉业务及相关合作事项。

手机端可点击二维码查看原图并长按识别。

李成律师微信二维码扫码添加微信