Skip to content
查看 GitHub 源文件

源文件:https://github.com/lennonli/licheng-AI-tutorials/blob/main/docs/ai-knowledge-base-quality-ABL-20260831-V1.md

AI优先|AI知识库不是越大越好:先解决质量、时效和可追溯性

一说到AI知识库,很多人的第一反应是:

资料越多越好。

把所有合同放进去;

把所有法律文件放进去;

把以前项目资料全部导入;

把网上找到的文章、案例、报告一起塞进去。

看起来知识库越来越大。

但我现在越来越觉得:

知识库最大的风险,恰恰可能是“太多”。

因为AI真正需要的,不是一个塞满文件的仓库。

而是一套:

质量高、来源清楚、持续更新、能够追溯的知识体系。

尤其是在法律工作里。

一个过时法条、一份质量很差的法律意见、一个来源不明的案例摘要,都可能直接影响最终判断。

所以知识库建设的第一目标,不应该是“大”。

而应该是:

可信。

一、知识库最危险的问题,不是缺资料,而是垃圾太多

我们经常说一句话:

Garbage in, garbage out。

垃圾进去,垃圾出来。

这句话放在AI知识库里特别准确。

比如你有1万份法律文件。

其中可能有:

  • 已经失效的法规;
  • 已经修改过的旧版本;
  • 网上转载但内容错误的文章;
  • 质量很差的合同模板;
  • 某个项目里为了谈判临时形成的观点;
  • 没有最终确认的内部草稿。

如果这些内容全部被AI当成“知识”,那知识库越大,风险可能越高。

因为AI未必天然知道:

  • 哪一份可信;
  • 哪一份过时;
  • 哪一份只是参考;
  • 哪一份才是正式依据。

所以知识库建设的第一步,不应该是:

尽量多收。

而应该是:

先筛。

二、法律知识库尤其要重视“现行有效”

法律工作和普通知识库有一个很大的区别:

法律会变化。

  • 法规会修订;
  • 司法解释会更新;
  • 监管口径会调整;
  • 部门规章会废止;
  • 地方政策也可能发生变化。

所以一份两年前完全正确的资料,今天可能已经不能直接使用。

这也是为什么我一直强调:

法律依据必须核验现行有效。

如果一个法律知识库只负责“存”,不负责“更新”,其实非常危险。

例如知识库里同时存在:

  • 2023年的旧规定;
  • 2025年的修订稿;
  • 2026年的最新版本。

AI如果没有明确的版本识别机制,就有可能引用旧规则。

所以法律知识库至少应该尽量保留:

  • 文件名称;
  • 发文机关;
  • 发布日期;
  • 施行日期;
  • 有效状态;
  • 更新时间;
  • 官方来源。

不能只是把一个PDF扔进去就结束。

三、官方来源和二手材料一定要分层

我觉得知识库里一定要区分:

一手来源。

和:

二手分析。

例如:

  • 法律法规原文;
  • 司法解释;
  • 监管部门文件;
  • 交易所规则;
  • 法院正式裁判文书。

这些属于一手材料。

而:

  • 律师文章;
  • 公众号文章;
  • 研究报告;
  • 案例总结;
  • 培训材料。

这些属于二手材料。

二手材料当然非常有价值。

有时候甚至比原始法规更容易理解。

但它们的作用应该是:

帮助分析。

而不是替代正式法律依据。

所以一个比较好的知识库结构应该让AI知道:

  • 如果要回答“法律依据是什么”,优先回到正式来源。
  • 如果要回答“实务上通常怎么处理”,再参考二手材料。

这两类资料不能混成一个层级。

四、高质量项目文件,往往比海量网上资料更值钱

我觉得真正值得长期沉淀的资料,很多时候不是网上能搜到的东西。

而是自己工作中形成的高质量成果。

例如:

  • 已经反复修改过的合同;
  • 最终出具的法律意见书;
  • 成熟的尽调报告;
  • 经过审核的回复口径;
  • 项目复盘;
  • 内部风险清单;
  • 高质量案例总结。

这些资料有一个很大的优势:

经过真实业务验证。

网上可以找到100篇“股权转让协议模板”。

但你自己经过多个项目修改出来的一份成熟版本,可能更有参考价值。

所以我理解的个人AI知识库,不应该只是:

把互联网搬到本地。

而应该更多沉淀:

自己的高质量经验。

这才是真正具有长期价值的部分。

五、不是所有项目文件都应该进入长期知识库

这里又有一个很容易犯的错误:

做完一个项目,就把整个项目文件夹全部塞进知识库。

我觉得没有必要。

一个项目里通常会有大量:

  • 重复文件;
  • 旧版本;
  • 临时草稿;
  • 无效尝试;
  • 客户原始沟通;
  • 格式文件;
  • 中间数据。

这些并不都具有长期复用价值。

真正值得沉淀的可能只有少数内容:

  • 最终合同;
  • 核心修改说明;
  • 最终法律分析;
  • 典型问题;
  • 成熟模板;
  • 关键经验总结。

也就是说:

项目归档和知识沉淀不是一回事。

项目归档是为了完整保存。

知识库是为了未来复用。

这两个目标完全不同。

六、知识沉淀最好增加一个“提炼”过程

我越来越喜欢一种做法:

项目结束以后,不是直接把文件扔进知识库。

而是让AI先做一次提炼。

比如问:

  • 这个项目里有哪些经验值得未来复用?
  • 哪些合同条款具有模板价值?
  • 哪些法律问题具有典型性?
  • 哪些资料已经过时或不应继续使用?
  • 有哪些错误以后不要再犯?

然后生成一份:

项目知识摘要。

以后AI需要参考这个项目时,可以先读摘要。

真正需要细节,再回到原始材料。

这样知识库会干净很多。

七、每一条重要知识,最好都能回到来源

知识库里还有一个很重要的能力:

可追溯。

比如AI告诉你:

“根据某规定,公司需要履行某项义务。”

你最好能够继续问:

  • 来源是什么?
  • 哪一条?
  • 哪个版本?
  • 原文在哪里?

如果AI只能给出一个总结,但无法回到原始文件,那这条知识的可靠性就会下降很多。

所以我认为一个好的专业知识库,不应该只保存:

结论。

还应该保存:

结论是从哪里来的。

例如:

  • 文件路径;
  • 网页来源;
  • 页码;
  • 条款;
  • 发布日期;
  • 版本信息。

对于律师来说,这一点尤其重要。

因为最终工作往往需要的不是:

“AI说这个结论是对的。”

而是:

“我能不能验证这个结论为什么是对的。”

八、知识库应该允许“淘汰”

很多知识库只有新增,没有删除。

今天加100份;

下个月再加200份;

几年以后越来越大。

但真正成熟的知识管理一定应该包括:

删除和淘汰。

比如:

  • 法规已经失效;
  • 模板已经被新版本替代;
  • 某篇研究文章被证明存在错误;
  • 某个内部口径已经不再使用。

这些内容应该:

  • 删除;
  • 归档;
  • 或者明确标记为失效。

否则旧知识会一直和新知识竞争。

所以知识库维护不是:

不断积累。

而是:

积累 + 更新 + 淘汰。

九、可以给知识设置“可信度层级”

我觉得以后做专业AI知识库,可以尝试给资料分层。

比如:

  • A级:正式权威来源

法律法规、司法解释、监管规则、正式裁判文书。

  • B级:内部高质量成果

正式法律意见书、最终合同、成熟项目报告。

  • C级:可靠参考资料

专业机构文章、研究报告、行业资料。

  • D级:临时参考

网络文章、未经验证的总结、初步草稿。

这样AI在检索时,就可以按照可信度排序。

  • 涉及法律结论时,优先用A级。
  • 涉及实务经验时,可以参考B级和C级。
  • D级只能作为线索,不能直接作为结论依据。

这种分层比单纯建立一个巨大文件夹更有意义。

十、知识库不是仓库,而应该是一套动态系统

所以我现在越来越不喜欢“把资料全部塞进去”这种知识库思路。

真正成熟的知识库应该不断做四件事:

  • 收集。

把真正有价值的资料留下来。

  • 筛选。

判断什么值得长期保存。

  • 更新。

确保法规、规则、模板仍然有效。

  • 淘汰。

清理低质量和已经过时的内容。

这其实和人的知识体系很像。

一个优秀的律师,不是因为脑子里记了最多材料。

而是因为知道:

  • 什么重要;
  • 什么可靠;
  • 什么已经过时;
  • 遇到问题去哪里找。

AI知识库也应该一样。

十一、知识库最终服务的是“调用”,不是“收藏”

很多人会有一种收藏习惯。

看到好文章就保存;

看到好模板就下载;

看到案例就扔进文件夹。

几年以后资料很多,但真正工作时还是重新Google。

这种知识库其实没有形成生产力。

所以知识库最后一定要回答一个问题:

AI在真实任务里能不能用到它?

例如:

  • 审合同的时候,AI能不能自动找到类似条款;
  • 做法律研究时,能不能优先找到最新法规;
  • 做IPO问询时,能不能检索到以前类似回复;
  • 做尽调时,能不能调用成熟问题清单。

如果不能,知识库再大,也只是一个电子仓库。

真正有价值的是:

需要的时候能够被正确调用。

十二、先做“小而准”,再做“大而全”

如果让我重新搭一个知识库,我现在大概率不会一开始就追求规模。

我会先建立一个很小的核心库。

比如:

  • 最常用法律法规;
  • 最成熟合同模板;
  • 最有价值法律意见;
  • 少量高质量案例;
  • 经常复用的项目经验。

先保证:

  • 来源可靠;
  • 版本明确;
  • 分类清楚;
  • 可以检索;
  • 可以回溯。

然后在真实工作中慢慢增加。

这样系统虽然一开始不大,但每一条知识都比较可信。

我觉得这比一开始导入几十万份文件更有价值。

所以我现在越来越认为:

AI知识库不是越大越好。

真正重要的是三个词:

质量。时效。可追溯。

特别是在法律、财务、投资这些专业工作里,

知识库最大的价值不是:

“AI知道很多。”

而是:

“AI知道哪些东西值得相信。”

当这一点解决以后,知识库才真正从“文件收藏夹”,变成AI工作系统里的可靠基础设施。

内容同步自 GitHub 仓库,仅作为工具教程与工作流说明。

CONTACT

联系李成律师

扫描二维码添加微信,沟通法律 AI、非诉业务及相关合作事项。

手机端可点击二维码查看原图并长按识别。

李成律师微信二维码扫码添加微信