Skip to content
返回系列目录
查看 GitHub 源文件

源文件:https://github.com/lennonli/licheng-AI-tutorials/blob/main/docs/agent-practice-51-client-data-security-ABL-20260902-V1.md

AI实战51|客户资料能不能交给Agent?先把保密、脱敏和数据出境这几关过了

律师用AI以后,有一个问题迟早都会遇到:

客户资料到底能不能直接交给Agent?

  • 合同;
  • 尽调底稿;
  • 身份证;
  • 银行流水;
  • 劳动人事资料;
  • 诉讼证据;
  • 未公开交易信息。

这些材料本来就是律师每天处理的内容。

如果完全不用AI,很多工作效率会明显下降。

但如果什么都直接往AI里扔,又显然不合适。

律师本身就负有保密义务。《律师法》第三十八条明确要求律师对执业中知悉的国家秘密、商业秘密、当事人隐私以及委托人不愿泄露的信息承担保密义务。(全国人民代表大会)

所以我的基本原则不是:

敏感资料一律不用AI。

而是:

先判断资料是什么级别,再决定AI应该怎么用。


一、第一步:先把“用于模型训练和优化”关掉

这是最基础的操作。

现在很多AI产品都会提供类似:

  • 用于改进模型;
  • 帮助优化服务;
  • 训练模型;
  • 数据共享

之类的选项。

如果准备用Agent处理工作资料,我一般建议第一件事就是:

把这类功能关闭。

尤其不要拿处理客户材料的工作账号,同时参与模型训练或者产品改进计划。

但这里要注意:

关闭模型训练,不等于数据完全不经过服务器,也不等于数据一定零留存。

训练、日志、临时缓存、服务端保存、人工访问、第三方子处理者,其实是不同问题。

所以如果一个AI工具要长期用于律师工作,最好进一步搞清楚:

  • 数据会不会用于训练;
  • 保存多久;
  • 服务器在哪里;
  • 谁可以访问;
  • 能不能删除;
  • 企业版和个人版的数据规则是否不同。

如果律所能够使用明确承诺不用于训练、并提供数据管理能力的企业版或者API服务,一般比随便使用个人账号更适合专业工作。


二、普通客户资料,也不要习惯性“整包上传”

即使客户没有特别限制,也建议遵守一个原则:

最少必要。

比如只是想让AI分析一份合同中的违约责任,

没有必要同时把:

  • 营业执照;
  • 法定代表人身份证;
  • 银行账户;
  • 其他几十份合同

全部交给它。

能只给一份文件,就不要给整个项目目录。

能只给相关章节,就不要给全部底稿。

很多AI保密问题最简单的解决办法,其实不是更复杂的技术,而是:

不要把没有必要的数据给AI。


三、客户明确要求“不得上传网络”,不要直接把原文件交给云端AI

有些客户会明确要求:

  • 项目材料不得上传互联网;
  • 不得上传第三方平台;
  • 不得使用外部AI系统。

这种情况下,首先应该尊重客户约定。

不能简单理解成:

“我关闭模型训练了,所以可以上传。”

这是两回事。

如果客户允许:脱敏后使用外部AI,那么可以先在本地进行脱敏。

但如果客户要求的是:任何项目资料及衍生信息都不得上传第三方网络服务

那本地脱敏也不能被当成绕过客户要求的方法。

这时整个处理流程就应该留在本地。


四、一个很好用的思路:先在本地脱敏,再交给Agent

比如原始材料里写着:

张三,身份证号440XXXXXXXXXXXXX,手机号138XXXXXXXX,北京某某科技有限公司实际控制人……

真正让AI分析某个法律问题时,很多时候根本不需要知道:

  • 张三是谁;
  • 真实身份证号是什么;
  • 真实公司名称是什么。

完全可以先在本地转换成:

【自然人A】,身份证号【已脱敏】,手机号【已脱敏】,【目标公司】实际控制人……

然后再交给Agent分析。

这样既保留了法律关系,

又减少了真实个人信息和商业信息暴露。


五、本地脱敏可以直接用现成的GitHub项目

如果不想自己写脚本,可以看一个比较实用的开源项目:

CN PII Anonymization

它基于Presidio框架,专门针对中国大陆个人信息做了扩展,可以本地识别和处理:

  • 手机号;
  • 身份证;
  • 银行卡;
  • 护照;
  • 邮箱;
  • 姓名;
  • 地址

等信息,还支持文本和图片脱敏,并结合PaddleNLP和PaddleOCR处理中文内容。(GitHub:CN PII Anonymization)

底层的Presidio本身也是一个成熟的开源隐私处理框架,可以识别、删除、替换、掩码或者匿名化个人信息。(GitHub:Presidio)

当然,自动脱敏不能完全相信。

Presidio自己也明确提醒:自动识别无法保证发现所有敏感信息。

所以律师实际使用时,我更建议:

本地程序先脱敏一次,人工再快速检查一次,然后才上传。

尤其要重点看:

  • 人名;
  • 公司名称;
  • 项目名称;
  • 地址;
  • 账号;
  • 特殊交易金额;
  • 案件名称

这些有时候并不属于传统身份证件信息,但组合起来一样可以识别具体客户。


六、再进一步:有些材料干脆不要上传,直接让模型在本地跑

如果客户对数据安全要求比较高,但材料并不属于国家秘密,

还有一种更彻底的方案:

模型也放在本地。

现在已经不一定需要很大的服务器才能做到。

千问Qwen就是比较适合中文本地处理的一套模型。

官方Qwen3项目已经提供了多种本地运行方式,包括:

  • Ollama;
  • llama.cpp;
  • LM Studio;
  • MLX-LM。

(GitHub:Qwen3官方仓库)

最简单的方式之一就是:Qwen3 + Ollama

官方Qwen文档已经直接给出了Ollama运行方式,本地可以选择不同大小的模型。

如果使用Apple Silicon的Mac,还可以用:MLX-LM + Qwen3

MLX-LM本身就是专门针对Apple Silicon运行大模型的框架,目前已经支持Qwen3等模型。

对于:

  • PDF摘要;
  • 材料分类;
  • 信息提取;
  • 简单合同分析;
  • 文档总结

这类任务,小模型其实已经可以完成很多基础工作。

对于高度敏感项目,可以先让本地模型完成:

解析、提取、脱敏、摘要

然后只把真正需要复杂推理、且已经充分脱敏的内容交给更强的云端模型。

这个流程往往比“所有原始资料直接上传云端”更稳妥。


七、但有一个边界必须特别强调:国家秘密不是“装个本地模型”就解决了

这个问题一定要单独说。

如果材料依法属于国家秘密

不能简单采取:

“电脑断网 + Ollama + 千问”

然后认为已经合规。

《保守国家秘密法》明确禁止使用非涉密信息系统、非涉密信息设备存储或者处理国家秘密;涉密信息系统还需要按照国家保密规定和标准建设,并经检查合格后才能投入使用。(广东省通信管理局)

2024年修订的《保守国家秘密法实施条例》也明确要求涉密数据的收集、存储、使用、加工、传输、提供等活动符合国家保密规定。

所以对于真正的国家秘密,

我的建议很简单:

普通互联网AI不要用,普通个人电脑上的本地AI也不要擅自用。

如果确有AI处理需求,

应当在符合涉密信息系统管理要求的环境中,由有关单位按照自身保密制度和审批要求决定。

这一类问题已经不是简单的:

“哪个模型更安全。”

而是:

整个计算环境是不是涉密合规环境。


八、另外一个经常被忽视的问题:数据出境

如果律师使用的是境外AI服务,

并且项目资料实际被传输到境外服务器,

还可能产生个人信息跨境提供的问题。

这里也不能简单理解为:

“用了国外模型就一定违法。”

真正要看的是:

数据实际上有没有向境外提供。

但如果服务确实把境内收集的个人信息传输到境外处理,就需要进一步考虑《个人信息保护法》和数据出境规则。

《个人信息保护法》第三十八条对向境外提供个人信息设定了专门要求。(全国人民代表大会)

现行《促进和规范数据跨境流动规定》进一步按照数据量和敏感程度区分了不同情形。例如,非关键信息基础设施运营者自当年1月1日起累计向境外提供达到一定数量的个人信息或者敏感个人信息时,可能需要订立个人信息出境标准合同、进行个人信息保护认证,甚至申报数据出境安全评估。(中国政府网)

而且即使低于相关数量、可以免于履行某些数据出境机制,也不等于所有个人信息保护义务都消失。向境外提供个人信息仍需要根据具体情况履行告知、单独同意、个人信息保护影响评估等义务。(中国政府网)

所以如果日常大量处理:

  • 员工信息;
  • 客户信息;
  • 消费者信息;
  • 银行流水;
  • 身份证件;
  • 健康信息;
  • 诉讼材料,

就不应该只考虑:

“这个AI好不好用。”

还应该考虑:

“这些数据到底传到哪里去了。”


九、所以律师日常工作,我更倾向于优先考虑国内模型

尤其涉及大量中文客户资料的时候,

在模型能力满足工作的情况下,我一般会优先考虑:

境内服务 + 明确保密设置 + 最少必要上传。

原因并不是简单地说:

国外模型不安全。

而是境外服务一旦涉及实际数据出境,

律师和律所还要多考虑一层:

跨境个人信息和数据合规。

国内模型当然也不是:

“用了就自动安全。”

同样要检查:

  • 模型训练设置;
  • 服务协议;
  • 数据保存;
  • 访问权限;
  • 客户约定;
  • 个人信息保护。

只是如果数据始终在境内处理,

通常可以减少一层数据跨境问题。


十、最后可以把律师AI资料分成四档

我现在比较倾向于这样判断。

  • 第一档:公开资料。

法规、公开判决、公开公告。

正常使用AI即可。

  • 第二档:普通客户工作资料。

关闭模型训练;

按最少必要原则上传;

尽量使用受控账号和国内服务。

  • 第三档:高度敏感或者客户明确限制上传的资料。

优先本地脱敏;

必要时直接使用本地Qwen等模型;

脱敏后的内容能否上传,仍要看客户具体要求。

  • 第四档:国家秘密。

不要使用普通互联网AI;

也不要认为个人电脑本地部署模型就自动合规;

按照涉密信息系统和单位保密制度处理。

这样其实比一句:

“律师能不能使用AI处理客户资料?”

更准确。

真正的问题应该是:

什么资料,可以用什么方式交给AI。


直接复制的实战提示词

text
请在开始处理【项目文件夹/客户材料】前先进行AI数据安全检查,不要直接读取并上传全部资料。请首先识别材料中是否包含客户商业秘密、个人信息、敏感个人信息、身份证号、手机号、银行账户、未公开交易信息及其他需要保密的信息,并根据客户约定判断是否允许使用外部AI服务。对于允许脱敏后处理的材料,先在本地生成【脱敏副本】,使用【客户A/自然人A/金额A/地址A】等占位符替换能够识别具体主体的信息,并保留原始文件不作修改;完成后生成【脱敏检查表】,列明已经处理和仍需人工确认的敏感信息。未经确认,不得将原始客户材料上传第三方AI服务;涉及国家秘密的材料停止处理并提示改由符合保密规定的涉密信息系统处理。

最后记住一句话

律师使用AI,

真正需要建立的不是:

“什么都不能传”的恐惧。

也不是:

“关了训练就什么都能传”的侥幸。

而是一套很简单的判断:

  • 能少给,就少给。
  • 能脱敏,就先脱敏。
  • 能本地,就尽量本地。
  • 真正涉密,不要碰普通AI。

AI可以提高律师效率。

但客户把资料交给律师的时候,

首先交给我们的不是数据。

而是:

信任。

内容同步自 GitHub 仓库,仅作为工具教程与工作流说明。

CONTACT

联系李成律师

扫描二维码添加微信,沟通法律 AI、非诉业务及相关合作事项。

手机端可点击二维码查看原图并长按识别。

李成律师微信二维码扫码添加微信