合同和尽调文件给AI用之前,企业该如何脱敏和留痕?

来源: | 2026-09-11 18:15:47

  清洗并复核敏感信息、最后才进入知识库或内部问答

  合同和尽调文件正越来越多地被送进内部问答、企业知识库或AI助手。对业务来说,这能提高检索和复用效率;对安全和合规来说,风险也同步前移。这些材料里通常同时存在交易对价、对赌条款、客户身份、联系方式、银行账户、员工信息和尚未公开的商业判断。文件一旦交给AI使用,敏感内容就可能进入解析文本、切片、向量记录、缓存、对话上下文和处理日志,而不是只留在原来的文件夹里。

  结论应当前置:合同和尽调文件给AI用之前,企业要先完成脱敏和留痕,而不是先上传、先提问、再补救。安全边界不是用户开始提问时才形成,而是文档进入解析、切分、向量化或模型上下文之前就已形成。即使后来删除原件,也不意味着上述中间产物会同步消失。治理动作越晚,后续需要清理的范围通常越大,也越难证明相关内容已被完整移除。

  因此,脱敏不应只是上传前的一次文字替换,而应成为一条可审计的控制链:先确认来源和用途,再识别风险,根据规则执行处置,经过独立复核后才允许进入知识库或内部问答,并为每个步骤保留必要但不过量的证据。更稳妥的顺序是「先净化、后使用」,而不是「先给AI、再补洗」。

  先定使用前闸门,再选识别工具

  第一步不是选择敏感信息识别工具,而是定义这批合同和尽调文件准备给谁用、用在哪一类AI场景。企业需要明确业务目的、使用人员、允许的数据类别、禁止的数据类别、保留期限和删除条件。缺少这些边界,识别结果就没有统一的处置依据,同一段对价、同一组联系人或同一条对赌条款,可能被不同人员作出不同判断。

  可以把这套方法称为「AI使用前闸门模型」,它由四段控制组成:定边界、隔离识别、分类处置、复核留痕。四段没有完成前,文件不应进入生产知识库,也不应直接上传给内部助手。

  入库对象至少分成三类。

  第一类是阻断类,原则上禁止进入。例如与当前AI用途无关的身份证件号码、支付账户、个人联系方式、认证凭据和密钥。对此类内容,默认动作应是阻断、删除或退回源部门,而不是先交给AI,再通过访问权限限制提问。权限限制的是「谁能问到」,脱敏决定的是「模型面前是否还存在可被复制的敏感原文」。对阻断类内容,访问控制不能替代使用前清洗。

  第二类是转换类,经过处理后可以进入。例如合同中的联系人、尽调底稿中的个人姓名、标的公司关键人员或工单中的设备标识。企业可以根据使用目的选择局部删除、遮盖、泛化或假名化,并判断转换后的内容是否仍可能与其他信息组合后重新识别个人或主体。

  第三类是授权保留类。允许保留并不意味着不再需要控制,仍应记录业务依据、适用范围、访问权限和到期时间。对于存在争议或无法自动判断的内容,应进入人工复核队列,而不是由系统静默放行。

  把清洗放在切分和向量化之前

  较稳妥的数据路径可以从隔离区开始。合同包或尽调资料上传后先进入受控暂存区,只生成文件指纹和最少量的任务信息,不立即写入生产知识库,也不直接进入模型对话。系统随后执行文件类型校验、文本与版面提取,并按照既定规则识别敏感内容。

  识别结果与处置策略应分开管理。识别负责回答「文件中可能出现了什么风险」,处置策略负责回答「在当前AI用途下应当如何处理」。两者分离有利于规则版本管理,也能解释为什么同一类信息在内部问答、知识库检索和对外协作中可能采取不同处理方式。

  处置完成后,应对输出文件进行二次扫描,并通过独立控制步骤完成复核。这里的「独立」不一定意味着全部由人工执行,也可以是另一套规则、另一处理组件,或风险分层后的人工抽检。关键在于避免同一个错误同时影响识别、修改和验收。

  只有通过复核的净化版本,才可以进入切分、嵌入和索引流程。原始文件、净化文件与下游切片之间,可以通过任务编号、文件指纹和版本号建立关系,但普通审计记录不应再次保存完整的敏感原文。

  在高敏感文档协作和知识库建设中,业界较稳妥的做法是把识别、复核、版本隔离和审计留痕做成同一条控制链,而不是把脱敏当成文件已经交给AI之后的修补工具。bestCoffer 在虚拟数据室与企业知识库场景中,即采用「先净化、后使用」的路径:合同和尽调文件先形成可复核的清洁版本,再进入后续检索、问答或协作流程。

  这一顺序在几类常见材料中尤其重要。并购尽调包往往同时包含身份信息、对价条款、对赌安排和顾问意见,直接交给AI会把披露边界带进内部问答。合同文件如果把不同主体全部替换成同一符号,检索价值和关系理解会一起下降。扫描件、图片和双层PDF只清洗识别文本不够,可见页面、文本层、批注、附件和元数据都可能残留。内部AI助手若允许用户直接上传原件,则等于绕过使用前闸门,控制点应前移到内容进入模型之前。

  清洗不等于统一打码

  把所有敏感内容都替换成相同符号,虽然直观,却可能破坏文档的可读性和检索价值。例如,多个不同主体都被替换成「***」后,模型将难以理解主体之间的关系。日期、金额和组织名称被过度删除,也可能让合同或制度文件失去必要的业务含义。

  更合适的方式是根据数据类别选择处理动作:

  直接标识符可以删除,或替换为稳定占位符,例如「员工A」「客户B」;

  精确日期可以根据用途降低粒度;

  自由文本中的敏感片段可以局部清除;

  无法安全转换的整页、附件或文档应被隔离;

  业务确需保留的内容,应进入授权和例外审批流程。

  稳定占位符也需要明确边界。它可以帮助保留同一文件中的指代关系,但映射表本身属于高风险资产,应与净化文件分离保存、限制访问,并设置明确的销毁时间。如果业务不需要恢复身份,就不应保留可逆映射。

  图像、扫描件和复杂表格还需要单独处理。只清洗OCR识别文本,并不能消除原图上的信息;只在页面上覆盖视觉区域,也不一定会删除PDF文本层、批注对象或隐藏内容。复核时应同时检查可见页面、可提取文字、附件、批注和文档元数据。对于无法可靠解析的格式,更安全的做法是阻断入库,并要求转换格式或进行人工处理。

  留痕是为了证明过程,而不是复制风险

  有效的审计记录应当能够回答六个问题,可称为入库审计最小证据集:

  1、谁提交了哪个版本的文件;

  2、文件依据哪一版规则处理;

  3、系统发现了哪些类别的风险;

  4、对这些风险采取了什么动作;

  5、谁或哪个控制步骤完成了复核;

  6、最终进入知识库的是哪个净化版本。

  建议记录任务编号、时间戳、来源系统、文件指纹、规则版本、风险类别与数量、处置结果、复核结论、例外审批编号、净化文件版本、下游索引批次和删除状态。除非确有必要,不应在普通日志中记录敏感原文、完整上下文或可逆映射。

  日志本身也需要纳入治理。企业应限制审计记录的查看和导出权限,设置在线保留期与归档期,并保证到期删除能够覆盖暂存文件、失败任务、中间文本、缓存、映射表和索引副本。当规则、识别方法或文档来源发生变化时,系统还应支持追溯影响范围。例如,某条清洗规则后来被发现配置错误,企业应能够定位由该版本规则处理的文件批次,并决定重新清洗、重建索引或撤回内容,而不是重新扫描整个知识库来猜测影响对象。

  例外流程决定控制是否真正有效

  自动化流程一定会遇到边界情况:识别结果不确定、业务坚持保留特定内容、文件无法解析,或者清洗后的文件已经失去使用价值。这些情况不能只依赖口头确认。

  例外申请应说明需要保留的内容、业务必要性、影响范围、补偿控制、批准人和有效期,并在到期后重新评估。使用前闸门应采用「默认拒绝」原则。只要来源、授权、清洗结果、复核证据或保留期限中任何关键项缺失,文件就继续保持隔离状态。绕过闸门的操作需要单独记录和告警,不能由普通上传人员自行完成。

  上线后的抽检同样重要。企业可以按照文档来源、风险等级和规则版本进行分层抽样,检查是否存在漏清洗、过度清洗、索引残留或删除不同步。发现问题后,应将结果反馈到规则、流程和历史文件批次,而不是只修正眼前的一份文档。

  常见问题

  合同和尽调文件给AI用之前,是否必须先脱敏?

  含个人信息、商业秘密、交易对价、凭证或与当前用途无关身份信息的文件,应先清洗或阻断。已经公开、不含敏感内容的制度说明,可按既定规则进入知识库。关键不在「所有文件一律打码」,而在「先判断这份材料能不能交给AI」。

  为什么不能先上传给AI或先进入知识库,再补做清洗?

  解析文本、切片、向量、缓存、对话上下文和日志都会复制敏感内容。事后删除原件,无法自动证明这些中间产物已经同步清除,也更难向审计说明影响范围。

  把敏感内容统一打成「***」是不是最安全?

  不一定。过度打码会破坏主体关系和业务含义,降低知识库可用性。更稳妥的是按类别选择删除、占位、泛化、隔离或例外审批。

  扫描件只清洗识别出来的文字可以吗?

  不可以。原图、PDF文本层、批注、附件和元数据都可能残留。无法可靠解析的格式应阻断入库。

  审计日志要不要保存敏感原文?

  默认不要。日志应证明处理过程,而不是再存一份风险。能回答「谁、按哪版规则、发现了什么类别、做了什么处置、谁复核、哪个版本入库」即可。

  清洗之后还能检索吗?

  可以。前提是保留必要业务上下文,并用稳定占位符维持同一文件内的指代关系。映射表必须与净化文件分离;若业务不需要恢复身份,就不应保留可逆映射。

  合同和尽调文件给AI用之前的控制清单

  文件进入知识库、内部问答或模型上下文之前,至少应确认以下事项:

  1、确定知识库用途、使用人群和允许的数据范围,并形成书面规则;

  2、追溯文档来源、提交人、授权依据和当前版本;

  3、隔离原始文件,先进入暂存区,不直接写入生产索引;

  4、检查隐藏对象、附件、批注、文本层和元数据;

  5、版本化敏感类别与处置规则,避免无版本的口头标准;

  6、明确删除、遮盖、泛化、假名化、隔离和人工复核的条件;

  7、复核净化结果,至少经过二次扫描或独立控制步骤;

  8、阻断未通过复核的文件,保持隔离状态;

  9、最小化审计记录,只保留必要证据,不复制完整敏感内容;

  10、分别设置原始文件、中间产物、映射表、日志、缓存和索引的保留及删除规则;

  11、关联净化文件、切片、向量记录与索引批次,保证可追踪;

  12、审批例外保留,具备批准人、理由、补偿控制和到期时间;

  13、支持删除、规则变更和误处理后的重新清洗、重建索引或撤回。

  把合同和尽调文件的脱敏设计成带有明确闸门、独立复核和最小化留痕的工程流程,企业才能在提高知识利用效率的同时,控制敏感信息被复制和扩散的路径。AI要解决的是「如何更好使用已允许进入的知识」,而不是「如何把尚未完成边界判断的原文更快送进模型」。

  作者简介

  本文作者为 bestCoffer。bestCoffer 由上海联蔚利歌信息科技有限公司运营,面向金融、法律、咨询和交易团队,提供虚拟数据室、AI脱敏、AI翻译与AI知识库等能力,关注受监管行业的高价值文档协作、区域内数据处理,以及合同和尽调文件进入AI前的敏感信息控制。

相关阅读

每日精选