ARTICLE · INTELLIGENCE

战地情报 · 详情页

来自尧图项目组的一线实战观察与深度解析

GB/T 45652-2025落地指南:生成式AI训练数据安全治理与合规实践

GB/T 45652-2025落地指南:生成式AI训练数据安全治理与合规实践 做AI训练数据治理的人应该都遇到过类似的尴尬模型效果刷得挺高一到上线就被内容安全团队拦下来追问训练数据里为什么有一堆不该出现的东西。过去我们处理这类问题基本靠“人工抽查临时过滤”运气好能压住运气不好就等着被用户截图挂到网上。GB/T 45652-2025《网络安全技术 生成式人工智能预训练和优化训练数据安全规范》的出现等于把这种“凭感觉”的治理方式拉回到工程化、规范化轨道上。这篇文章我会站在一线从业者的角度把标准里涉及的预训练和优化训练数据安全问题拆开讲包括它到底约束什么、怎么落地以及我在实际数据管道里踩过的坑和总结的排查方法。这个标准最核心的价值是给生成式人工智能的训练数据划定了一条安全基线。它不只谈“数据要干净”还把数据来源合规、个人信息保护、内容安全、数据投毒防御、训练过程的访问控制这些维度全部整合到一起形成一个可审计、可追踪、可复现的安全框架。不管你是大模型团队的算法工程师、数据中台负责人还是给政企客户交付AI方案的乙方同学后续大概率都要按照这套逻辑去补作业。与其等审查来了再慌不如现在就对照标准把数据安全治理体系搭起来。1. 这项标准到底管什么事、为什么值得大家关注1.1 标准要解决的核心问题生成式AI的训练过程和传统机器学习有个明显的区别传统模型吃的是结构化特征生成式模型吃的是大规模自然语言、代码、图像、音视频数据。数据规模一旦到了几十TB甚至PB级别安全问题的形态就完全变了。GB/T 45652-2025把“预训练”和“优化训练”两个阶段都纳入了管辖范围。预训练阶段对应的是模型从零开始学习语言规律、世界知识的过程数据来源通常是互联网爬取、开源数据集、第三方数据采购优化训练阶段包括指令微调、人类反馈强化学习RLHF、偏好对齐等环节这部分数据往往是人工标注或模型生成的。标准对这两个阶段的差异化要求在于预训练数据量大、来源广核心风险是内容违规、敏感信息泄露、数据投毒优化训练数据量小但质量要求高核心风险是标注偏见、越权指令、不当内容强化。从安全角度看生成式AI最大的风险点不是模型参数本身而是模型把训练数据里的有害内容“内化”了。模型一旦学会后续无论怎么加拒绝策略都可能在某些诱导输入下输出危险内容。所以标准把关口前置到数据阶段本质上是在源头做风险拦截。这套思路和做食品安全是一个逻辑。你不能等菜上桌了才检验有没有毒必须在采购原料、储存、加工每个环节都设卡。训练数据就是模型的“食材”预训练和优化训练则是两道不同的“加工工序”每道工序都要有对应的安全检测点。1.2 标准适用的对象与边界标准适用的对象很明确在中国境内开展生成式AI预训练和优化训练数据活动的组织和个人。这里的“数据活动”不单指自己爬数据、自己训练还包括委托第三方处理、使用开源模型继续训练、购买标注服务等场景。很多人容易忽略的是标准对“受托方”同样有约束。比如你公司把数据标注外包给第三方团队那么你必须对标注流程的数据安全负责外包团队不能私自留存样本、不能把标注数据挪作他用这都需要通过合同和技术手段双向管控。我在项目里见过不少案例数据泄露的源头不是训练团队而是标注众包平台所以这块务必提高优先级。标准的边界并不覆盖推理阶段的实时输入输出过滤它聚焦的是“模型学会什么”。这意味着即使你的模型上线后有内容审核系统兜底也仍然必须满足训练数据安全的规范要求。两者是前后两道防线不能互相替代。如果你所在团队的模型只是做微调或领域适配不必全部重新预训练也仍然要遵守优化训练阶段的数据安全规定。而且微调数据往往涉及特定业务域风险更集中反而需要更细致的人工审查。2. 预训练和优化训练数据安全的关键要求拆解2.1 数据来源合法与授权校验数据来源合法是整份标准里最容易理解、但执行起来最麻烦的一条。预训练语料里大量来自互联网爬虫的文本里面可能包含受版权保护的书籍、新闻文章、用户评论以及未授权的个人信息。标准要求建立来源合规清单明确每一批数据的来源类型、授权状态、采集时间、采集方式等信息。实操层面这意味着每个数据源都要配一份“来源登记卡”。爬取的公开网页要记录robots协议是否允许、内容是否属于个人敏感信息购买的数据集要审查供应商的版权链条是否完整开源数据集要保留许可证信息。很多团队连自己用的训练数据来自哪里都说不清楚这种情况在标准落地时就是重大缺陷。那是不是所有互联网数据都不能用了也不是。关键在于做“合理来源审查”和“风险分级”。比如政府公开数据、开放许可的数据集风险较低个人博主页面、社交平台评论风险较高需要在采集后做重点过滤。标准鼓励建立白名单和黑名单数据源机制而不是一刀切禁用所有爬虫数据。我自己的习惯是给数据源分三级A级是明确授权的数据集和内部业务数据直接放行B级是需要二次处理的爬虫数据进入清洗和过滤流水线C级是高风险的未知来源数据原则上不用除非经过法务和安全的联合评估。这套分级思路和标准的要求是一致的落地时可以减少很多争论。2.2 数据质量与内容安全数据质量不只是影响模型效果还直接关联安全。标准中提到训练数据不得包含违反信息内容安全要求的内容包括各类违法信息以及可能危害国家安全、公共利益的敏感信息。这里需要特别注意的是“隐性问题”比如文本中隐藏的诱导性指令、经过加密或变体处理的敏感内容普通敏感词过滤根本拦不住。内容安全的检测应该分层设计。第一层是基础敏感词和规则过滤能快速剔除明显违规数据第二层是分类模型检测用训练好的内容安全模型去识别复杂语义问题第三层是人工抽检重点检查前两层判定结果中置信度边缘的样本。这个三层结构是我在多个数据集治理项目中反复验证过的比单纯堆关键词库有效得多。另外标准对“垃圾数据”也有明确要求比如广告噪音、恶意灌水文本、反复重复的模板内容。这些数据不直接造成安全事件但会污染模型的语言风格导致生成质量下降间接放大了安全风险。质量清洗和安全过滤不是两条线而是一条流水线上的前后工序。对于预训练这种动辄几TB的数据量全量做人工内容审核不现实。标准实际上认可“抽样检测自动化工具”的组合方式但对抽样比例、检测覆盖维度和复查频率有较高要求。我建议至少保留10%的关键类别数据如涉及个人信息、医疗、金融的语料做全量检测其余数据按批次抽样确保每批数据的安全检测结果可回溯。2.3 个人信息与隐私的去标识化生成式AI最大的隐私隐患是“记忆”。模型可能在训练时记住包含个人电话号码、身份证号、家庭住址的文本片段在推理时被诱导出来。GB/T 45652-2025对包含个人信息的训练数据提出去标识化要求具体措施包括数据脱敏、匿名化处理、差分隐私扰动等。首先要区分两个概念去标识化和匿名化。去标识化是去掉能直接识别个人的字段但结合外部信息仍可能重新识别匿名化则要求即使关联外部数据也无法还原个人身份。标准在不同场景下对这两者的要求不同预训练数据量大、难以逐一审查通常采用去标识化加风险评控优化训练数据量小但目的明确合规要求更严。实操中最常见的问题是用正则表达式匹配手机号、邮箱、身份证号做替换但中文本土语境下个人信息往往隐藏在看似普通的叙述里。比如一条文本写“我在朝阳区XX小区住了五年孩子在三小上学”虽然没有直接出现姓名和身份证号但结合上下文足以锁定特定个人。这类“弱标识信息”需要结合命名实体识别和人工判断。我个人建议在数据管线中加入一个专门的“隐私审查”节点不只是跑脱敏工具还要对高敏感文本片段做聚类分析。把包含地名、人名、机构名、联系方式等实体组合的样本筛出来由人工确认是否需要打码或直接删除。这个环节虽然费人力但在标准审查中得分很高也能有效降低模型泄露隐私的风险。2.4 数据投毒、偏见与对抗性风险防御数据投毒是生成式AI安全领域最专业的话题之一。攻击者可能有预谋地在公开数据集或开源社区投放恶意样本伪装成正常语料让模型学习到后门行为。一旦模型被植入后门可能只在特定触发词出现时才生成恶意内容平时表现完全正常这种隐蔽性让传统评测很难发现。标准对数据投毒防御提出了明确要求建立数据来源可信度评估机制、检测异常样本、验证数据完整性。这里的“完整性验证”可以理解为对数据集的指纹管理比如计算每个数据文件的安全哈希值和统计特征分布。如果某个批次的数据来源发生变化或统计分布与预期偏差过大就需要重新审查。被投毒的数据不一定都来自恶意攻击有时也是数据采集方式不当造成的。比如某次爬虫协议变更导致采集到的内容大面积偏离目标语域可能让模型的风格发生偏移这时候如果没有检测机制团队往往要等到模型生成结果异常才能发现问题。数据投毒防御要做的就是把这种“事后发现”变成“事前拦截”。对抗性风险比如越狱指令、提示注入标准虽然没有要求训练阶段完全免疫但要求在优化训练数据中控制有害问答对的分布不能因为RNLH数据设计不当反而强化了模型的“邪门”能力。实际业务中RLHF数据里如果负面样本比例失衡模型可能会变得过度保守或是学会绕开审核的“暗语”这些都得在数据设计阶段提前规避。3. 在实际落地时怎么把标准变成可执行的数据治理流程3.1 第一步建立数据分级分类台账拿到标准之后我建议第一件事不是急着写算法而是盘家底。把团队目前存量的训练数据全部理一遍搞清楚每个数据集的位置、容量、来源、格式、使用阶段预训练还是优化训练、敏感程度。这个台账是整个数据安全体系的地基没有它后面所有安全评估都是空的。分级维度可以参考三个数据来源风险高、中、低、内容敏感等级极敏感、敏感、普通、使用环节预训练、微调、对齐。三个维度交叉之后就能形成一张矩阵图。比如“高来源风险极敏感内容预训练阶段”的数据集应该优先处理而“低来源风险普通内容微调阶段”的数据集安全检测要求可以适当降低。台账还要和实验记录打通。比如某个模型使用了哪些批次的数据训练这些数据经过了哪些安全处理都要能回溯。标准要求安全措施能够追踪到具体数据批次而不是只停留在“我们做了清洗”这句话。实际上很多团队在应对监管检查时拿不出完整的批次溯源记录这是最容易被扣分的地方。我个人建议用一套数据版本管理工具来维护台账每个数据集不仅记录内容还记录它的来源URL、采集脚本版本、清洗脚本版本、抽样检测报告、处理人、处理时间。养成这个习惯之后无论是内部复盘还是外部审计都能快速给出完整的证据链。3.2 第二步构建清洗与质量评估流水线数据清洗流水线不是简单跑几个脚本它应该是“清洗质检安全检测记录”四位一体的标准流程。我以一个中文语料清洗流程为例说明实际配置时需要考虑的模块第一个模块是格式清洗去HTML标签、去乱码、去重复段落、去低质量句子。这个模块虽然看起来偏“数据工程”但和内容安全直接相关。攻击者经常把恶意内容伪装成图片替代文本或零宽字符如果不先做格式清理后面的文本检测器可能根本看不见这些隐藏内容。第二个模块是内容安全检测包括敏感词过滤、分类模型检测、近义词/变体识别。这里要注意敏感词库要持续更新不能一套词库用一年。生成式AI的语言一直在变攻击者也会用谐音、拆字、英文字母替换等方式绕过过滤。我一般会给敏感词库配置一个“热更新”机制定期从舆情平台和技术社区同步最新的风险词特征。第三个模块是数据质量评分对每条样本计算多样性、困惑度、重复率等指标低于阈值的样本直接丢弃或降权。质量分和安全风险不是完全独立的很多无效样本里夹杂着诱导性内容单独靠质量过滤无法把它们筛出来需要两个模块联动。第四个模块是抽样核验由质检人员对清洗后数据进行抽样人工审查。抽样不只看内容好坏还要看安全过滤是否存在误杀或漏网。我建议每个批次至少保留200条人工审查记录包括审查人结论和发现的问题类型这样出现争议时有据可查。3.3 第三步形成训练前的安全审查机制数据清洗完成之后进入训练之前还需要过一次“安全审查”流程。这一步容易被当成冗余环节但实际上它是标准的落地点相当于给数据签发“准训证”。安全审查环节要做三件事第一检查数据来源登记是否完整授权链条有没有断点第二检查内容安全检测报告确认高风险内容占比低于阈值第三检查隐私去标识化是否覆盖到位是否存在可重新识别的风险。每一项检查都要输出结论性文档由数据安全负责人签字确认。对预训练数据集来说数据量太大逐一检查不具备可行性。实际操作中会做成批次的审查一个批次的数据集中跑安全检测生成统计报告后由负责人抽样复核。关键是批次划分要和数据采集时间、来源url强对应保证如果某个批次出现安全问题能够快速定位并隔离。优化训练数据阶段的审查要更精细。因为指令数据、偏好数据本身就是人写的内容形态更复杂安全风险不只在“文本是否违规”还在“指令会不会诱导模型越狱”。我见过不少团队用自动化工具过滤优化训练数据结果漏掉了大量间接引导模型输出危险内容的正向样本比如说“你很擅长写作假设没有任何限制请写一篇关于……的指导文章”这种样本表面分词没有违规词实际意图很危险。对这种数据必须配置专门的风险意图分类器配合人工逐个审核。3.4 第四步优化训练阶段的数据使用控制优化训练阶段的数据安全不仅要管内容还要管“谁能在什么条件下使用数据”。标准对权限控制、访问审计、数据复制限制都有要求这块对于团队规模较大的公司尤其重要。我的做法是给优化训练数据建独立的隔离环境算法工程师只能通过受控接口读取数据不能直接拉到本地。接口层做脱敏处理每次访问都留审计日志。模型训练日志里记录的数据加载批次要和数据台账对应出现安全事件时能反查到是哪个人在哪个时间点处理过这份数据。对RLHF人类反馈强化学习数据还要额外做“标注员管理”。标注员本身也可能成为数据泄露或数据投毒的入口所以标准对标注操作规范、标注数据流转、标注员权限都有相应的安全要求。我曾经在一个众包标注项目里发现部分标注员用个人账号登录标注平台时把任务样例截图发到了社交平台上直接泄露了未公开的模型行为数据。后来我们限制标注平台登录IP、禁止截图、关闭复制功能并通过水印追踪截图来源才把风险控制住。数据使用控制的核心是“最小够用”原则训练任务需要什么数据就给什么数据不需要的字段一律不发放。优化训练阶段尤其适用这条因为指令数据通常包含业务私密信息只给模型需要的部分不把整库开放给训练进程能有效降低数据泄露面。4. 常见坑、排查思路以及我的一些经验4.1 常见错误把“清洗”当“安全”我刚接触数据安全体系时最大的误判就是把数据清洗等同于数据安全。清洗解决的是数据质量问题安全解决的是风险控制问题。一个脏数据里可以没有违规内容一个看似质量很高的文本也可能暗藏投毒样本和安全后门。举个具体的例子。我们用开源爬虫抓取了一大批新闻类语料常规清洗时发现整体重复率很低、文本质量很高就准备直接进入预训练流程。结果安全检测时发现其中夹杂了数千条经过对抗性改写的样本——原文被替换了少量措辞让模型在遇到特定主题时输出错误或有害内容。这些样本单独看没有任何语法问题质量评分也很正常只靠清洗根本发现不了。这种经历让我确定了流程上的铁律清洗流水线跑完之后必须单开一道“安全检测”流程两者使用不同的检测原理和检测工具不能共用一套脚本。清洗脚本负责“能不能用”安全检测负责“敢不敢用”两个问题必须分开回答。所以每次和团队复盘数据事故时我都先问一句你们的清洗流程里是不是有个“看似完备”的安全过滤器但它其实只是另一个关键词表如果是那赶紧重构安全检测模块把模型检测、语义聚类、对抗样本识别这些真正有防御能力的机制补上。4.2 常见问题速查表在实际推进标准落地的过程里团队经常遇到下面这几类问题我把它们整理成速查表方便对照排查。常见问题出现原因排查方法解决建议数据来源登记不完整早期数据没有记录采集链路检查台账中缺失字段比对模型训练日志按批次补充登记无法补录的数据停用敏感词过滤误杀率过高词库过于宽泛缺少语境判断抽样统计被过滤样本的人工复核结论引入分类模型替代部分规则过滤保留规则做兜底个人信息去标识化不彻底只做正则替换没考虑上下文推断对脱敏后文本做重识别攻击测试增加实体关联分析和弱标识识别模块优化训练数据里漏掉诱导性指令检测逻辑只查词面违规对指令样本做意图分类和人工审查配置独立的风险意图分类器提高人工抽检比例数据投毒样本批量混入爬取源被污染或开源数据被篡改对比数据统计指纹、安全哈希校验建立数据源信誉机制对高风险源做全量检查RLHF负样本比例失衡标注员对安全标准理解不一致统计正负样本的分布和标注一致性编写标注安全手册定期校准标注口径审计时无法提供批次证据安全记录散落在多套系统里核对模型训练记录和数据处理记录的时间戳统一用数据版本管理工具归档所有安全处理记录多团队协作时安全标准不统一各团队自行理解规范要求对比不同团队产出的数据质量报告制定企业内部安全SOP安排统一培训4.3 对中小团队和个人的落地建议如果你是中小团队可能没有专职安全工程师也别直接照搬大厂的完整方案先抓重点。标准虽然覆盖面很广但真正容易引发事故的环节其实就那么几个数据来源有没有合规风险、个人信息有没有暴露、内容安全有没有明显漏项、数据投毒有没有基础防御。对于个人开发者或者小型团队我建议从“最小安全集”开始把数据集来源记录写成简单的CSV或表格把内容安全检测挂到清洗脚本后面把个人信息去标识化做成一个独立的处理函数写进数据流水线。不要一上来就铺开搞大数据平台工具链先把这几个基础动作跑顺。开源工具方面目前市面上已经有不少语义内容安全模型和隐私检测工具可以直接集成到数据流水线中。你是自建还是采购取决于团队的技术积累但无论怎么选都要保证检测结果可留存、可回溯。标准要求的是“证明你做了”如果你的安全检测没有日志记录那在合规审查时等于没做。预算有限的情况下合理使用开源模型做安全分类和实体识别可以大大降低成本。但要注意开源模型本身也可能存在偏见或漏洞用在安全检测环节时要先对模型自身做评测不能信任“开源模型绝对可靠”这个假设。最后分享一个我个人的经验标准落地最难的从来不是技术而是让团队每个人都认识到“数据安全不是安全部门的事而是所有接触数据的人都该有的习惯”。我在项目里推过一个很简单的办法——每个处理训练数据的人提交数据时必须附上一份类似“安全交付单”的说明列出数据来源、清洗步骤、安全检测结果和风险残留。刚开始大家都嫌麻烦坚持三个月之后团队对数据的安全敏感度明显提升很多隐患在源头就被反馈回来了。这套习惯比任何检测工具都管用。如果你正在做生成式AI的训练数据治理不妨先从这个动作开始再逐步向完整的GB/T 45652-2025体系靠拢。
RELATED READING

延伸阅读

更多一线实战笔记与深度复盘,助您持续精进