客户资料进 AI 训练集,先把能识别个人的字段挑出来
这是一篇今日头条稿件。为便于检索、归档与阅读,收录于“公开发声”。
客户资料准备进入 AI 训练、微调或评测时,先把能识别个人的字段单独标注,再核对处理目的、合法基础、供应商关系和删除安排。
先给结论:客户资料准备进入 AI 训练、微调或评测时,第一步不是问“能不能整包导入”,而是先把能识别个人的字段挑出来。
客户姓名、手机号、账号、地址、沟通内容、订单备注,以及能够和其他信息结合识别到个人的字段,都不宜和纯产品参数、汇总统计混在一起处理。哪怕一份表格只有几列涉及联系人,也应先单独标注,再决定后续怎么用。
建议先做一张“字段—目的—接触方—保存”清单:
第一,列出资料来源和字段内容。客户名单、客服记录、合同工单、语音图片等,只要能够识别特定个人,就要按个人信息处理规则继续核查。
第二,写清楚训练到底要解决什么问题,是内部检索、模型微调、效果评测,还是对外提供功能。处理目的不同,所需的合法基础和必要性判断也可能不同。
第三,标出谁会接触这些资料,是否交给模型供应商、外部服务商或其他合作方。获得文件访问权限,不等于取得训练或微调授权;委托处理或向第三方提供时,还要把处理目的、期限、方式、信息种类和保护责任对应起来。
第四,记录匿名化、去标识化或脱敏的实际效果,以及保存多久、如何删除、输出是否可能重新识别。名称被替换,并不当然意味着其他字段组合后无法识别个人。
为什么要先分字段?因为“内部研发”不是自动免责。客户资料进入新的训练、微调或评测流程前,仍要核对处理目的、必要性、个人信息类型、供应商关系和退出路径。《中华人民共和国个人信息保护法》要求个人信息处理遵循合法、正当、必要和明确合理目的等边界;《网络数据安全管理条例》也对生成式人工智能训练数据安全、个人信息保护和删除或匿名化处理提出相应要求。
还要留住一个边界:字段分类只是准入起点,不等于训练集已经合规,更不等于可以立即上线。若来源、授权、接触方或删除安排写不清,先暂停导入,把合同、权限、处理记录和供应商条款补齐,再决定是否继续。
可以把这张清单交给业务、技术和法务共同复核:业务说明用途,技术说明数据流,法务核对合法基础和合同边界。每次确认都留下对应记录,后面才说得清“哪些字段能用、用到哪一步、谁负责退出”。
本文仅提供一般法律信息,不构成对具体数据、合同、模型或企业处理活动的法律意见。
参考资料
- [1] 《中华人民共和国个人信息保护法》
- [2] 《网络数据安全管理条例》
- [3] 《生成式人工智能服务管理暂行办法》