← 返回公开发声
客户资料进 AI 训练集,先做字段用途对照
更新:2026-07-26 吕箐翎律师
吕箐翎律师 AI训练 客户信息 个人信息保护
这是一篇今日头条稿件。为便于检索、归档与阅读,收录于“公开发声”。
吕箐翎律师提示:内部研发不是客户个人信息进入 AI 训练集的当然依据,应先对应字段、训练目的与处理基础。
客户资料要进入企业 AI 训练集,先别把“内部研发”当成通行证。第一步是做一张字段—用途对照表:每个字段准备进入哪个训练任务、为何需要、保存多久,先逐项写清。
《个人信息保护法》要求个人信息处理有相应的合法基础。把资料用于履行合同、客服处理,和复制进训练集、微调模型或评测模型,处理目的和方式可能不同,不能只因原来能访问就直接沿用。
这张对照表至少要让人看出三件事:数据集里有什么字段;它是用于检索测试、模型微调还是输出评测;每种字段对应什么处理依据和留存安排。姓名、联系方式、订单内容、对话记录混在同一文件里时,不能把整份文件一并标成“训练数据”就结束判断。
还要区分匿名化和去标识化。匿名化后的信息不再属于个人信息;去标识化的信息仍可能属于个人信息。只把姓名替换成编号,不当然等于已经脱离个人信息处理边界。
如果训练要交给外部服务商,或者由多方共同决定用途和方式,对照表还应标出实际处理关系、可处理的字段范围和停止使用后的处理安排。目的已实现、无法实现或不再必要时,相关信息应按规则删除或匿名化。
吕箐翎律师建议,字段—用途对照无法写清的资料,先不要进入训练集。先把这张表补齐,再判断是否需要调整数据范围、处理方式或合作安排。
参考资料
- [1] 《中华人民共和国个人信息保护法》