训练数据、模型权重、开源代码都能商用吗?先拆三张表
AI项目里最容易混在一起的,是训练数据、模型权重和开源代码。吕箐翎律师建议先把三类对象分开,再分别核对来源、许可证、使用范围、再分发和客户交付,不能只看“开源”或“可商用”标签。
吕箐翎律师的判断是:AI 项目能不能商用,不能只看页面上有没有“开源”“开放权重”或“可商用”几个字。至少要把训练数据、模型权重、代码和依赖拆成不同对象,分别核对来源、许可证、使用目的、修改方式、再分发和客户交付范围。
第一张表:训练数据从哪里来、准备怎么用
训练、微调、评测、RAG 检索和内部测试,虽然都可能被统称为“给模型用数据”,但使用目的和材料边界不一样。
先记录:
- 数据来自公开网页、客户、员工、合作方、供应商还是内部业务系统;
- 里面是否有作品、数据库内容、个人信息、敏感信息或商业秘密;
- 原来取得数据的目的,是否覆盖训练、微调、评测、检索和客户项目;
- 数据是否会交给境外模型、供应商、标注团队或其他处理者;
- 权利人提出删除、退出或更新时,企业怎样定位数据集和后续版本。
“网页公开可见”不能直接推出可以复制、建库和训练;“客户把资料交给企业”也不当然覆盖模型训练或向第三方供应商提供。训练语料授权不能只写一句“可用于训练”,还要把用途、期限、范围和退出路径写清楚。
第二张表:代码和依赖适用哪套许可证
代码、框架、插件和第三方依赖要按组件、版本、许可证、修改和分发方式核对。开源组件可以商用,不等于没有声明、通知、源代码提供或其他许可证义务;是否触发具体义务,要看实际组件和许可证文本。
可以保留一份与构建制品对应的清单:
- 组件名称、版本、来源和 SPDX 标识;
- 实际采用的许可证文本和例外;
- 是否修改、静态或动态链接、嵌入、打包或单独提供;
- NOTICE、版权声明、源代码提供路径和客户交付材料;
- 当前产品版本、构建时间和对应的 SBOM。
“商用”不是许可证名称,“开源”也不是一份覆盖所有组件的总授权。不要只用一个项目主页或供应商宣传页替代当前交付制品的版本核对。
第三张表:模型权重和模型服务条款单独审
开放权重模型至少要单独记录模型名称、版本、来源、模型卡或使用条款、权重下载时间、允许用途、限制行业、再分发条件和是否允许继续微调。代码许可证、模型权重条款和训练数据来源可能来自不同主体,不能因为某一项标注“开源”,就把另外两项一起写成已经获得许可。
还要分开看三种动作:
- 企业只调用模型服务;
- 企业下载权重,在内部部署或微调;
- 企业把权重、适配器、模型服务或衍生成果交给客户或下游。
这三种动作涉及的访问、修改、再分发和合同范围不同。模型权重可以下载,不等于允许任意行业使用;模型可以内部运行,也不等于允许把权重或微调结果交付给客户。
最高法涉 AI 意见提醒的是争议场景,不是统一通行证
最高人民法院2026年9月7日发布的涉人工智能纠纷案件意见涉及涉AI知识产权纠纷、开源软件、数据使用和事实查明。它说明企业在发生争议时,不能只说“模型自动生成”或“代码来自开源项目”,而应能够还原产品版本、输入数据、组件来源、实际用途和交付方式。
这不等于意见已经为所有训练数据或开放权重模型给出统一许可答案。企业仍要回到具体材料、许可证文本、授权合同、处理关系和使用场景逐项核对。
交付前用三张表合成一份证据包
| 对象 | 先核对什么 | 交付前留下什么 |
|---|---|---|
| 训练数据 | 来源、权利、个人信息、用途、退出和供应商范围 | 数据集版本、来源记录、授权与删除记录 |
| 代码与依赖 | 版本、许可证、修改、分发、NOTICE和源码安排 | SBOM、许可证包、构建版本和交付清单 |
| 模型权重 | 模型卡、条款、用途限制、微调和再分发 | 权重版本、条款快照、模型卡和客户限制 |
如果三张表只能提供一张“开源组件列表”,或者只保存最终模型而不能说明训练数据、代码依赖和权重来源,先不要把产品宣传为“全部开源、无版权风险或可任意商用”。更稳妥的表达是说明已核对的对象、版本、授权范围和仍待确认的边界。
本文仅提供 AI 训练数据、模型权重和开源代码分层审查的一般信息,不替代对具体模型许可证、训练语料、客户合同或交付安排的专项核验。