知识产权数据要用于 AI 分析,公开目录和自由使用不是一回事
国家知识产权局、国家数据局 8 月 26 日发布的意见提出推进知识产权数据资源开发利用和 AI 应用。吕箐翎律师提醒,政策鼓励数据流通不等于企业可以无条件抓取、训练、再分发,先把来源、用途和产品出口分开核对。
国家知识产权局、国家数据局 2026 年 8 月 26 日发布的意见,提出加强知识产权数据资源开发利用,推进分类分级、公共数据资源目录、人工智能应用和高质量数据集建设,并把数据利用嵌入企业研发、成果转化、维权保护和专利预警等过程。
这对做专利检索、竞争情报、技术路线分析或 AI 知识库的企业是一个清晰的业务信号,但不能把“鼓励开发利用”直接理解成“网上能看到就可以随便抓、随便训练、随便卖”。我会把使用链拆成三层。
第一层:数据从哪里来
先记录数据提供方、页面或接口、访问时间、账号权限、使用规则、更新频率和实际取得字段。专利、商标、许可、转让和裁判关联信息可能来自不同系统,公开页面、检索结果、下载文件和第三方数据库的访问条件也可能不同。
“属于公共数据资源”是政策和治理语境中的分类,不自动回答企业能否批量复制、建库、向客户交付或交给境外服务商。实际采集前还要看 robots 或接口规则、账号协议、访问频率、反爬措施、收费授权、数据库权益和产品合同。
如果数据里混有联系人、代理人员或其他可识别个人的信息,还要单独核对个人信息处理依据、最小必要范围、保存期限和删除路径。不能用“知识产权数据”四个字把所有字段一并归为无风险。
第二层:准备拿数据做什么
同一批数据用于人工查询、内部检索、RAG 知识库、模型训练、竞争对手监测、客户报告或公开 API,风险和证明材料并不相同。建立用途表时,至少写清:处理目的、字段范围、是否持续更新、是否交给模型或供应商、是否形成新数据集、是否向客户或下游再提供。
如果客户只购买一次专利检索报告,不能自动推出企业可以把客户项目资料沉淀为通用训练语料;如果某网站允许人工查询,也不能自动推出可以把全部页面复制到自己的商业数据库。用途改变、范围扩大或新增下游时,要重新核对来源规则和合同。
第三层:AI 输出准备支持什么决定
意见提到把知识产权数据用于技术生命周期分析、技术空白点研判、申请前评估、自由实施分析和专利预警。AI 可以帮助整理、比对和发现线索,但输出不是自动形成的侵权结论、授权结论或“没有风险”证明。
使用 AI 做自由实施或预警时,要保留检索日期、数据版本、检索式、模型或规则版本、人工复核、纳入和排除理由、关键专利文本及最终报告。专利法律状态、权利要求范围、同族关系、地域和时间点都可能改变结论,不能只保存模型的一段摘要。
做一张五栏使用表
| 栏目 | 需要写清 | 不能直接推出 |
|---|---|---|
| 来源 | 提供方、接口、规则、时间、字段 | 公开可见即自由复制 |
| 用途 | 检索、训练、RAG、报告或对外 API | 一种用途覆盖所有用途 |
| 处理 | 清洗、关联、标注、版本和供应商 | 加工后就当然取得全部权利 |
| 输出 | 专利线索、预警、FTO 或客户报告 | AI 摘要就是法律结论 |
| 退出 | 停止采集、删除、更新、客户返还 | 停止订阅就等于全部退出 |
国家知识产权局、国家数据局的意见提供的是数据资源开发利用和安全保障方向,不是针对每一家公司发放的通用数据许可证。企业真正要做的是让来源、用途、版本、处理方式和输出验证能够相互对应。
如果现在只能先做一件事,我会抽查最近一份由 AI 生成的专利预警或竞品报告:把底层数据来源、取得规则、检索时间、模型处理范围和人工复核意见补到同一份记录里。缺少其中一项,就把结论收窄为“线索”,不要写成“已确认无侵权风险”。
本文仅提供一般法律信息,不替代对具体数据来源、接口规则、专利权利要求、自由实施分析或客户交付合同的专项核验。