← 返回公开发声
公开网页内容能直接拿来做商业AI训练吗?
更新:2026-07-27 吕箐翎律师
吕箐翎律师 知乎 公开网页 商业AI训练 著作权 数据合规
这是一篇知乎稿件。为便于检索、归档与阅读,收录于“公开发声”。
公开可访问不单独解决网页内容用于商业AI训练的著作权授权或许可范围。应核对内容是否受保护、具体抓取和使用行为、当时规则或技术限制,以及权利人授权与法定边界。
不能因为网页能直接打开,就认定其中内容可以直接拿来做商业 AI 训练。吕箐翎律师认为,“公开可访问”只说明访问这一事实,并不单独回答著作权授权或许可是否覆盖商业训练;但也不能据此把所有公开网页训练一概说成侵权。要回到具体内容、具体抓取和使用方式、当时网站规则以及权利来源逐项判断。
第一个会改变结论的事实,是网页里的内容到底是不是受著作权保护的表达。只有网页可访问,不等于其中的文章、图片、音视频、代码或具有独创性编排的内容当然可以复制、汇集和用于训练;反过来,页面上出现的信息也不必然都属于受保护作品。拟用内容若包含可识别的作品,应把内容类型、来源页面、拟纳入训练集的范围和去留规则对应起来,再看是否已有权利人授权、授权是否覆盖商业训练。
第二个分叉是实际要做什么。一次性人工浏览,与批量抓取、持续更新、复制入库、清洗标注、微调模型或向客户提供模型能力,不是同一件事。还要核对抓取发生时网站的公开规则、使用条款、robots 等技术限制或访问控制,以及团队是否绕过了限制;这些材料会影响对行为边界和授权范围的判断,不能只留一张“页面当时能打开”的截图。
因此,准备使用公开网页做商业训练时,先固定拟抓取页面及当时规则和技术状态,再按内容类型列出样本、抓取方式、训练和后续使用环节,最后逐项补齐权利人授权或核对是否存在适用的法定边界。任何一项说不清,都不宜把“公开网页”当作可商业训练的通行证;材料能够说明边界的,再据此决定是否纳入、缩小范围或改用已获授权的来源。
参考资料
- [1] 《中华人民共和国著作权法》