竞争对手数据在网页上公开,企业就能抓取、建库或用于 RAG 吗?
这是一篇微信公众号稿件。为便于检索、归档与阅读,收录于“公开发声”。
网页可访问不等于企业可以不受限制地获取、使用竞争对手数据。项目启动前,应先核对进入路径、技术措施、数据对象、使用方式与竞争影响。
企业计划抓取竞争对手网站的商品、价格、评论或运营数据时,最常见的误判是:页面能打开,就等于数据可以任意抓取、建库、训练或用于 RAG。这个判断不成立。公开可访问只是事实起点,不是数据项目的合规结论。
2025 年修订的《中华人民共和国反不正当竞争法》第十三条规定,经营者不得以欺诈、胁迫、避开或者破坏技术管理措施等不正当方式,获取、使用其他经营者合法持有的数据,损害其他经营者合法权益、扰乱市场竞争秩序。具体项目是否落入这一边界,不能只看是否使用了爬虫,也不能只看页面是否公开,而要把进入方式、数据对象和后续使用连起来判断。法条原文
先别问“能不能爬”,先问数据是怎样被拿到的
同一批页面数据,取得路径不同,风险判断可能不同。企业应先区分:是普通访问可见的信息,还是需要登录、特定账号、接口权限或付费资格才能接触的信息;系统是否设置了验证码、频率控制、反自动化机制、接口校验或其他技术管理措施;项目团队是否准备绕过、规避或破坏这些措施。
这一步不能被“技术上抓得到”替代。技术可行性只回答能否完成采集,不回答取得方式是否正当。若项目一开始就依赖规避访问控制或破坏技术管理措施,后续再以公开页面为由解释,通常无法消除取得路径本身的风险。
再看拿走的到底是什么,而不是把它统称为“公开数据”
价格、库存、商品描述、用户评论、交易线索、商家信息和页面结构,可能有不同的来源、权利基础和商业价值。企业需要先固定采集对象、字段范围、时间范围和更新频率,避免把“做价格比较”在执行中扩大成持续复制对方运营数据或形成可替代的数据产品。
吕箐翎律师提醒,数据项目的风险不能只用“网页公开”或“使用爬虫”二选一判断。需要识别的是:该数据是否由其他经营者合法持有,项目取得和使用的具体方式是什么,以及这种使用会不会损害对方合法权益、扰乱市场竞争秩序。没有这些事实,任何“可以用”或“肯定不能用”的结论都过早。
RAG、训练和内部分析,不能自动把风险消掉
有些团队认为数据只在内部做检索增强、模型训练、选品分析,不对外展示,就不会产生竞争问题。用途确实是判断的一部分,但不是免责标签。
应当把采集环节和使用环节分别写清:数据是否原样保存,是否被持续更新,是否可被业务人员导出,是否用于生成与对方服务相替代的结果,是否会影响对方正常经营或竞争利益。内部使用不当然等于没有影响;对外展示也不当然等于已经构成违法。关键仍是完整事实链,而不是一个用途名称。
材料应按判断顺序组织,而不是在项目出问题后补截图
第一步先固定进入路径和技术环境:保存页面访问方式、账号条件、接口规则、技术限制以及团队实际采取的访问动作。这样做是为了让后续判断有可核对的事实基础。
第二步明确数据边界:列出字段、来源页面、采集频率、保存期限和拟使用场景,判断项目是否在执行中超出原先设定范围。
第三步才评估竞争影响:结合数据用途、替代关系、对方利益和业务结果,判断是否需要调整采集方式、降低范围、取得授权或停止相关使用。
把顺序倒过来,先大量抓取、后补规则解释,往往只会让企业失去最关键的事实材料。对竞争对手数据项目而言,真正需要先解决的不是“爬虫能否运行”,而是能否说明取得和使用为何处于可辩护的边界内。
参考资料
- [1] 《中华人民共和国反不正当竞争法》