竞争对手网页公开,能抓取、建库或接入 RAG 吗?先别把“看得到”当成“能使用”
这是一篇微信公众号稿件。为便于检索、归档与阅读,收录于“公开发声”。
竞争对手网页数据可公开访问,并不直接回答能否抓取、建库或用于 RAG。企业应依次核验进入路径、数据对象、取得与使用方式,以及竞争影响。
产品团队常把这件事说得很轻:竞争对手官网没有登录墙,网页也能被搜索引擎检索到,抓下来做竞品库,再接进 RAG 给销售或研发使用,应该没有问题。
这个判断跳得太快。网页公开可访问,当然是重要事实;但它并不等于数据可以被任意、持续地获取和使用,更不能直接推出“内部使用就没有竞争风险”。对竞争对手网页数据的项目,先不要急着问“用了没有爬虫”,应当按取得路径、数据对象、取得和使用方式、竞争影响的顺序核验。
第一关:先看你是怎样进入的,而不是先给网页贴上“公开”标签
同样是一个能在浏览器里打开的页面,进入条件可能完全不同:是否需要登录,是否依赖接口权限,是否有验证码、访问频控或其他技术管理措施,团队是否为了持续获取而绕开、规避或破坏了这些条件。
这一步排在最前面,是因为“公开”描述的通常只是某一次访问结果,不能说明取得过程没有边界。若项目需要绕开既有的访问控制,后续即使只取少量字段、只给内部系统使用,也不能靠“网页本来能看”把该问题略过。
2025 年修订的《反不正当竞争法》第十三条将经营者以欺诈、胁迫、避开或者破坏技术管理措施等不正当方式,获取、使用其他经营者合法持有的数据,并损害其合法权益、扰乱市场竞争秩序的情形纳入规制。条文原文可见:中国人大网《中华人民共和国反不正当竞争法》。
如果进入路径没有触及这些问题,判断也还没有结束。因为下一步要看的不是“能不能进”,而是究竟拿了什么、拿了多少。
第二关:再把“网页内容”拆成具体数据对象、范围和频率
团队说“只抓公开信息”时,往往把对象说得过于笼统。产品名称、价格展示、案例页面、客户评价、库存状态、更新节奏,可能被一次性摘录,也可能被高频、批量、持续同步;它们在项目中承担的作用并不相同。
因此,需要先固定数据对象和边界:取的是哪些页面或字段,覆盖什么时间段,抓取频率如何,是否保留历史版本,是否把零散展示内容重新组织成可检索、可比较的数据库。没有这组事实,就无法判断项目实际接触的是有限的公开表达,还是在持续复制、积累对方经营数据。
这一步之所以不能和“是否登录”合并,是因为无登录访问只说明入口条件相对开放,不说明获取范围当然合理。范围和频率一变,项目的实际影响也会随之变化。
第三关:对象和范围明确后,才看取得方式与 RAG 的实际用途
“接入 RAG”不是一个可以自动降低风险的用途标签。要继续追问的是:数据如何被取得、清洗、切分、向量化和保留;系统向谁提供答案;答案是否会替代对方页面的查询、形成竞品监测能力,或被用于定价、投放、销售话术、产品决策。
这里的重点不是给某一种技术贴上违法或合规的结论。爬虫、人工下载、接口调用、内部知识库和 RAG 都只是方式或工具;同一工具在不同进入条件、数据范围和使用场景下,结论基础不同。把“不是公开发布”或“只在公司内部问答”当作终点,恰好会漏掉取得方式与使用方式本身。
也因此,项目材料不应只留一份技术方案。应把实际访问记录、权限与频控情况、字段清单、抓取频率、数据保留规则、RAG 可回答的范围及业务使用者一并对应起来。它们不是文末备查清单,而是为了回答上一关留下的具体疑问:团队到底如何把对方的数据转成自己的能力。
第四关:最后落到是否损害竞争权益、扰乱竞争秩序
前面三关回答的是“如何取得、取得什么、怎样使用”;最后才有条件判断这种做法对对方合法权益和市场竞争的影响。比如,项目是否利用持续获取的数据替代对方投入形成的服务或资源,是否对其正常经营造成可识别影响,是否借此取得竞争优势。这里不能只凭项目名称或单一技术动作下结论。
顺序不能倒置。若一开始就问“有没有造成损失”,很容易在事实还不完整时作出空泛判断;若只看“网页是否公开”,又会把入口事实误当成全部结论。竞争影响需要建立在前述进入路径、数据对象、范围频率和实际用途已经被固定的基础上。
先固定的不是“能不能抓”,而是项目事实
对竞争对手公开网页数据,较稳妥的起点不是一句“可以抓”或“不可以抓”,而是先固定:进入时是否存在登录、接口权限、验证码或频控等条件;抓取了哪些数据、覆盖多大范围、以何种频率持续;数据怎样取得并在 RAG 或其他业务中使用;这些使用与竞争对手权益、竞争秩序之间可能形成什么关系。
公开可访问只是这条判断链的起点之一,不是抓取、建库或用于 RAG 的通行证。事实不足时,应先补齐上述项目记录,再就具体方案作针对性评估,而不对项目预先下最终违法结论。
参考资料
- [1] 《中华人民共和国反不正当竞争法》