什么样的爬虫会涉及违法?
网络爬虫(Web Crawler / Spider)是一种按照预设规则自动抓取互联网数据的程序,是搜索引擎、价格监控、舆情分析、AI 训练数据采集等场景的技术基石。但近年来大量判例表明:爬虫技术本身中立,使用方式却有红线。一旦越界,轻则民事赔偿,重则锒铛入狱。

爬虫本身不违法
爬虫是互联网运转的基础设施。没有爬虫,就没有搜索引擎;很多网站甚至主动欢迎搜索引擎爬虫抓取,以换取曝光和流量。司法实践也明确承认这一点——在奇虎 360 诉百度案中,法院指出 Robots 协议”已经成为维系企业核心竞争力、维系市场有序竞争的一种手段”,正当的数据爬取是被接受和鼓励的。
同时,我国法律从未笼统禁止”爬虫”。《网络安全法》《数据安全法》《个人信息保护法》规制的都是行为而非技术。判断爬虫是否违法,看的不是”你爬了没有”,而是:
- 爬什么——数据内容本身是否受法律保护(个人信息、商业秘密、著作权作品等);
- 怎么爬——是否突破、绕开了对方的技术防护措施;
- 怎么用——是否对数据持有方构成实质性替代、是否破坏市场竞争秩序。
这三问决定了同一个技术动作,是正常的商业行为,还是违法犯罪。
什么样的爬虫会违法?
红线 1:破解防护措施爬数据 —— 非法获取计算机信息系统数据罪(刑法第 285 条第 2 款)
这是涉爬虫案件中最高发的罪名。以下行为均可能触发:
- 破解或绕过验证码、动态令牌等身份校验;
- 伪造 device_id、UA、IP 绕过服务器的身份校验和频率限制;
- 伪装成正常用户模拟登录,抓取仅登录可见的数据;
- 破解接口加密签名、绕过设备指纹检测;
- 使用他人账号但超越授权范围爬取系统数据。
典型案例(全国首例爬虫入刑案):(2017)京0108刑初2384号。被告单位指使技术人员通过伪造 device_id 绕过身份校验、伪造 UA 及 IP 绕过频率限制,抓取今日头条平台的公开视频数据,造成对方技术服务费损失 2 万元。北京市海淀区法院认定构成非法获取计算机信息系统数据罪。
这个案例澄清了一个常见误区:”数据是公开的,爬了不犯法”。法院明确指出:数据公开≠允许任意抓取。平台为数据设置了访问控制措施(权限、频次、方式),突破这些措施获取数据,即使数据内容本身公开,仍可能构成犯罪。
近期案例(2026 年宣判):上海长宁区”商品数据案”。乐某某等 4 人虚设登录身份、切换访问来源、在爬虫脚本中加入破解模块绕过验证码,非法抓取并售卖某平台商品详情数据 11 万余条,违法所得 4.4 万元。4 人分别被判处有期徒刑九个月至一年二个月——单条数据仅赚几分钱,代价却是实刑加罚金。
红线 2:爬取个人信息 —— 侵犯公民个人信息罪(刑法第 253 条之一)
爬取的内容若包含可识别自然人身份的信息(手机号、身份证号、住址、行踪轨迹、账号昵称 + 联系方式等),即使获取手段没有破解任何防护,也可能构成此罪。《个人信息保护法》进一步要求:处理个人信息需有合法事由并取得同意,遵循”最小必要”原则。
典型案例:湖南郴州北湖区法院 2024 年审结的”抖音用户信息案”。朴某等人利用爬虫软件在抖音直播间(包括私密直播间)批量获取用户的抖音号、手机号、昵称等个人信息,用于电话营销引流,非法获利数十万元。4 人均构成非法获取计算机信息系统数据罪,被判处有期徒刑一年三个月至三年六个月。
典型案例:北京朝阳区”租房合同案”。A 公司员工为窃取竞争对手客户信息,串通 B 公司内部员工登录 B 公司业务系统运行爬虫,抓取记载有出租人、承租人公民个人信息的收/出房合同。董某某等人均构成侵犯公民个人信息罪,被判处有期徒刑一年七个月至三年六个月。
红线 3:高频轰炸拖垮系统 —— 破坏计算机信息系统罪(刑法第 286 条)
爬虫对目标网站发起大量请求,导致服务器负载过高、服务瘫痪或严重降速的,可能构成破坏计算机信息系统罪。即使用户”无意”搞垮对方,但明知高频请求会造成影响仍然实施,同样有风险。实践中,控制抓取频率(rate limiting)不仅是礼貌,更是法律上的自我保护。
红线 4:爬取受版权保护的内容 —— 侵犯著作权罪(刑法第 217 条)
批量抓取网络小说、影视剧、原创课程、付费专栏等受著作权保护的内容并传播牟利的,可能构成侵犯著作权罪。曾有案例中行为人爬取网络小说搭建盗版站,最终被判处有期徒刑三年、缓刑四年,并处罚金 40 万元。
红线 5:开发、售卖破解型爬虫工具 —— 提供侵入计算机信息系统程序罪(刑法第 285 条第 3 款)
值得警惕的新趋势:涉爬虫犯罪已从”自己爬”升级为”卖工具让别人爬“,开发、售卖、使用三方分离。司法机关认定”专门用于侵入计算机信息系统的程序”有三要素:
- 具有避开或突破安全保护措施(包括验证措施和反爬措施)的功能;
- 可以未经授权或超越授权获取数据;
- 专门用于侵入用途,无其他合法用途。
典型案例:上海法院审理的”得物 APP 案”。被告人开发并售卖可绕过得物签名认证、图形验证、设备指纹、代码混淆等防护机制的爬虫程序。法院认定其构成提供侵入计算机信息系统程序罪——注意,此人只是卖工具,并没有自己爬数据。
民事红线 1:违反 Robots 协议 / 用户协议 —— 不正当竞争
Robots 协议(robots.txt)是网站在域名根目录下声明”允许/禁止哪些爬虫抓取哪些内容”的技术规范。中国互联网协会《互联网搜索引擎自律公约》要求成员遵守 Robots 协议。司法实践中,违反 Robots 协议抓取虽然不直接构成犯罪,但通常被认定为违反公认商业道德,构成不正当竞争。
经典判例包括:
| 案件 | 裁判要点 |
| 谷米诉元光”车来了”案 | 爬虫更换 IP、破解加密算法,日均抓取公交实时数据 300-400 万条,构成不正当竞争 |
| 百度诉奇虎 360 案 | 360 违反 Robots 协议抓取百度内容,构成不正当竞争 |
| 新浪微博诉超级星饭团案 | 绕开访问权限抓取非公开数据 + 明知 Robots 限制仍抓取公开数据,均具不正当性 |
| 大众点评诉百度案 | 抓取后大量全文展示,构成对大众点评的实质性替代,超出必要限度 |
其中”实质性替代”是关键概念:即使数据来源合法,若使用方式导致用户无需再访问原平台(如全文搬运点评内容),依然违法。数据使用应遵循”最少、必要“原则。
民事红线 2:数据爬取的高额赔偿风险
近年数据类不正当竞争案件赔偿额不断攀升,最高法公布的典型案例中已有单案判赔 2000 万元的爬虫案件。法院还特别指出:抓取的数据中若包含 IP 地址、设备标识等间接识别信息,无法证明取得用户单独同意的,还同时违反《个人信息保护法》第 6 条——民事责任与行政责任可能叠加。
三层法律责任体系一览
| 责任层级 | 法律依据 | 典型情形 |
| 刑事责任 | 刑法第 285 条(非法获取计算机信息系统数据罪、提供侵入工具罪)、第 286 条(破坏计算机信息系统罪)、第 253 条之一(侵犯公民个人信息罪)、第 217 条(侵犯著作权罪) | 破解反爬措施、爬个人信息并牟利、拖垮服务器、卖破解工具 |
| 行政责任 | 《网络安全法》《数据安全法》《个人信息保护法》 | 未履行数据安全义务、非法处理个人信息,可处罚款、停业整顿、吊销执照 |
| 民事责任 | 《反不正当竞争法》第 2 条及互联网专条、《民法典》人格权编、《著作权法》 | 违反 Robots 协议、实质性替代、侵犯隐私权、著作权侵权 |
一张表判断你的爬虫是否安全
| 行为特征 | 风险等级 | 说明 |
| 遵守 robots.txt,只抓允许的内容 | 🟢 低 | 基本合规,但仍需注意频率与用途 |
| 公开数据 + 低频率 + 不破解任何措施 | 🟢 低 | 平台对合法抓取公开数据负有一定容忍义务 |
| 大量高频抓取,给服务器造成压力 | 🟡 中 | 可能构成不正当竞争,极端情况触碰刑法第 286 条 |
| 违反 Robots 协议 / 用户协议明确禁止 | 🟡 中 | 通常构成不正当竞争 |
| 抓取后全文展示,实质性替代原平台 | 🔴 高 | 大众点评诉百度案确立的红线 |
| 需要登录才能看的数据(模拟登录、借用账号) | 🔴 高 | 已涉及”避开访问权限” |
| 破解验证码、伪造设备指纹、绕过频率限制 | 🔴 极高 | 直接对应刑法第 285 条 |
| 抓取手机号、身份证号等个人信息 | 🔴 极高 | 触碰刑法第 253 条之一 |
| 抓取并售卖数据牟利 | 🔴 极高 | 牟利是”情节严重”的重要认定因素 |
| 开发/售卖带破解功能的爬虫工具 | 🔴 极高 | 提供侵入计算机信息系统程序罪 |
合规自查清单(写给开发者与企业)
写爬虫前、爬取中、使用时,逐条对照:
爬取前
- 查看txt,确认目标路径是否允许抓取;
- 阅读平台的《用户服务协议》,确认是否明确禁止自动化抓取;
- 评估数据内容:是否包含个人信息、著作权作品、商业秘密?优先选择官方 API、开源数据集或商业数据合作;
- 涉及个人信息的,确认是否有合法处理事由,能否做到匿名化/脱敏。
爬取中
- 绝不破解验证码、签名、加密算法,不伪造设备指纹;
- 不模拟登录抓取非公开数据,不借用/超越他人账号授权范围;
- 严格控制频率与总量,设置合理间隔,避开业务高峰;
- 标识真实的 User-Agent,不虚设身份、不切换来源伪装。
使用时
- 遵循”最小必要”原则,不全文搬运,避免对原平台构成实质性替代;
- 及时匿名化处理,剔除个人身份信息;
- 不倒卖数据牟利——”一条才赚几分钱”的侥幸心理已让多人获刑;
- 保留授权凭证与合规记录,以备争议时举证。
给企业额外一条:委托第三方爬数据不豁免责任。前述”租房合同案””商品数据案”中,组织者、技术执行者、提供服务器者全部被追责,分工明确反而被认定为共同犯罪。
结语
爬虫技术的双刃性已被无数判例反复验证。一句话概括法律边界:爬公开的、允许爬的、控制频率地爬、不破解任何防护、不碰个人信息、不实质性替代原平台——这是安全区;破解防护、爬个人信息、拖垮系统、卖破解工具——这是犯罪区。
技术不是法外之地。正如检察机关在判后释法中所说:任何爬取行为,一旦超过”授权”与”合法”的篱笆,一旦开始破解防护、突破限制,工具就沦为了凶器。对开发者而言,敬畏规则才是让技术走得更远的前提。





