当下,爬虫、数据抓取、API聚合已是互联网企业的常规操作。但“抓取他人平台数据”的边界到底在哪里?有人以为“技术上能抓到就是我的”,结果踩中不正当竞争的红线和刑事风险。本文以被称为“大数据不正当竞争第一案”的微博诉脉脉案为切口,讲清数据爬取的合规边界与影响深远的“三重授权原则”。
案件引入:一场“合作”如何变成不正当竞争?
2013年起,脉脉(由淘友天下公司运营)曾获得新浪微博(由微梦公司运营)的授权,用户可通过微博账户注册脉脉并获取部分微博信息。但在合作期间,脉脉在未获微博授权、也未征得非脉脉用户许可的情况下,将脉脉用户手机通讯录中的联系人与新浪微博用户相对应,把非脉脉用户的职业、教育等信息展示在“一度人脉”中;双方合作终止后,脉脉仍未删除、继续使用相关数据。微梦公司遂以不正当竞争为由起诉,索赔千万元。
一审法院(北京市海淀区人民法院)认定脉脉构成不正当竞争,判令停止侵权、消除影响、赔偿经济损失200万元及合理费用。二审北京知识产权法院于2016年12月30日作出(2016)京73民终588号民事判决,驳回上诉、维持原判。该案成为数据抓取领域的标杆判例,确立了“三重授权原则”。
法律分析:法院判的三大逻辑
本案的裁判,为“第三方到底怎样抓取平台数据才合法”给出了清晰的答案。
一、平台的数据权益受保护:抓别人的“饭碗”要经同意
法院认为,在数据资源已成为互联网企业重要竞争优势的情况下,网络平台提供方可以就他人未经许可擅自使用其经过用户同意收集并使用的用户数据信息主张权利。微博对用户信息投入了经营成本,用户规模与数据质量是其核心竞争力,他人未经授权“搭便车”式抓取,直接损害其竞争优势。换言之,平台合法收集、积累的数据,不是无主物,他人不得擅自取用。
二、三重授权原则:抓取必须经得起“三次点头”
这是本案最核心的规则。法院明确,互联网中第三方应用通过开放平台(如OpenAPI模式)获取用户信息时,应坚持“用户授权+平台授权+用户授权”的三重授权原则。其一,用户同意平台向第三方提供信息;其二,平台授权第三方获取信息;其三,用户再次授权第三方使用信息。本案中,脉脉既未取得微博的平台授权(超出《开发者协议》约定,擅自抓取职业、教育等字段),也未取得非脉脉用户的用户授权(仅凭通讯录手机号就匹配展示他人信息),授权链条断裂,抓取行为自始不合法。
三、违反公认商业道德,即构成不正当竞争
法院适用《反不正当竞争法》第二条,认为脉脉违背诚实信用原则和公认商业道德,破坏OpenAPI合作模式与公平竞争秩序,构成不正当竞争;尤其在合作终止后仍继续使用、未按要求删除数据,更凸显主观恶意。
法院指出,用户点击格式合同时的授权行为常具随意性,不能据此作为非用户授权的依据——真正为用户信息“站岗”的是平台方。平台应通过OpenAPI接口协议规范第三方抓取行为、禁止越权爬虫,并履行个人信息保护的社会责任。
律师实务风险提示与维权建议
一、对数据使用方(第三方开发者、企业)
1.审查授权链条:调用OpenAPI或爬取前,确认已取得“用户授权+平台授权+用户再授权”三重授权,留存授权凭证,避免“默示同意”的错觉。
2.严守范围与目的:只取协议约定字段、只为约定目的使用,不超采、不转用、不向第三方再提供;任何变更均重新取得同意。
3.合作终止即下线删除:授权或合作终止后立即停止抓取、删除已获取数据,完整保留合规记录,防止被认定为恶意持续侵权。
二、对数据提供方(平台企业)
协议+技术双控:在《开发者协议》中明确可获取的字段、目的、期限,并用接口权限、调用频次限制、日志审计等技术手段将规则落地。
主动维权与示警:发现越权抓取及时发函、向用户示警,并依据协议与《反不正当竞争法》追责。
落实自身保护义务:平台自身亦须遵循合法、正当、必要与“最少够用”原则,避免一边维权一边自身侵权。
结语
数据不是无主之物,爬虫也不是法外之地。技术能抓取多少,不代表就能合法取得多少——“三重授权”这道闸门,既保护用户的个人信息,也保护平台来之不易的数据资产。对企业而言,守住授权链条与范围边界,是数据合规的底线;对个人而言,看清每一次“授权”背后的流向,也是在数字时代守住自己的边界。


