数据治理对数据市场的寒蝉效应
(本文约15000字,预计阅读时间30分钟)
译者按
本文旨在论证,虽然“数据治理”(即政府利用私营部门收集的数据进行执法)具有提升行政效率、实现个性化法律的潜力,但这种“双重用途”可能对数据市场及数据驱动型创新产生反向的“寒蝉效应”。
文章首先指出,个性化法律(Personalized Law)依赖于海量、实时且精准的数据。为了实现执法的精准化,政府需要获取私营企业(如汽车制造商、互联网平台等)拥有的数据资源。然而,作者认为学术界以往的研究多关注政府监控对公民自由和隐私的威胁,却忽视了这种数据提取行为会扭曲商业数据市场的运作。然而,数据治理与数据资本主义之间存在内在张力,数据的获取并非没有代价。政府介入数据市场可能会因“反公地”问题或政府权力带来的议价力量,推高数据成本,甚至使政府陷入对特定数据供应商的技术锁定。
更深层的危害在于“寒蝉效应”。文章详细阐述了这种效应通过四个维度改变市场动态:数据主体(个人或企业)因担心被政府监控、遭受不公待遇或法律风险,会减少设备的使用,或在共享数据时产生防御性心理,导致底层原始数据供给减少。为了逃避潜在的法律责任或操纵画像结果,数据主体可能采取混淆策略或提供“噪声”数据,这直接损害了算法训练的准确性。企业为了避免因共享数据而导致用户流失或承担法律合规成本,可能会放缓对更先进、更依赖数据学习的技术(如智能传感器)的开发与推广。数据是人工智能与机器学习的燃料。数据治理带来的扭曲会产生连锁的多米诺骨牌效应,导致数据驱动型创新的基础退化,最终可能对整个数字经济的动态效率产生负面影响。
总结而言,作者呼吁政府在推动数据治理时,不能单纯将数据视为免费的执法资源。若不对共享机制带来的负面外部性进行系统性分析,一味追求执法的短期便利,很可能以损害长期经济创新力和市场活力为代价。在个性化法律成为现实之前,必须认真评估这种治理模式对数据生态系统的长远代价。
大数据不仅已成为商业领域的重要资源,也成为了治理领域的重要资源。“数据治理”旨在利用私营企业收集的海量数据来提高执法效率。它可以采取多种形式,包括设定执法优先级、影响举证方式,甚至改变法律规范的内容。例如,汽车制造商可以利用驾驶员驾驶习惯的实时数据来了解其汽车对不同驾驶模式的反应。如果与政府共享,这些相同的数据可用于执行限速,甚至为每位驾驶员制定个性化的限速标准。
为执法目的共享数据显然会引发对公民自由的担忧。事实上,在过去的二十年里,学者们一直关注这种数据共享给隐私和自由带来的风险。然而,到目前为止,现有文献大多忽视了这种数据的双重使用对数据市场和数据驱动型创新的影响。
在本文中,我们认为数据治理可能会产生“寒蝉效应”,从而扭曲数据收集和数据驱动型创新。我们对以下假设提出质疑:收集数据的激励是既定的,并且尽管政府可以访问这些数据,企业仍将继续收集数据。我们表明,在某些情况下,收集数据的激励与为治理目的共享数据之间存在反向关系。此外,数据主体允许私营实体收集其数据的意愿也可能发生变化,从而潜在地影响数据驱动型市场的效率,并进而影响数据驱动型创新。因此,数据市场可能无法提供充足和适当的数据来支持数字治理 。这反过来又可能对社会福利产生重大影响。
大数据不仅在商业领域,而且在法律领域也已成为一项重要资源。数据治理可以采取多种形式,包括设定执法优先级、影响举证方式,甚至改变法律规范的内容。私营实体在收集和分析此类数据方面发挥着核心作用。事实上,数据治理的成功实施可能取决于数据的潜在双重用途:既作为私营部门产生的商业资产,又作为一种内在的治理手段。同一数据在私人和公共用途之间的相互作用,对社会福利具有重要影响。在过去的二十年里,学者们已经认识到私营企业在促进政府获取数据方面发挥着越来越重要的作用,分析了私营公司配合政府监控的动机,并探讨了此类数据共享对公民自由的影响。
然而,这些文献通常忽视了数据的双重使用对数据市场的影响。当前的文献主要假设收集数据的动机是既定的,并且企业将继续收集数据,只是对政府访问此类数据设置更高的障碍。我们对这一假设提出质疑:一旦引入数据治理,数据收集的动机可能会发生变化。但更根本的是,数据主体允许私营实体收集其数据的动机也可能发生变化,从而可能影响数据驱动型市场的效率,进而影响数据驱动型创新。这反过来又可能对社会福利产生重大影响,此外,允许政府访问私人收集的数据可能会损害数据治理所依赖的基础。在我们能够做出明智选择并确保政府的数据治理确实能增加福利之前,必须认识并分析这种动态效应。
为了详细阐述这一主张,本文重点关注数据治理的一种形式——个性化法律(personalized law),并认为关于它的许多论证也同样适用于其他形式的数据治理。个性化法律旨在利用数据收集和数据科学领域的技术进步(这些进步使得数据能够被高效、及时地传输、存储、组织和分析),从而为个人量身定制法律规范。例如,与其设定一个适用于所有驾驶员的单一限速,不如根据驾驶员的经验、驾驶历史或实时路况为其量身定制限速标准。或者,可以根据相关的暂时或永久性健康状况或家庭情况(例如,正驾车载有幼儿)向个人发放残疾人停车许可证。这种定制的规范可以嵌入到数字基础设施中(例如自动驾驶汽车、智能停车设施和道路),并且可以通过允许停车、开具罚单,甚至在发出警告后远程禁用汽车来对个人进行实时应用。个性化法律可以通过改善执法、减少涵盖不足或过度涵盖的风险规避机制,以及减少制度化歧视来提高效率。然而与此同时,个性化法律可能会破坏一些重要的价值观,引发关于隐私、法律面前人人平等以及公民自由的担忧。
为了实现其承诺,个性化法律要求政府能够获取其主要输入要素,即相关数据以及能将该数据转化为治理工具的算法。事实上,法律越是个性化,所需的数据就越准确和私密。这意味着,为了定制法律规范,不仅需要的数据量会发生变化,其质量(包括多样性、速度和真实性)也会发生变化。虽然其中一些数据可以从政府控制的数据源(如测速摄像头)中收集,但大部分数据可能由私营企业收集(例如,由汽车制造商运营的汽车传感器收集的驾驶模式数据;由移动电话应用程序收集的位置数据;或由可穿戴设备生成的实时健康数据)。私人生产的数据是数字经济的主要资源、资产和产品。其高商业价值源于它允许对决策进行规范化定制,从而降低风险并提高绩效。除其他外,它使企业能够做出更有利可图的投资、定价和营销决策,并根据个人需求创造新的或改进的产品和服务。因此,许多公司都在投资收集、组织和分析数据,或者创造依赖于这些数据的产品、服务和技术,从而催生了数据资本主义。
严重依赖私营企业收集的数据的个性化法律,能否与充满活力的数据收集市场以及由此产生的数据驱动型创新共存?本文认为,尽管数据具有非竞争性且其传输成本通常较低,但收集、组织、存储和共享某些类型的数据可能会非常昂贵。因此,一些数据中介机构可能会享有市场支配地位。因此,不能假设数据将以低廉的、有竞争力的价格与政府共享。这一考虑因素影响了数据治理的可行性和效率。更重要的是,我们认为数据治理可能会产生内在的紧张关系,有时甚至会与数据资本主义发生冲突。一旦被引入,它可能会影响其所依赖的数据市场,从而改变当前的现状。我们确定并分析了数据治理可能改变数据驱动市场动态的四个维度:1)收集的数据量;2)收集的数据质量;3)建立在持续数据分析基础上的高效技术的使用;以及,随之而来的也是最重要的一点,4)数据驱动型创新。这些影响反过来很可能会影响数据驱动市场的效率,以及依赖此类数据的个性化法律的可行性和效力。产生这些影响的原因在于,数据治理的引入可能会导致对数据提供、收集和共享的自我限制;数据市场中的寒蝉效应;以及在依赖此类数据的产品和服务市场中的连锁多米诺骨牌效应。一些数据主体——无论是私人个体还是法律实体——可能会限制其对收集数据的设备的使用,或者提供不准确、部分或“嘈杂”的数据,从而影响可用数据的数量和质量。这反过来可能会降低数据收集者与政府共享数据的动机,甚至从一开始就降低他们生成可能用于治理目的的数据的动机。这种数据提取障碍或数据质量下降可能会导致数据驱动型创新降级,并可能对现代经济的主要引擎——动态效率——产生负面影响,从而可能降低社会福利。
本文结构如下:第一部分将个性化法律作为一种数据治理形式进行简要介绍,并探讨了其高效运作的必要条件,以此作为铺垫。该部分还简要探讨了数据市场的特征。第二部分分析了数据资本主义和个性化法律之间潜在的紧张关系根源:数据的价格。第三部分重点讨论了这种紧张关系的一个更显著的表现形式:数据市场运作的扭曲,包括收集的数据量和质量的扭曲,以及这对基于数据的设备的使用和数据驱动型创新的影响。结论部分简要探讨了一些用于解决这些内在紧张关系的监管和技术工具。
个性化法律旨在利用数据的激增来提高执法效率。例如,现代汽车可以收集关于驾驶模式的实时数据。汽车制造商可以利用这些数据来了解其汽车对不同驾驶模式的反应。如果与政府共享,这些相同的数据可用于为每位驾驶员制定个性化的限速标准。再举一个例子,企业会收集有关个人风险水平的数据。这些数据可用于为产品(例如保险)定价或定制营销(例如跑车)。相同的数据也可用于补充由个人签署的不完整合同,这需要对其风险水平进行评估。因此,个性化法律寻求利用关于个人的细粒度数据,以便制定和应用量身定制的法律规范。本部分将探讨此类数据的来源和特征。
实施个性化法律可能需要两种不同的数据来源:政府收集的数据和私营企业收集的数据。这两种来源的数据并不总是重叠的。例如,政府从测速摄像头、人口普查和纳税申报表中收集数据。其中一些数据可能是独有的,而另一些可能与私营企业收集的数据相似。政府收集的数据可能并不总是足以制定个性化法律。在这些情况下,政府可能会投入资源来收集此类数据,或者选择获取私营企业收集的数据。事实上,数字通信、数据收集和数据存储目前由私营企业主导。在某些情况下,可能需要结合政府和私人的数据源。
数据是当今经济的重要驱动力。计算和存储能力的增长,加上日益普及和高效的互联网接入,刺激了数字经济的到来,并促成了基于海量数据(大数据)收集和处理的商业模式的兴起。利用复杂算法存储、整理和分析数据以获取洞察力的能力,赋予了数据巨大的财务价值和力量。数据分析允许对决策进行常规化定制,从而降低风险并提高绩效。大数据还促成了新产品的推出,例如自动驾驶汽车和智慧城市,从而为企业、消费者和整个社会带来巨大收益。
个人数据在这一经济中发挥着关键作用。它被用于寻找相关性,从而能够预测总体趋势以及个人偏好和行为。它还可用于为每个人创建一个“数字档案”,然后该档案可用于改进个性化的产品和服务,或用于微定向广告。
数据市场由数据价值链上的三个主要环节组成,如图1所示:收集;综合与分析;以及使用。
收集涉及数据的提取及其数据化,即将信息记录、聚合和组织成可用于数据挖掘的形式。综合与分析涉及整合不同类型的数据并对数据进行分析处理以发现相关性。它将原始数据转化为有意义的信息。最后一个环节,即使用,涉及利用基于数据的信息在相关市场中进行预测和决策。这些活动的输出可能包括改进的或创新的流程、产品或服务。这个价值链还具有动态的内部互惠维度,在这个维度中,关于算法过去预测成功率的数据被收集起来,并用于“训练”算法使其更加准确,从而使其在未来能做出更好的预测。数据的特征以及其收集、分析和使用的市场影响了数据的提供方式。
数据来源多种多样。其中一个主要来源是用户的在线注意力,其特点是竞争激烈。已经出现了几种收集此类数据的商业模式,其中一些基于与数据主体的隐性或显性交换:用户允许企业访问其(部分)私人数据以换取各种利益(例如应用程序、内容、服务)。一些企业已经发展成为“超级”数据收集者,可以直接、大量地接触数字用户(例如谷歌、Facebook和亚马逊)。有些数据是作为其他生产活动的副产品收集的,例如嵌入在“物品”中的传感器(例如汽车、家用电器、可穿戴设备和数字管家)。某些类型的数据由众多企业以低成本收集(例如智能手机用户的位置数据)。此外,类似的数据可以从不同的来源收集(例如,位置数据可以从可穿戴设备或智能手机收集)。
然而,数据收集的成本并不总是很低,其市场也并不总是充满竞争的。正如丹尼尔·鲁宾菲尔德 (Daniel Rubinfeld) 和米哈尔·加尔 (Michal Gal) 教授所展示的,某些类型的数据市场的特征是准入门槛高。这些障碍有些反映了独家访问点(例如由医生收集的患者数据)或企业开始收集数据的时间点(例如自然灾害前的一系列航拍地图)。数据竞争的障碍也可能源于数据收集、组织、存储或分析的规模和范围经济;源于网络效应(例如Facebook和Yelp);源于对数据传输的法律限制(例如未经同意共享个人的病史);源于当历史数据很重要时的锁定和转换成本;以及源于数据兼容性和互操作性的障碍。对用户注意力的激烈竞争可能会增加创造昂贵产品或服务以吸引此类注意力的需求。最后,当数据是其他活动的副产品时,收集者必须参与到相关活动中。
由综合与分析组成的数据价值链环节通常具有规模和范围经济的特点。可以从数据中收集的信息与所收集数据的属性(体量、速度、多样性和真实性)正相关,至少在某种程度上是这样。因此,识别模式、生成预测以及迅速适应快速变化的情况,通常需要获得大量最新、多样且准确的数据。有趣的是,且与下文分析相关的是,在数据分析中发现的相关性并不一定是微不足道的。
最后,关于使用,数据的非竞争性意味着相同的数据可以有多种用途。此外,如果数据以数字形式存在,与其他实体共享所收集数据的边际成本可能非常低。同时,数据通常不可替代。不同的市场可能需要不同类型的数据。例如,当速度至关重要时,旧数据无法作为足够有效的输入。
数据市场可能会如何受到个性化法律引入的影响?这是接下来两部分的重点。
数据治理的可行性和有效性在一定程度上取决于政府获取数据必须支付的价格。讨论个性化法律的文献往往隐含地假设数据市场具有竞争性,并且其价格不会构成获取数据的障碍。人们普遍认为,私营部门产生的数据将以低廉的竞争性价格自愿与政府共享以用于治理目的(以下简称“数据共享”),并且这种双重用途将提高整体效率和社会福利。
在现实世界中,这些条件并不总是成立,而且数据的价格可能很高。如上所述,虽然共享已收集数据的成本可能很低,但收集数据可能涉及高昂的成本。如果个性化法律需要市场通常不收集的数据(这是由于在收集数据的类型、收集频率和数据组织方式方面存在不同的激励机制),则收集成本可能会进一步增加。例如,如果数据收集或分析的成本很高,企业可能会决定每天只对数据进行一次采样。然而,要应用个性化法律,可能需要更频繁地进行采样。或者以数据组织为例,数据治理可能需要结合多个数据源并同步数据,以确保类似的法律原则适用于所有人。创建用于互操作性的数据标准并确保符合此类标准可能会很昂贵。当所有竞争者都承担高昂的收集成本时,从长远来看,市场价格必须至少能够覆盖这些成本。
此外,一些数据收集者在收集某些类型的数据方面可能享有显著的比较优势,甚至排他性。这反过来可能会对此类数据产生显著的市场力量。值得注意的是,个性化法律越具体,所需的数据就必须越具体,因此从多个来源获取该数据的可能性就越小。在这种情况下,私营企业要求共享数据的价格可能会很高,这反映了它们的市场力量。此外,所要求的价格可能会反映并捕获个性化法律的数据使用对社会福利产生的部分正外部性,从而进一步推高其价格。此外,当个性化法律的应用需要来自几个不同来源的数据时,可能会出现“反公地”(anticommons)问题。数据的价格还可能反映由于将数据用于治理目的而丧失的商业机会。最后,它还可能反映出数据收集者因其作为“面对政府监控时的用户隐私捍卫者”的自我形象受损而可能遭受的损失。
由于我们上面探讨的原因,数据的价格可能在社会层面不是最优的,并且个性化法律的一些福利收益可能会丧失。然而,需要注意的是,政府为数据支付的价格可能会增加数据收集的动机,这反过来又可能加剧数据提供的竞争,至少在某些市场中是这样。那么,数据共享的价格可能会降低。
目前的分析表明,考虑到政府可能需要为数据支付的价格,个性化法律的提供可能不是最优的。当价格过高时,政府根本不会购买这些数据,并且会避免进行数据治理。然而,有时这可能不是最优选择。当政府被锁定在个性化法律政策中(例如,它已经对部分公民应用了该法律,现在需要对其他公民应用),而数据价格上涨时,就可能出现这种情况。例如,如果政府在技术上受制于某些数据供应商(这可能是由于审查新数据供应商的过程漫长且成本高昂、创建数据使用接口方面的先发优势,以及将新类型数据纳入现有系统所面临的障碍等原因),就会发生这种情况。
个性化法律旨在利用数据的激增来提高执法效率。由于数据具有非竞争性,且政府的使用通常不会耗尽或损害其商业效用,因此人们通常假设为执法目的共享数据将增加社会福利。
本部分对这一假设提出质疑。它认为数据共享可能会产生寒蝉效应,从而可能扭曲数据以及数据驱动型市场。虽然上一部分通常假设私营企业收集数据的程度在很大程度上是既定的,但我们表明,在某些情况下,收集数据的动机与为治理目的共享数据之间存在着反向关系 。因此,数据市场可能无法提供充足和适当的数据来支持个性化法律。
从图表上看,数据共享为市场动态增加了另一个维度的论点可以说明如下:
我们首先探讨个性化法律对数据主体行为的潜在后果。然后,我们探讨这些后果对数据市场动态的可能影响,重点关注数据的数量和质量,以及数据驱动技术的使用和数据驱动型创新。
个性化法律要求以前所未有的规模和目的与政府共享数据。令人担忧的是,这种数据共享将影响数据主体提供其数据以供收集的动机,从而影响数据收集者收集数据的能力和动机。
关于私营企业的监控是否会影响人们的行为,存在着激烈的争论。行为学研究指出了一个“隐私悖论”,即人们声称高度重视隐私,但他们实际的在线行为却表明他们愿意为了相对较小的回报而披露个人数据,这两者之间存在差距。然而,对于从这些研究中得出的结论,人们鲜有共识。一些隐私学者将这种悖论解释为,消费者缺乏关于披露个人数据所涉及的潜在风险的充分信息,或者对数据收集、所涉风险以及存在哪些数据披露的替代方案持有误解。然而,另一些人认为,尽管个人有明显的隐私担忧,但他们还是会披露个人数据,因为他们更看重眼前的利益,而不是未来抽象的潜在风险。
此外,可以说监控已经融入了“永远在线”社会的现代生态系统中,在这个系统中,数据被持续收集(例如,设备中的传感器经常持续记录数据)。因此,可以推测,个性化法律仅仅会为已收集的数据增加另一层用途。那么,是否有理由相信,如果私营企业使用的相同数据也被用于数据治理,数据主体会改变他们的行为呢?
虽然尚未研究为实现个性化法律而增加的政府监控对行为的影响,但已经存在一些粗略的指标。爱德华·斯诺登(Edward Snowden)的泄密事件提供了一个利用私营部门收集的数据进行政府监控的典型例子。多项研究发现,在斯诺登事件曝光后,用户的行为发生了变化。例如,Alex Marthews和Catherine Tucker教授发现,在斯诺登事件曝光后,搜索查询中选定敏感词汇的使用有所减少。Jonathon Penney教授进行的另一项研究指出,对隐私敏感的维基百科文章的访问量有所下降。
问题在于:我们能从这些研究中学到多少?观察到的行为变化可能仅仅反映了用户的期望,即私营企业收集的数据不会被用于政府监控。正如Helen Nissenbaum教授所言,语境很重要,在一个语境中共享的数据不能在不违反“特定语境实质性规范”的情况下在另一个语境中共享,这些规范界定了谁收集数据、数据可以与谁共享以及在什么情况下共享。从这个意义上说,可以说对斯诺登事件的反应部分可以用无视特定语境规范所产生的信任破坏来解释。当然,如果数据共享是透明的且事先已知的,这种破坏就不存在了。
然而,我们认为,即使数据主体意识到他们的数据将被用于个性化法律目的,这种意识仍然可能会改变他们的行为。这是因为将数据用于治理为监控增加了新的维度,不仅影响作为消费者的数据主体,也影响作为公民的数据主体。收集到的关于数据主体的数据可能会带来与执法相关的具体后果,影响其合法权利或义务。即使是对监控本身是否会对行为产生寒蝉效应持怀疑态度的批评者也同意,当监控增加了负面后果的风险时,可能会产生寒蝉效应。数据分析与国家制裁或奖励之间的这种联系,使得个性化法律不仅仅是一种执法措施(旨在为每个人量身定制标准),也是一种实际上可以塑造数据主体行为的工具。由于量身定制的标准(例如,定制的限速)可能是基于在其他背景下(例如,社交媒体)收集的数据确定的,我们可能需要重新思考关于在生成和收集数据时数据主体行为的假设。
因此,将数据用于数据治理引发了超出隐私损害的担忧。构成这种差异的基础可能有几个因素。这些可以分为个性化法律的潜在后果和其他无形影响。
对于用户而言,政府对数据的使用可能会(或被认为)比私营企业造成的危害更大。最明显的危害是,基于个人画像可能会导致执法力度增加或加重法律负担。虽然守法的数据主体可能会从这种画像中受益,但其他人可能会因此受到损害。例如,如果收集到的关于数据主体使用某产品的数据显示该用户有疏忽的倾向,并且这一事实显著提高了对其预期的注意义务水平,那么她可能会不愿意允许收集相关数据或将其与政府共享。
因此,数据共享为私营企业收集和使用个人数据所产生的风险增加了一个新的维度。例如,谷歌和亚马逊会收集有关客户在线阅读习惯的数据,并利用这些数据更好地预测用户感兴趣的内容,或他们接下来想购买和浏览的商品。相同的数据也可以被政府使用,这不仅限于调查犯罪或侦测获取极端主义材料以威胁公共安全的人员,还可能被用于衡量学生和教师的阅读表现。此类信息随后可被用于做出有关孩子未来发展或教师晋升前景的决策。一个人的在线阅读习惯可能被用于治理的前景,潜藏着真实的风险。
这种风险因为个人数据将被用于何种目的的不确定性而进一步加剧。因此,即使是守法的数据主体,对于数据可能揭示的相关性或数据在未来可能被用于何种目的的不确定性,也会影响他们对共享该数据可能导致危害的认知。这种不确定性阻碍了数据主体去评估由于自身数据被使用可能导致危害的发生概率、规模和类型。考虑一位可能会从个性化法律中受益(例如获得更高限速)的守法公民。如果法律发生变化(例如,禁止基于性别的风险评估评分),或者在数据中发现了不同的相关性,那么同一个数据库可能会增加她在其他领域的法律责任。例如,如果发现危险驾驶与看似无关的性格特征(例如,如社交媒体帖子中反映出的缺乏条理性)之间存在相关性,那么一位原本受益于更高限速的守法数据主体的最高限速可能会被降低。这种潜在的危害以及随之而来的逃避数据收集的动机,可能会随着未来能够让个性化法律治理过程变得自动化和快速的技术进步而进一步增强。
政府对执法的垄断也是一种风险来源,这引发了人们对错误或权力滥用的担忧。不准确的画像可能导致不合理地剥夺权利或增加强加给数据主体的法律义务。这种不准确性可能是基于片面数据的画像,或者是由于对数据的分析不准确而引起的。不准确性也可能源于分析过程中的路径依赖。即使数据主体改变了她的行为(例如显著改善了驾驶习惯),目前还不清楚这种改变将在何时才能反映在数据中。试想一个不需要复杂分析的更简单的例子——即目前改变一个人的信用评级可能需要多长的时间。在这些情况下,数据主体可能会试图进行策略性的规避,以防止某些行为被记录下来。
另一个担忧是政府机构出于自身目的滥用数据的可能性——例如,在算法中赋予某些有助于推进某一政治目标的特征以更大的权重。事实上,认为国家是一个仁慈的行为体、单纯为了所有人的福祉而努力且不受政治影响的假设,是值得怀疑的。随着分析变得越来越细致和依赖数据,它也更容易受到操纵和滥用。
通过解释哪些数据特征在决定结果时实际发挥了作用,可以部分减轻这种损害。然而,随之而来的是一个“透明度悖论”:为了验证政府没有在数据或算法上动手脚所需的透明度,可能会使这些数据对市场上的其他参与者变得透明,从而降低数据收集者的比较优势,损害其商业利益。
将数据用于个性化法律也可能涉及信号传递,这可能会影响共享个人数据的动机。例如,如果别人在某路段可以开到每小时五十英里,而你只被允许开三十英里,这可能会对外发出一个信号,表明你是鲁莽的,并影响你收到的商业或个人报价。因此,特定的政府画像可能会在生活的其他领域产生外部性。事实上,企业可以通过在政府执行的画像上“搭便车”来降低成本,至少在那些对公众可见的画像方面是如此。
最后,为个性化法律目的而共享数据,可能会增加身份盗窃或身份交换的动机。如果这可以使个人在个性化法律制度下获得更优惠的标准,那么该个体可能会试图用另一个数据主体的数据记录来替换她自己的记录(无论是否经过后者的同意)。
将数据用于个性化法律也可能造成无形的伤害,这反过来可能会引发公众的负面反应。例如,政府在没有搜查令的情况下获取个人数据可能被视为对公民自由的侵犯,以及政府对私人领域的不当干预。重要的不仅仅是执行什么法律,还有如何执行。
与政府共享数据也可能会增加人们(感知到的)对个人领域失去控制的感觉。有趣的是,研究表明,当人们感到自己对共享数据的决定拥有控制权时(无论这种控制权是真实的还是虚幻的),他们更愿意共享个人数据。这意味着对自身数据失去控制(或感觉失去控制)可能会减少自愿的数据共享。事实上,为政府目的共享数据所带来的失控感,甚至可能比私营公司使用数据所造成的失控感更强烈。在私人领域,人们通常觉得自己有一定程度的选择权:一个人可以更换供应商,或者可以放弃或限制对大多数产品的使用(即使这需要付出一些代价)。然而,要改变政府或“关闭”它们的法律则困难得多。当然,在某种程度上,这种推理已经过时了。当传感器记录我们的一举一动时,无论我们是否在数字世界中采取任何特定的自愿行动(例如,搜索),数据收集已经不再取决于我们是否选择去操作设备。
与将数据用于个性化法律相关的另一种无形伤害涉及对自由的体验。个人数据处理可能会限制数据主体在不同情况下呈现其多面人格的能力。例如,一个人在生活的大部分领域可能都极其谨慎和小心,但在某一个她肯定不会对他人造成伤害的领域,她允许自己表现得鲁莽。一个对所有生活领域的数据进行同等处理的算法,可能会给该个体打出一个很高的风险分数,而这根本无法反映她在大多数生活领域中的真实表现。这种负外部性反过来可能会促使个人放弃或淡化他们原本希望在不同环境中向他人展示的特质。对于治理算法会赋予生活不同方面多少权重存在不确定性,这也会产生同样的结果。其后果就是,人们可能会感到自己向世界展示“多面自我”的能力受到了极大的束缚。
一些人认为,不愿与政府共享数据也可能是出于意识形态的原因,旨在保护自由主义的隐私观念,以防止出现一个“无孔不入的监控的反乌托邦世界”,以及随之而来的所有社会和政治恶果。
最后,所适用规则丧失普遍性也可能带来心理方面的影响。一个数据主体仅仅因为其个人特征(尤其是那些她自己无法控制的特征),就可能要受到比周围其他人更严格的法律要求的约束,这一事实可能会导致她产生一种自卑感,并影响其社会地位。
在探讨了数据共享可能对数据主体造成的潜在损害之后,下一个问题是:这些损害将如何影响数据主体和数据收集者的行为?并且它们将如何影响因将数据用于个性化法律而产生的社会福利?我们重点关注四个主要影响:收集的数据量、数据质量、高效数据收集设备的使用,以及对数据驱动市场中创新的影响。
上述讨论得出的一个主要担忧是,被收集的数据将会减少。当数据主体可以选择是否参与某项被记录的活动或是否使用收集数据的设备时,他们可能会避免此类行动或使用。这反过来将减少可用数据的数量。
然而,这种影响取决于数据主体是否知晓数据收集和共享的情况。数据收集者如果认识到数据主体的潜在反应,可能会承诺不与政府共享其收集的数据。例如,微软和苹果就将斯诺登事件视为一个商业机遇,借此撬动隐私市场,并宣传其产品和服务能够免受政府拦截,是安全的。苹果公司推出了没有密钥的加密工具,以便在被要求共享数据时,它在技术上无法做到。事实上,在2016年,苹果公司公开质疑了联邦调查局(FBI)要求允许政府访问一部iPhone上数据的要求,尽管该数据是一项涉及国家安全的调查所必需的,而这通常被认为是数据共享的正当理由,也是政府特权的一部分。其他公司可能会使用更隐蔽的方式来限制数据共享,包括设置技术障碍以阻止数据收集或共享。
即使企业遵循自我施加的数据共享限制,由于用户和企业之间存在动机不对称,数据主体可能仍会感到担忧。例如,当一家数据收集者即将退出该行业,或者当数据主体不知道收集者的承诺已发生改变时,就可能出现这种情况。
如果数据共享是强制性的,那么这种自我施加的限制就不那么重要了。然而在那种情况下,数据主体可能会选择不能收集数据或收集较少数据的设备,至少在某些情况下是这样。在这种情况下,制造商可能会提供此类设备,至少当失去消费者的代价高于从数据收集中获得的收益时会这样做。
需要注意的是,个人限制数据收集的决定可能不会产生最理想的社会结果。事实上,个人可能会选择通过保留数据来最大化其个人利益,而不考虑什么对整个社会是有益的。他们的决定也可能受到集体行动和搭便车问题的影响,即每个人都试图在收集他人数据的成果上搭便车,这可能会导致创造出她也能从中受益的更好的产品或服务。
当然,在某些情况下,“不使用”不是一种选择,或者代价极其高昂。当保险公司将数据作为提供保单的先决条件,或者当数据可以显著降低保费时,情况可能就是如此。中国的社会信用评分提供了一个极端的例子。在该系统下,私人数据和政府数据的结合(如违约罚款)被用来为个人公民和企业建立社会信用评分。虽然目前社会评分的使用是自愿的,但如果选择不使用它,成本会飙升(例如:如果没有社会信用评分,租一辆15美分的自行车需要30美元的押金,这使得最贫穷的人无法承受)。当“不使用”这种选择本身就成为数据主体特征的一种粗略信号时,“不使用”也可能成为数据主体一种有限的解决方案。然而,考虑到不同的动机可能会导致“不使用”,它通常不能以此来表明潜在的违法者。
最后,在一个全球互联的世界中,一个政府使用私人数据而另一个政府不使用,这也可能导致数据主体在选择服务提供商所在地区方面的决定发生改变。结果可能是将某些活动转移到国外,特别是如果因为更好的决策需要而无法避免数据收集的话。事实上,在斯诺登事件曝光后,一些公司停止使用美国电缆传输数据,并开始投资他们自己的电缆基础设施。这为提供某些服务的外国公司创造了比较优势,从而削弱了其美国竞争对手收集数据的能力。总体而言,这可能会减少特定司法管辖区内可用于治理的数据量。
与此同时,数据共享的至少一个方面可能会增加数据收集者共享数据的动机,这超出了他们为此获得的价格。为治理目的与政府共享数据可能间接使私人收集者受益,因为这减少了公众要求他们为收集和使用私人数据所获利益而向数据主体付款的压力。包括杰伦·拉尼尔(Jaron Lanier)、埃里克·波斯纳(Eric Posner)教授和格伦·韦尔(Glen Weyl)在内的杰出思想家认为,数据收集者剥削了无偿提供数据的数据主体的“劳动”,尽管这些数据对其收集者具有巨大价值。他们建议发起一场数据劳工运动,迫使数字垄断企业为人们的电子数据提供补偿。数据收集者可以争辩说,以一种增加整体福利的方式共享数据应该被视为对数据主体的一种支付形式。
对数据收集者的这些影响及其反应在很大程度上也与随后的分析相关。我们只在它们有所不同时才提及它们。
数据共享也可能因多种原因影响收集的数据的质量。例如,有监控意识的数据主体可能会使用各种混淆策略,使用工具来隐藏他们的活动或他们的身份(例如,隐身搜索)。这反过来可能会降低个性化法律的可靠性。
此外,数据共享还可能产生逆向选择,从而干扰数据治理的准确性。当期望从个性化法律中受益的个人,或者那些没有足够替代方案的人(例如,那些缺乏足够信贷渠道,因此必须依靠社会评分来建立信任度的人)不成比例地共享数据时,可能会出现一些扭曲。数据质量的扭曲也可能源于为了获得更高分数或“更好”的个性化标准而进行的修补和试图在系统中作弊的行为。
当与数据治理相关的外生因素改变了数据主体的行为时,也可能产生扭曲。一旦人们了解了他们特征的预测因素,他们的行为可能会针对这些因素发生变化。这反过来会降低过去预测因素的有效性,并需要不断的调整和额外的成本。
显然,使用被污染或片面的数据可能导致对个人的不准确画像,从而扭曲个性化法律设定的规范,并不合理地改变强加给数据主体的法律义务水平。此外,高度依赖被污染或片面的数据将扭曲建立准确标准和做出可靠预测的任何尝试。然而需要注意的是,如果不准确画像对数据主体造成的负面影响足够大(例如,由于政府使用其他不太准确的数据源),数据主体可能会避免使用数据污染工具,至少在生活的某些领域是这样。
总的来说,当企业收集的数据可能为了个性化法律而共享时,它可能会变得具有选择性、片面性和不准确性。这可能会加剧个性化法律制度的缺陷,这种缺陷源于“数据隐形人”,即他们根本不使用数据驱动的服务,大概率在私人和公共数据集中代表性不足。
我们在上面描述的对数据收集的影响可能会对生产效率和动态效率都产生负面影响。本节探讨前者,而下一节重点探讨后者。
这里的论点基于这样一个假设:数据共享将成为数据主体决定使用哪种设备的考虑因素。假设制造商收集的关于其产品使用情况的数据,因为持续的数据收集创造了一个正反馈循环,从而增加了数据主体和未来用户的技术利益。进一步假设,在没有数据共享的情况下,任何特定的数据主体都会喜欢这种特定的产品而不是竞争版本。然而,数据共享可能会改变她的决策参数。
例如,考虑一家正在收集和分析有关个人驾驶习惯数据以改善车辆功能的汽车制造商。如果制造商与政府共享此数据,可能会给部分汽车用户带来更高的法律负担。因此,此类用户可能会决定不购买“智能汽车”,特别是当竞争对手不收集此类数据时。请注意,用户不会考虑对他人的正外部性,并可能忽视数据驱动学习对自己产生的长期积极影响。
因此,数据共享可能会对原本有效的技术的传播产生寒蝉效应,从而不仅可能减少特定用户的利益,而且可能减少所有其他用户的利益(考虑到算法学习的数据会减少,并且由于逆向选择,数据的可变性也会降低)。此外,如果有足够多的消费者避免使用更有效的技术,这可能会抑制采用基于持续数据收集的学习算法的更有效技术的开发、引入和吸收。
事实上,在我们的例子中,虽然汽车制造商可能不会承诺完全停止收集数据(因为对此类数据的持续分析赋予了其汽车比较优势),但它可能会减少收集的数据的数量或类型,即使这会减缓其汽车在功能或安全性方面的进步。
也许最重要的是,鉴于数据决定了数据驱动创新的功能和可靠性,数据收集的变化也可能对动态效率产生负面影响。数据是开发基于机器学习的新产品和服务所需的基石。机器学习使算法能够发现数据中的集群和模式,从而能够根据不同参数之间的关系进行预测。使用人工智能(AI)生成预测的算法需要数据进行训练。 庞大且多样化的数据集是机器学习任何创新的基础。
不完整或有偏见的数据可能会导致有缺陷的预测(无用输入,无用输出)。事实上,正如一份政府报告所得出的结论,“人工智能需要好数据。如果数据不完整或有偏见,人工智能会加剧偏见问题。”实际上,如果提供给这些算法的整体数据是片面的和被扭曲的,这将降低企业改善预测的能力,包括数据治理所需的预测。
在当今的数字生态系统中,数据是创新的重要驱动力,对社会福利产生的影响可能是巨大的,至少在某些市场是这样。仅举几个例子,在短短几年内,大数据显著提高了生物面部识别的准确性;减少了交通拥堵;并提高了医生检测恶性皮肤癌以及更准确评估药物治疗副作用的能力。为了实现这些创新,我们需要数据,并且是大量的数据。
请注意,为了使刚才探讨的影响发生,它们带来的行为变化不必对所有数据主体或数据中介机构都是普遍的。事实上,数据治理的引入可能会对市场参与者产生不同的影响。它可能对许多人的行为没有影响。它甚至可能增加一些人与政府共享数据的动机。 然而,数据治理可能会造成一个恶性循环,其中数据收集的变化会影响数据分析的整体质量,特别是当这些变化是不可预测的、无法检测的或无法用分析工具来抵消的时候。在某些情况下,数据中的微小变化可能会对整个数据库产生强烈影响。
通过将数据用于治理目的,政府可以获得强有力的工具,以提高执法的效率和精准度。个性化法律等举措承诺通过为个人量身定制法律规范来提升效率,并减少法律的过度覆盖或覆盖不足。然而,正如本文所论证的,这种“数据治理”并非没有代价。它可能会产生内在的紧张关系,甚至与数据资本主义的商业逻辑发生冲突。
一旦引入数据治理,它可能会通过寒蝉效应扭曲其所依赖的数据市场。由于数据主体的担忧、对私人数据被用于公共监控的恐惧,以及对自身行为可能引发的法律后果的策略性规避,数据收集的动力、质量和多样性可能会受到破坏。更关键的是,这种扭曲不仅限于数据收集本身,还会蔓延至数据驱动型产品的开发及创新过程,进而损害社会福利。
我们需要警惕的是,将数据用于治理可能会改变数据生态系统中的风险与收益格局。数据共享不再仅仅是一个技术或合规性问题,它触及了数据驱动型创新的核心。如果我们只关注执法的即时便利,而忽视了其对长期创新环境和市场动态的连锁反应,那么“个性化法律”很可能会从一种法律科学的前沿构想,变成损害数据驱动型经济发展的制度负担。
目前,关于如何解决这些紧张关系的讨论才刚刚起步。虽然透明度、问责机制、或赋予数据主体更多的控制权(如“请勿追踪”清单)可以作为缓解措施,但它们往往只能解决滥用或误用的问题,却无法触及更深层次的结构性矛盾。此外,这些缓解措施本身也伴随着高昂的成本,并要求公众对政府持有极高的信任。
总结而言,为了确保数据治理确实能增进社会福祉,我们需要超越对隐私和公民自由的传统关注,重新审视数据共享对市场创新、经济增长以及法律执法效率之间复杂的互动关系。在个性化法律真正成为现实之前,我们必须首先认清并认真分析这些潜在的负面影响。本文旨在为此研究方向迈出第一步。