科学网—No.10.当“去标识化”标准各不相同:谁在守护你的数字病历?
精选
已有 99 次阅读
2026-9-24 19:20
| 系统分类: 观点评述

No.10.当“去标识化”标准各不相同:谁在守护你的数字病历?
郭茹月
2026 年 4 月,一场特殊的“黑客挑战赛”引发关注。《自然》( Nature )旗下期刊《科学数据》( Scientific Data )召集了 68 名技术高手,对 38 份经“去标识化”处理的医学影像数据进行重识别,试图还原患者真实身份,并设立了丰厚的奖金激励。其结果是:无人成功 [ [1] ] 。
这样的结果看似令人安心,但主办方同时报告:多个团队仅凭数据中的语言信息和元数据,就精准锁定了数据来源的医院。他们距离真正的身份识别,只差一步。
这揭示了一个被长期忽视的真相:去标识化不是一道安全或不安全的是非题,而是一场永无止境的“猫鼠游戏”。

去标识化,不只是“涂掉姓名”
很多人以为,删除姓名、身份证号、电话号码,数据就“安全”了。但去标识化的技术内涵远比这复杂。传统的技术手段主要有三类 [ [2] ] :一是抑制技术,即删除直接标识符,如姓名、身份证号、电话号码等信息;二是泛化技术,即把“ 35 岁”模糊为“ 30~40 岁”,或把精确邮编模糊为城市区域,“牺牲”精度换隐私;三是假名化技术,即把患者 ID 替换为代号,原始映射关系单独保管 [ [3] ] 。
近年来,两项进阶技术正逐步成为行业新宠。其一是 K- 匿名( k-anonymity ),它要求数据的任意一条记录与其他 K-1 条记录不可区分,确保某个数据不会被轻易地从数据群中“拎”出来 [ [4] ] 。其二是差分隐私( Differential Privacy ),通过在查询结果中加入经过精确计算的“数学噪音”,使任何人都无法反推某条特定记录是否在数据库中 [ [5] ] 。这是一种可量化的、数学上可证明的隐私保护手段。
值得注意的是,在欧盟《通用数据保护条例》( GDPR )框架下,假名化数据仍属于“个人数据”,依然受到严格监管;只有经过不可逆处理、无法再识别个人的匿名化数据,才能脱离欧盟 GDPR 的管辖[ [6] ]。这一区分恰恰说明,不同技术手段对应着完全不同的法律责任,去标识化从来不是“做没做”的问题,而是“做到什么程度”的问题。
全球标准:一场没有统一规则的游戏
目前全球并无统一的去标识化标准,不同国家或地区遵循不同的技术规则。
美国走的是“清单式合规”路线[6],在其设定的安全港路径下,只需移除 18 类指定标识符(姓名、电话、社保账号等),数据即被视为安全。这种路线规则清晰,执行简便。
欧盟则从数据接收方能否重识别的视角出发,其核心问题是解决“是否有人能识别出精确的数据来源”。英国则采用“动机入侵者测试”,假设存在一个足够努力、不择手段的攻击者,来测试数据能否扛得住攻击。
中国发布了《信息安全技术 个人信息去标识化效果评估指南》,系统性地引入了标识度分级概念,把数据中的属性分为“直接标识符”(如姓名)和“准标识符”(如罕见病诊断、特殊检验指标), [ [7] ] 并通过计算“唯一性概率”来量化重识别风险。
韩国则提出基于数据使用环境的分级。例如,封闭网络(如医院内部研究)可宽松处理;公共网络(如开放数据平台)须最严标准;受限环境(如经伦理委员会审批的科研项目)适用中等标准。这种方式承认了“安全”取决于数据在哪里、给谁用。
从表面上看,各国标准的差异是技术规范的不同。但深究下去,每一种标准背后都暗含了一个伦理前提:隐私是什么?美国的“清单式合规”把隐私视为可被规则框定的合规对象;欧盟的“结果导向”把隐私视为不可让渡的人格权利;中国的“分级定量”则把隐私视为需要在安全与利用之间动态权衡的公共资源。标准之争,本质上是隐私观之争。

标准各异的科技伦理后果
技术标准差异背后,是不同的伦理选择。这些差异将带来以下三个方面的风险:
第一,跨国数据的重识别风险。在美国被视为“已去标识”的数据,在欧盟可能仍属于“个人信息”。提供方声称安全,接收方却可能用更先进的技术重新识别,责任归属模糊。当医疗数据跨境流动时,患者的隐私保护水平取决于数据“落地”的国家,而不是“起飞”的国家——这本身就是一种伦理上的保护洼地。
第二,“匿名化迷思”依然普遍。即使删掉姓名,如罕见病诊断、特殊检验指标组合、极端年龄等“准标识符”仍可能组合成独一无二的“数字指纹”,精准指向个人。近年的研究证实:利用大语言模型对去标识化的临床文本进行对抗性攻击,可以显著突破传统去标识化工具的防护;甚至连心电图( ECG )这类生理信号数据中,仍残留着足以实现个体重识别的生物特征信息。匿名化,远没有想象中那么“彻底”。
第三,知情同意的“时间错配”。试想:一位患者在 2016 年签署知情同意书,同意自己的病历数据用于某项癌症研究。在当时的技术条件下,这些数据经过常规去标识化处理后确实“无法识别个人”。但十年后的今天,大语言模型可以从一段匿名的临床笔记中,通过语义关联、写作风格、时间线索等多维度信息,以远超当年的精度重新锁定患者身份。当初的同意,是否覆盖了今天的重识别风险?这就是“后可识别性”时代最尖锐的伦理困境 [ [8] ] ——识别性不再是数据的固有属性,而是随技术动态变化的关系。

医疗数据安全的“猫鼠游戏”,何以为终?
标准差异可以在技术、法律、组织层面弥合,但前提是各领域愿就一条底线达成共识:不把风险的代价转嫁给毫不知情的数据提供者。去标识化的真正安全,不在于找到一套完美的、一劳永逸的技术标准,而在于建立动态、透明、可问责的制度安排——让数据的“匿名”状态在技术变化和社会需求中持续被审视、被更新、被监督。
不同国家可以有不同标准,但底线应当共通:每一次重识别风险评估是公开的,每一次数据使用在伦理框架内接受审视,每一个数据提供者有权在充分知情的前提下做出选择。
在这场“猫鼠游戏”里,技术始终在迭代,攻击手段始终在进化。但无论算法如何精密、标准如何繁复,我们最终要保护的,从来不是数据本身,而是数据背后那个活生生的人。
作者:郭茹月,上海交通大学科学史与科学文化研究院博士后;
审核:李侠,上海交通大学科学史与科学文化研究院教授。
图片来源:科普中国素材库
参考文献
[ [1] ] Catalán Flores R., Gómez-Rico Junquero I., Jiménez Gómez P., et al. From Theory to Practice: Re-identification Challenge to Test Imaging Data Pseudonymization Effectiveness [J]. Scientific Data, 2026, 13(1): 1111.
[ [2] ] 邹先虎 . 医疗大数据场景下“数据脱敏”的术语界定、技术适配与风险防控研究 [J]. 中国科技术语 , 2026, 28 (3): 95-97.
[ [3] ] 张省 , 赵孟桥 . 健康医疗数据共享中的个人隐私保护问题分析 [J]. 中国医学伦理学 ,2026,39(4):449-458.
[ [4] ] 岳思 , 吴伟明 , 谷勇浩 . 数据发布中 k- 匿名隐私保护技术研究 [J]. 软件 ,2017,38(11):12-17.
[ [5] ] 杨济华 , 郭程 . 差分隐私数据保护技术分析 [J]. 电子世界 ,2016,(17):92.
[[6]] 谢安明,金涛,周涛.个人信息去标识化框架及标准化[J].大数据,2017,3(5):20-29.
[[7]] 蔡蔚然.去标识化个人信息分级处理的规则体系[J].山东社会科学,2023,(2):185-192.
[ [8] ] Morris J. X., Campion T. R., Nutheti S. L., et al. DIRI: Adversarial Patient Reidentification with Large Language Models for Evaluating Clinical Text Anonymization [J]. AMIA Joint Summits on Translational Science proceedings AMIA Joint Summits on Translational Science, 2024, 2025: 355-364.
【博主跋】 这是人工智能伦理系列的第时篇,2026-9-15日发表在《科普中国》网站上,这是原稿,与邹老师合作愉快,是为记!
2026-09-24于办公室临屏涂鸦
转载本文请联系原作者获取授权,同时请注明本文来自李侠科学网博客。 链接地址: https://blog.sciencenet.cn/blog-829-1554006.html
上一篇: No9.免费的陷阱与流浪的隐私 欢迎参加科学网十佳博文评选活动! 主办单位:
支持单位: 