文章目录
问题现象
在最近一个涉及医疗数据分析的联邦学习项目中,我们遇到了一个典型的“数据隐私悖论”。业务方希望我们利用多家医院的脱敏数据训练一个疾病预测模型,同时反复强调:“数据绝对不能离开医院,模型也不能泄露任何单一患者的隐私信息。”我们初期采用传统的加密传输和结果聚合,本以为万事大吉。直到安全审计时,红队专家通过分析我们发布的全局模型参数,结合其中一家医院的辅助信息,竟然以较高的置信度推断出了某个特定患者是否患有某种敏感疾病。那一刻,我们才深刻意识到,仅仅对数据“静态脱敏”或“加密传输”,在复杂的机器学习场景下,隐私泄露的风险依然巨大。模型本身,就可能是一个“隐私泄露器”。
这次事件迫使我们系统性地研究和应用真正的隐私保护技术。在实践过程中,差分隐私(Differential Privacy, DP) 和同态加密(Homomorphic Encryption, HE) 是两座绕不开的大山,它们理念强大,但坑也又多又深。今天,我就结合自己的踩坑经历,来盘一盘这两项技术。
排查过程:为什么传统方法会失效?
我们先复盘一下当初为什么“翻车”。传统的做法可以概括为:
- 数据脱敏:移除直接标识符(如姓名、ID)。
- 安全通道:使用TLS等加密技术传输数据或梯度。
- 聚合:在服务器端对来自各客户端的更新进行平均。
问题出在哪里?在于模型记忆性
订阅专栏 解锁全文
&spm=1001.2101.3001.5002&articleId=161008271&d=1&t=3&u=29137283b0fb449baa745a8bc3221391)
2831

被折叠的 条评论
为什么被折叠?



