基于深度强化学习的车载隐私保护

车载自组织网络中的隐私保护深度强化学习

摘要

道路车辆数量的增加导致了更多的伤亡和事故。因此,制造业正在致力于提升驾驶员安全,以确保车载自组织网络中的安全可靠交通。此外,移动车辆在特定地理区域内运行,并通过无线介质在一定范围内与路侧单元进行通信。车联网已成为一种新型网络类型,其中车辆通过公共网络与应用程序进行通信。这导致了数据探索的增加以及网络安全相关威胁的上升。我们提出一种深度强化学习方法,用于对通过车载自组织网络连接的特定车辆的私人信息进行敏感化处理,通过净化处理在安全与隐私之间保持平衡。此外,我们为车载自组织网络提供了一系列建议和潜在应用作为使用案例。

引言

移动自组织网络(MANET)是一种动态网络技术,能够实现自配置、无基础设施和自主的特性。车载自组织网络(VANET)是MANET的一个子类型,其中车载节点通过无线网络进行通信。由于拓扑结构动态变化,车载节点频繁加入和离开网络,如图1所示。其主要组成部分包括车辆、路侧单元(RSU)、车对车(V2V)、车对基础设施(V2I)以及基础设施对基础设施(I2I)。

MANET与VANET之间的另一个显著区别在于,车辆节点的速率和类型无法被预测,提前导致随机、不对称的车辆的渐进密度,且大部分未知。随着物联网技术的实施,车载自组织网络变得更具动态性、更可靠且高度灵活,以应对这些挑战。这推动了应用和服务的进步,即所谓的车联网(IoV),是“Internet of Vehicles”的缩写。图1展示了车联网基础设施。然而,进步总是伴随着安全问题的暴露,影响车辆节点与网络之间的信任。车载自组织网络通常规模较车联网更小。

车联网集成了通过全球网络连接的车辆,其中车辆基础设施与互联网相连,为车辆提供一系列应用和服务。此外,由于高层建筑以及道路网络中的各种不一致性等多种约束,车载自组织网络(VANET)节点经常在网络中出现和消失。与此同时,车联网(IoV)似乎不受上述约束的影响。IoV提供了与多种服务、功能和应用的连接性;然而,安全与隐私仍然是问题,特别是用于公共交通的车辆。我们已经看到,车载自组织网络(VANET)是任何智能交通系统(ITS)的关键组成部分,因为VANET的主要目的是在时刻t为驾驶员和出行者提供安全可靠的交通服务。

车载自组织网络有三个主要目的:利用交通网络实现道路安全、舒适性和信息娱乐以及交通管理。

示意图0

安全应用的主要目标是减少事故并挽救生命。通过使用网络中的车载节点,可以实现及时的警告消息。一些早期警告消息包括碰撞警告、关于危险状况的建议以及变道辅助。其他车载自组织网络VANETs的交通管理应用包括拥堵规避或速度限制通知。我们可以看到,信息娱乐应用能够提供增强任何驾驶员体验的服务。这些基于信息娱乐的应用均需要互联网连接。车载自组织网络的主要目标是使驾驶更加安全和可靠。因此,安全的网络通信至关重要。在执法和第一响应者的背景下,车载自组织网络的敏感性变得更加突出。因此,本研究旨在解决智能交通系统(ITS)中车载网络的安全与隐私问题。

通过5G网络连接的车载自组织网络中产生的数据流量非常庞大。这些数据推动了用于隐含信息发现的数据挖掘领域的先进技术的发展。管理者或决策者随后利用提取和挖掘出的数据来制定和更新政策。然而,过多的数据开放在隐私保护领域引起了关注。由于数据挖掘旨在从数据中寻找模式和有价值的信息,而这些信息可能揭示敏感的个人隐私信息,进而可能导致车辆通信中的信任面临高风险的安全问题。

大多数情况下,研究人员使用启发式和元启发式方法来净化敏感信息。本文提出了将隐私保护数据挖掘(PPDM)问题与深度强化学习(Q学习模型)相结合的思想。该提出的模型接收输入状态并预测动作。这种方法的一个优势是只需调整较少的参数,并在保持效用的同时隐藏敏感信息。Q学习模型有助于预测过程,并能够实现良好的泛化能力。

我们的模型能够动态地发现实例并对它们进行扰动,从而在无需预定义规则的情况下成功隐藏信息。同时,它还能动态地维持数据的效用。

相关工作

安全与隐私问题在数据呈指数级增长的背景下被视为一个至关重要的研究领域。在数据流中,类模型的 l‐多样性与 k‐匿名性被用于实现过程的匿名化。标准的 K‐均值算法被应用于数据隐私和净化处理过程中。通过提出的模型,加密和数据效用得到了提升。这些是机器学习(ML)以及数据挖掘领域中使用的一种标准方法。在无线介质中,车载自组织网络(VANETs)中的网络威胁和攻击利用了无线电通信广播技术。在无线通信介质上传输的数据必须得到安全保障,否则可能引起对手不必要的关注。

用户车辆的私人信息必须在车载节点间的信息交换中得到保护。此外,管控机构应在保留驾驶员隐私的同时保护其私有身份。与车辆网络相关的隐私应成为车载自组织网络中的关键组成部分。在未知车辆中广播的伪造信息和对抗性信息可能对驾驶员和行人的安全造成严重后果。另一方面,如果可信安全消息也可能通过车载自组织网络中的组件使用对抗性信息发送,则会导致信息延迟和修改。这将对人类生命造成严重后果。这意味着与安全相关的合法且准确信息在车载自组织网络中也需要同等的安全级别。

车载自组织网络与数据清理

为了实现服务和应用的通信,车载自组织网络(VANETs)包含应用单元(A.U.)、车载单元(OBU)以及路侧单元(RSU)。这些RSU通过互联网连接,以提供服务任务。如图1所示,以下的应用单元是VANETs的基本组成部分,并对每一部分进行简要描述:应用单元使用一个应用并处理网络问题。A.U.与OBU结合,并通过无线介质进行通信。该应用可以控制OBU。OBU有助于在VANET架构中利用IEEE 802.11p无线技术连接各网络组件,包括OBUs和RSUs。OBU主要由多种传感器(即无线通信元件)、中央控制模块(CCM)和接口组件组成。CCM为用户提供界面以执行资源命令处理(RCP),并包含用于通过收发器进行读写操作的存储器。传感器数据通常由OBU处理;提出的模型也部署于此,以隐藏敏感信息。OBU还提供车辆的地理位置、自组织路由、数据安全、网络拥塞控制机制、消息传播以及IP移动性。RSU是位于道路上的固定基础设施,为车辆环境中的无线接入(WAVE)或专用短程通信(DSRC)设备提供无线访问。它基于IEEE 802.11p无线技术,以实现与道路上车辆的通信。RSU还在无线自组织网络中提供接入点(A.P.)。RSU的功能包括信息娱乐、交通状态共享、来自中央机构的安全消息。它还提供OBUs之间的消息共享以扩展通信,作为OBUs的网关,并作为数据源提供基础设施到车辆的通信。所有RSUs(位于特定地理区域内的)都可以相互通信并互连。可信机构负责控制TSUs,能够处理高复杂度计算并提供高存储容量。T.A.s旨在认证所有车辆,并验证与车辆相关的安全,防止其传输虚假消息。它还验证数字签名和证书。

攻击者利用虚假的交通紧急情况伪造信号。当黑客识别变得无法追踪时,这种通信错误方式已成功变得更加有效。因此,有必要提高通信的安全性。数据清理方法被引入,其中优化模型利用基于进化算法。该方法首先选择关键效用事务,然后对其进行聚类以隐藏敏感信息。基于规则的方法也被用于数据隐私保护。所使用的模型采用k‐匿名不精确规则来构建数据表。所构建的数据随后用于保护隐私能力。车辆传感器数据也根据模型预测用于电机转矩。该模型用于闭合系统工程之间的环路。模型输出被应用于搭载电驱动力系统的车辆。针对新冠肺炎患者也进行了隐私保护的通话数据记录分析(CDRA),以控制大流行。

问题陈述

如图2和图3所示,车联网环境下的隐私保护数据挖掘(PPDM)包括路侧单元(RSU)、车对车(V2V)、车对基础设施(V2I)、基础设施对基础设施(I2I)以及可信权威机构(T.A.)。图2中提到了智能车联网(IIOVT)网络的RSU和T.A.,二者均使用不同的车载单元传感器采集数据,并通过图2中提到的RSU和T.A.共享给隐私保护数据挖掘(PPDM)算法。一旦净化处理完成且数据被存储,就会进行群体匿名化以隐藏任何群体信息。

示意图1

我们可以将该方法视为如图3所示并在算法1中描述的方法。在步骤1中,模型将其所有参数作为输入。接下来,算法提取所有的F.I.s,即频繁项集 F itemsets ={f1 , f2 ,…, fk}。这些频繁项集的支持度计数值必须不小于(算法1,第1行)中给定的最小支持度计数值。基于频繁项集,我们选择20%的频繁项集用于效用和数据清理。我们投影每个项目集从原始数据集中的实例 InsI.D.,如(算法1,第2行)所示。接下来,我们可以将状态表示为一组实例 InsI.D. ,如(算法1,第3行)所示。我们初始化 Q 表并同时设置探索率。该模型基于ε‐贪心策略引入随机性,如[12], 所示,每个回合据此更新,如(算法1,第4‐6行)所示。动作奖励 R rep‐表示根据动作、状态和下一个状态引起的变化(算法1,第10行),然后使用适应度函数进行计算(算法1,第7至13行)。

使用公式(1),可以找到状态的适应度值。我们仅针对删除操作计算适应度值。为了更新 Q表,采用贝尔曼方程,如(算法1, 第12至13行)所示。每个循环中,通过随机删除点选择实例集。我们的模型利用该实例集进行训练,并使用输入特征的长度 InsID,以及动作(删除/不删除)、下一状态(若动作为=删除)来进行强化学习(R.L.),如(算法1,第13行)所示。在回合结束时,我们的模型最小化适应度值,这反过来表明需要对实例集(传感器数据)进行删除以隐藏敏感项集,如(算法1, 3, 16行)所示。如图中所述,训练阶段基于算法1进行。在基于循环神经网络的 LSTM网络中——一个状态表示实例(车载传感器数据)具有两个动作(删除或不删除),这会导致另一个状态,该状态是前一个和当前状态的并集。需要注意的是,这两个决策在删除时会根据项目集实例的不同而产生不同的适应度值。随后,在隐私保护阶段,使用经过算法1训练的网络进行决策,从而得到适应度值。该适应度值用于计算如图3隐私保护阶段所述的隐私保护副作用。当删除特定项目集时,数据对每个实例都会产生特定影响。

每个样本的影响可以通过适应度函数计算得出,代表了公式1和图3隐私保护阶段中提到的隐私保护质量。

状态:设 s=[p, h, b]:为实例集合 p ∈ R+D,其中我们看到在时刻t删除实例 h ∈ Z+D的代价,以及净化处理后剩余的实例,表示为 b ∈ R+,其中 D是投影数据集中的实例数量, Z+表示非负整数。

动作:设在 s上存在一组动作,即删除/不删除。如果动作为删除,则且只有此时才会导致实例在 st+1和 st中的并集。如果动作为不删除,则不会执行并集操作。该动作将导致适应度值增加/减少,如公式1所示,其中 α可被视为净化前后敏感项集比例的隐藏程度,β可定义为净化前后频繁项集(F.I.s)的数量。此外,我们可以说 δ 被定义为在净化后的数据库 D ′中存在但在原始数据库 D中原本不频繁的频繁项集数量,其中 w1, w2,…, w3是每个副作用相对重要性的权重,其值由用户在运行时于范围内设定[0, 1]。

政策:我们定义 π(s):为删除/不删除状态 s的方法。我们将 a在状态 s处的概率分布定义为政策。

奖励:让我们定义 r(s, a, s′ )为仅当在状态 s执行动作 a并到达新状态 s′时可能发生的适应度值的变化。在政策中,只有当动作被删除时,才计算适应度值。如果适应度值下降,则奖励为10。否则,我们将奖励设为 −10。贝尔曼方程最初在[12],中给出,其中动作奖励 at的期望为 r(st, at, st+1)。我们注意到,折扣因子 γ被返回仅基于一个假设。我们方法的目标是在给定目标时刻 tf最小化适应度值。我们模型的马尔可夫属性,通过优化策略以最小化函数 Qπ(st, at)。在考虑与环境的交互的同时对适应度值进行优化,我们的策略得以学习。状态、动作和奖励的示例表格见表 I。a, b, c, d, e代表车辆传感器数据。

状态 T ID a b c d e 动作 / 政策 奖励 适应度值
1 1 1 1 0 0 1 删除 10 1
2 34 0 1 1 0 1 删除 10 0.5
3 9 1 1 1 0 1 删除 10 0.3
4 14 1 0 1 1 0 no 删除 -10 0.3
5 16 0 1 1 0 1 无删除 -10 0.3

深度强化学习(DRL)

我们提出了基于LSTM的网络,如图3所示。该架构的输入为传感器输入值,输出为 delete 或 not−delete,构成一个二分类问题。我们还提出了一种基于窗口的时间步长方法。将前一状态及其预测的适应度值作为输入特征加入。由于车载通信频率非常高,我们将窗口时间步长设置为2。因此,(t+1)结合了前两个(t − 1和 t − 2)决策及其适应度值。通过这种方式,模型能够重新学习复杂模式,并尝试实现泛化[13]。

模型输入包括编码后的项目值、先前的决策以及适应度值,组成输入向量。在解码器网络中添加了 Dense层以生成输出。在编码器和解码器网络中,使用修正线性单元 ReLU作为激活函数,其定义为 f(x)= max(0, x)。为了避免过拟合,应采用 Dropout机制。使用 Adam优化算法作为优化器,该算法在LSTM的训练中非常有效。

示意图2

算法 1 Deep净化 强化学习(DSRL)

输入: D,OBU数据集,支持阈值 ε,敏感信息比例项集 P,状态大小 S,回合大小 M 最小化适应度值动作。

1: 从计算出的频繁项集中使用 P选择敏感项集 基于 ε
2: 从 D中获取选择的敏感项集的 TID
3: 根据 TID的随机集合选择集合 S组合
4: 对于 episode= 1, M执行
5: 采取随机决策 N以进行动作探索
6: 根据状态 s1接收输出 N
7: 对于 t= ,1 S do
8: 根据 N采取动作
9: 执行(动作 at,观察奖励 rt,状态 st+1)
10: R←转移(st, at, rt, st+1)
11: Train DRL←输入(动作 at,奖励 rt)
12: 使用 N 更新贝尔曼方程
13: 更新 Train DRL(动作 at)
14: end for
15: 结束循环
16: 返回 States、 action 和 fitness value

车载自组织网络的安全与隐私需求

车载网络收集包括配备医疗保健、智慧城市和监控的传感器在内的各种数据。在动态车载自组织网络中,数据碎片化对从业者来说是一个挑战。在案例研究[14],[15],中,自动驾驶车辆的数量表明了网络漏洞。

通过通信系统,黑客以电子控制单元程序为目标,并试图破坏车辆网络。结果导致车辆行为异常。这促使必须采取强有力的通信网络安全措施,包括在车辆端部署入侵检测系统。针对传感器通信采用了保护隐私的方法,同时对移动应用和服务器进行频繁日志审查。一旦发现任何漏洞,[14]应立即通知车主和制造商,以便在攻击发生前采取应对措施。我们为车载自组织网络组件车载单元提出了一种数据净化处理。该功能仅与其他无线连接的组件共享有限的数据。采用深度学习方法来改进并学习传感器的模式。我们尝试证明DQRL模型足以在通信过程中隐藏私人信息。通过净化处理,可在某些公共数据点上移除敏感信息。该框架可以帮助希望隐藏信息的用户,特别是针对私人事件的情况。车载自组织网络配备了多个传感器,用于采集温度、湿度、摄像头、加速度传感器、超声波、接近传感器以及气体等数据。这些传感器数值对于智慧城市评估和改进交通系统至关重要。然而,在收集传感器数据点的同时,也会处理到可能使用户面临风险的私人信息。

数据安全 :在公共无线连接中的通信数据安全至关重要。正确及时的消息传递可以保障安全,而恶意节点注入对抗模型导致的错误信息则可能造成致命后果。数据安全与隐私要求突显了本研究的重要性,这些要求可通过提出的模型得以降低。若无法满足这些要求,将导致车载自组织网络中的漏洞。所提出的模型能够满足车载自组织网络中的安全与隐私问题。

完整性与数据可信 :双方之间传输的数据不应被篡改。内容应保持未修改且不丢失。当数据被修改时,即破坏了完整性。应采用此类检测机制。

认证与识别 :所有连接的节点必须经过认证,以确保受保护的数据传输。必须阻止未经授权的访问,以保障节点通信和消息的安全。此外,用户的身份应使用提出的模型进行保护。因此,恶意节点无法复制真实节点的身份。一旦被攻破,恶意节点可能删除警告消息;从而导致驾驶员可能无法按照指示作出响应。类似于Sybil攻击,此类攻击可通过使用唯一ID机制[8]加以防范。向执法机构提供法律法医证据需要强有力的认证过程,以避免任何对抗性攻击[8]。只有经过认证的车载节点和授权车辆才能访问路侧单元并从车载自组织网络[8]的服务中受益。

可用性 :即使在遭受D/DoS或干扰攻击[3]或其他恶意活动[8]的情况下,车载节点也应能够发送和接收消息。例如,在特定区域,由于受到攻击,服务器在高度拥堵的区域无法通信。可用性需要高带宽和连接性。当某些消息延迟或未能实时传输时,可用性的重要性便凸显出来。结果,这些消息会失去其价值(例如关于道路状况的消息),甚至可能对网络中的用户造成危害(例如危险报告消息)[8]。

隐私和机密性 :即使存在责任连接,也必须保护车辆和驾驶员的隐私。所提出的有用模型去除了个人身份信息,以避免身份盗窃问题。驾驶员、车辆和位置的真实身份应始终受到保护。只有官方机构才能查看驾驶员和车辆的身份。

去污方法的建议 :在去污过程中,应进行车载节点数据可扩展性分析,并确定需要共享的信息。应分析车辆内部的车辆传感器数据关系。应根据实例数量(传感器的数据速率)执行维度大小分析(传感器数量)。还应进行模态分析,以分析模型分布。异常值通常会降低模型性能[16]。必须考虑噪声和污染(异常)分析[16]。DSRL的不平衡数据分布会导致性能下降。特别是,应考虑以下建议。

问题识别 :对于车载自组织网络应用,机器学习引擎工程师应明确要通过净化处理解决的问题。

客户端检测 :某些应用会缓存车辆传感器数据以用于模型预测。应针对网络交互进行数据检测。

仿真原型 :应使用有效的测试数据[16]来测试模型架构和超参数调优。目的是仔细监控数据分布漂移及其在模拟在线生产系统中的性能。

深度学习模型训练 :应训练并测试不同架构,以检查对抗攻击兼容性。模型应被优化,并进行超参数调优[16]。

模型评估 :模型应在不同的测试用例下进行训练和测试。

部署 :在部署时,应选择最佳的模型配置。

结论

我们提出了一种数据净化模型,用于隐藏敏感信息。该模型能够分析车载单元传感器,并利用强化学习方法将其隐藏。该方法可结合适应度函数进行调整,并获取反馈回复集成方法,以纠正错误决策。时间序列的附加特征也可被采用,包括不确定性、效用、频率和共现性。

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值