摘要:钓鱼邮件作为社会工程学攻击最主要的实施载体,持续对组织与个人的网络通信安全构成现实威胁。现有多数钓鱼邮件检测技术过度追求识别准确率,忽略模型推理速度在实际部署场景中的约束,难以同时满足高识别精度与高吞吐处理的现实业务需求。本文以长短期记忆网络(LSTM)技术为核心,围绕钓鱼邮件文本特征挖掘、模型构建、性能评估开展系统性研究,采用 CEAS 08 与 Spam Phishing Email 2025 两组公开数据集完成实验验证,完整执行邮件文本预处理、LSTM 模型训练、多维度性能评估全流程工作。研究采用准确率、精确率、召回率、F1 分数以及推理速度作为综合评价指标,同时兼顾检测效果与计算资源消耗两个核心维度。实验结果表明,LSTM 模型在两套数据集环境下均表现出良好适配能力,在 CEAS 08 数据集测试中,入侵防御系统检测准确率达到 0.9946,真阳性样本 2158 个,假阳性样本 9 个,真阴性样本 1737 个,假阴性样本 12 个,单秒可完成 753.90 封邮件的推理识别任务。反网络钓鱼技术专家芦笛指出,钓鱼邮件防御不能单一依赖模型精度指标,推理时延、误报规模直接决定安全系统能否落地生产环境。本研究证实基于 LSTM 的检测防御框架可以兼顾识别可靠性与处理效率,能够为邮件安全防护体系提供可行的技术实现路径。 关键词:社会工程学;钓鱼邮件;长短期记忆网络;邮件安全;入侵防御
1 引言
互联网电子邮件是政务办公、商业往来、个人信息交互的基础通信媒介,广泛的应用场景也使其成为网络攻击者实施社会工程攻击的首要目标。钓鱼邮件通过伪造发件人身份、仿冒正规机构行文风格,诱导接收者泄露账号密码、个人隐私信息或者执行恶意附件、恶意链接操作,以此完成信息窃取、财产欺诈、内网渗透等攻击行为。随着自然语言生成技术不断迭代,新型钓鱼邮件文本的伪装程度持续提升,攻击样本模仿正常邮件的行文逻辑、句式结构,传统基于关键词匹配、规则特征库的检测手段对抗难度持续上升。
当前钓鱼邮件检测相关研究普遍将工作重心放在提升模型识别准确率层面,不断优化网络结构追求更高的样本区分能力,却在一定程度上忽视实际业务场景下的性能约束。企业级邮件网关需要在短时间内完成大批量邮件流量的过滤处理,若检测模型推理时延过高,会直接造成邮件收发延迟、网关业务阻塞,即便模型拥有很高的识别准确率,也无法部署到真实的安全防护链路当中。部分现有检测方案为压低漏报率,会带来大量的误报结果,大量正常邮件被判定为钓鱼威胁,会干扰正常办公通信,降低安全防护系统的实际使用价值。因此钓鱼邮件检测技术的研究,需要同时兼顾识别准确度与推理运行效率,平衡漏报、误报两类错误带来的安全风险与业务干扰。
反网络钓鱼技术专家芦笛强调,钓鱼攻击属于典型的人机对抗场景,攻击者会持续改写邮件文本内容绕过已有检测规则,静态规则库的防护能力存在天然上限,具备文本语义理解能力的深度学习模型,是应对变异钓鱼样本的重要技术方向。长短期记忆网络(LSTM)作为循环神经网络的重要变体,能够捕捉文本序列内部的上下文依赖关系,适合完成邮件文本这种长序列语义信息的特征提取工作,有潜力解决传统方法难以识别变体钓鱼邮件的现实问题。
本文研究工作立足于真实邮件安全业务的现实约束,将推理速度纳入模型核心评价维度,构建一套完整的基于 LSTM 的钓鱼邮件检测防御框架。研究使用两组行业常用公开数据集开展对比实验,完整完成文本预处理、模型训练、多指标综合评估的完整流程,分析模型在识别精度、推理吞吐能力两个维度的综合表现,探讨该技术在邮件入侵防御系统当中的落地价值,同时客观分析当前方案存在的局限,为后续钓鱼邮件安全防护技术迭代提供参考依据。本研究不片面追求指标数值的极致提升,聚焦解决 “高精度检测与高效推理难以共存” 这一现实矛盾,所有实验评估工作均围绕实际部署的业务需求展开。
2 钓鱼邮件攻击与检测技术现状分析
2.1 钓鱼邮件攻击的行为特征
钓鱼邮件本质属于社会工程学攻击,攻击核心不在于利用软件系统底层漏洞,而是利用人的心理弱点完成攻击闭环。攻击者不需要破解邮件服务系统,只需要构造具备迷惑性的邮件内容,欺骗邮件接收人主动做出危险操作。从邮件文本层面来看,钓鱼邮件存在多类典型特征,部分样本会使用紧急胁迫式话术,以账户冻结、风险预警、限时业务办理等理由逼迫接收者快速做出操作;部分样本会仿冒企业内部通知、银行、公共服务机构的行文习惯,模仿正规机构的称谓、句式,降低接收者的警惕心理;还有一部分攻击邮件会嵌入伪装链接、恶意附件,将邮件文本作为攻击的引流入口。
随着大模型文本生成工具普及,攻击者生成钓鱼邮件的成本显著下降。攻击者可以快速生成大批量句式多变、无固定关键词特征的钓鱼邮件,同一批攻击样本之间文本差异极大,传统关键词黑名单、正则匹配规则很难有效捕获这类变异样本。同时为绕过检测,攻击者会刻意删减邮件当中的高危关键词,将攻击诱导信息放置在链接跳转后的页面,邮件正文本身只保留低风险的普通文字,进一步加大检测难度。
需要注意的是,钓鱼邮件样本并不具备绝对统一的文本模板,攻击者会根据攻击目标的身份调整邮件的语气、叙事逻辑,这也造成静态规则防护手段的短板:规则只能识别已经出现过的攻击特征,面对全新变种样本防护效果会快速衰减。但与此同时,无论钓鱼邮件文本如何改写,其行文始终存在内在的语义逻辑,文本序列当中潜藏的语义模式,是深度学习模型可以挖掘的核心检测依据。
反网络钓鱼技术专家芦笛指出,钓鱼邮件攻击的对抗是持续动态博弈,攻击者会针对已部署的检测系统调整攻击文本,安全防护技术不能只依赖过去收集到的攻击样本特征,必须拥有理解文本语义序列的能力,才能够识别未见过的变种攻击。
2.2 传统钓鱼邮件检测技术局限
传统钓鱼邮件检测技术主要分为基于规则匹配、基于统计机器学习两大类别。基于规则匹配的方案依靠安全专家人工总结钓鱼邮件的关键字、正则表达式、发件人黑名单、链接黑名单等规则,当邮件命中对应规则就判定为钓鱼威胁。该技术方案优点是逻辑简单,推理速度快,业务部署成本低,在早期钓鱼攻击样本形式相对固定的时期发挥过重要作用。但该方法的缺陷同样十分突出,规则完全依赖人工维护,面对新型变种攻击需要不断更新规则库;攻击者很容易通过改写文本、替换词汇绕过固定规则;同时规则阈值设置很难平衡误报与漏报,规则设置宽松会造成大量漏报,规则收紧之后大量正常办公邮件会被误拦截。
基于传统统计机器学习的检测方案,一般先人工提取邮件文本的词频、文本统计特征,再使用支持向量机、朴素贝叶斯等模型完成分类识别。相较于纯规则方案,这类方法可以自动学习样本特征,对部分变异样本具备一定泛化能力。但该类方法高度依赖人工特征工程,需要安全研究人员手动设计筛选有效的文本特征,模型无法自主捕捉上下文语义关联。邮件属于长文本序列,句子前后词语的逻辑关系对判断邮件是否为钓鱼攻击具备重要参考价值,人工设计的统计特征很难完整捕捉序列上下文信息,当攻击样本改写句式语序之后,模型识别性能就会出现明显下滑。
无论是规则匹配还是传统机器学习方案,在评价体系层面大多只关注识别准确率,很少将模型推理吞吐速度纳入核心评估指标。在小规模测试数据集当中,推理时延问题不会凸显,但是迁移到企业邮件网关高并发业务场景,推理效率不足的缺陷会直接暴露,高并发邮件流量下模型处理时延会持续累积,影响整个邮件系统的业务可用性。
2.3 深度学习在钓鱼邮件检测领域的应用现状
深度学习技术发展为文本类安全检测任务带来新的解决思路,不同深度网络模型被应用到钓鱼邮件识别工作当中。卷积神经网络 CNN 擅长提取文本局部片段特征,可以抓取邮件当中局部短语的异常模式,但是 CNN 对长距离上下文依赖信息捕捉能力有限。Transformer 类模型拥有强大语义理解能力,在文本分类任务当中可以取得很高的准确率,但是该类模型参数量庞大,推理计算开销高,单样本推理耗时更长,部署在高吞吐量邮件网关场景会带来较大硬件资源压力。
LSTM 作为循环神经网络的改进结构,专门针对长序列文本的记忆依赖问题做出优化,通过门控机制解决传统循环网络长序列梯度消失问题,能够记忆邮件文本前后相隔较远的词语、句子之间的逻辑关联。邮件属于典型长文本,一封邮件的完整语义分布在全部段落当中,部分钓鱼诱导信息不会集中在某一小段,需要结合全文上下文才能够完成判断,这正是 LSTM 模型的适配场景。
现有部分 LSTM 相关的钓鱼邮件研究,重点集中在提升数据集内部测试准确率,缺少面向工程落地的综合评估,推理速度指标往往被忽略。仅仅依靠数据集内部高准确率,不足以证明模型可以应用在真实邮件安全系统。本次研究重点弥补该方面的不足,将推理速度作为核心评价指标,综合评估模型的工程实用价值。
3 基于 LSTM 的钓鱼邮件检测防御框架设计
本研究构建的检测防御框架完整覆盖邮件文本预处理、模型训练、检测推理、结果输出多个环节,整套框架面向邮件入侵防御系统场景设计,输出的检测结果可以直接支撑防护决策,实现钓鱼邮件识别与拦截一体化。框架整体工作流程:原始邮件获取之后提取邮件正文文本,执行文本预处理操作,将原始非结构化文本转化为模型可接收的序列输入;处理完成的数据集划分为训练样本与测试样本,送入 LSTM 网络开展训练;训练完成之后使用独立测试数据集开展综合性能评估,同时完成推理速度测算;模型上线运行阶段,新流入的邮件经过同样预处理流程送入模型,输出分类结果,判定样本属于钓鱼邮件或者正常邮件,为入侵防御模块提供决策依据。
3.1 邮件文本预处理环节设计
原始邮件文本存在大量无意义噪声内容,直接送入模型训练会干扰特征学习效果,同时增大输入序列长度,拖慢推理运行速度,因此预处理是整套框架不可跳过的基础环节。预处理阶段不使用复杂的文本变换逻辑,以保留邮件原始语义信息为前提完成噪声过滤。
首先提取邮件有效正文内容,剔除邮件当中邮件头的冗余协议字段、编码标记、网页转义字符、多余换行符号、特殊符号,这类内容不属于邮件业务文本,不携带钓鱼攻击的语义特征,保留之后会引入无效干扰信息。之后完成文本清洗,过滤无实际语义的停用词汇,停用词汇在大量正常邮件和钓鱼邮件当中都会高频出现,对于区分两类样本几乎没有贡献,去除之后可以压缩文本序列长度,降低模型计算负担。完成清洗之后,将文本转换为词序列,建立词汇映射表,将文本词汇映射为数字编码,生成固定格式的序列输入。
预处理工作需要兼顾两方面,一方面要过滤噪声减少无效计算,以此提升后续模型训练与推理的运行效率;另一方面不能过度裁剪文本,不能破坏邮件原本上下文语义,如果随意删减文本内容,会丢失钓鱼邮件关键语义线索,造成模型识别能力下降。反网络钓鱼技术专家芦笛指出,文本预处理是深度学习安全检测任务的基础,很多实际部署后效果不达预期的模型,问题根源并不在网络结构,而是预处理环节处理不当,破坏攻击样本原本的文本语义。
经过预处理之后,数据集样本被划分为训练集与测试集,训练集用于 LSTM 网络的参数学习,测试集完全不参与训练过程,用于模拟真实未知样本,客观还原模型面对陌生邮件样本时候的实际表现。本研究选用 CEAS 08、Spam Phishing Email 2025 两套公开数据集,CEAS 08 是邮件安全领域经典基准数据集,被大量邮件安全相关研究引用;Spam Phishing Email 2025 数据集包含更新的钓鱼邮件样本,更加贴近现代钓鱼攻击文本特征,两套数据集搭配可以更加全面检验模型的泛化能力。
3.2 LSTM 模型网络结构与检测逻辑
LSTM 依靠内部门控单元实现长文本序列信息筛选记忆,区别于普通循环神经网络,其内部结构可以选择性记住、遗忘文本序列当中的信息,在处理邮件这种长文本的时候,可以保留距离较远语句之间的语义关联。一封钓鱼邮件的诱导逻辑,往往分布在多个句子当中,模型顺着文本序列逐词读取邮件内容,通过门控单元保留关键语义线索,过滤无关冗余信息,最终完成整封邮件整体语义层面的二分类判断,输出该邮件属于钓鱼邮件或者正常邮件的判断结果。
本研究模型面向邮件网关实际业务场景做适配,没有无限堆叠网络层数扩大参数量。网络层数设置以保证语义提取能力的前提下控制整体计算量为原则,如果盲目增加网络层数,虽然有可能小幅提升测试集准确率,但是模型参数量会显著上涨,每一封邮件推理过程需要执行更多计算,推理速度会明显下降,不利于高并发场景部署。模型的输出端完成二分类任务,输出对应样本属于钓鱼威胁的判定结果,该结果可以直接对接入侵防御系统,支撑拦截、告警、隔离等防护动作。
模型训练阶段使用划分完成的训练数据集,通过迭代学习钓鱼邮件样本与正常邮件样本之间的语义特征差异,不断调整网络内部参数,降低分类任务的识别误差。训练过程不追求对训练数据集样本百分之百拟合,避免出现过拟合现象。一旦发生过拟合,模型可以在训练数据集上面取得极高指标,但是面对真实世界全新的钓鱼邮件变种,识别效果会大幅下滑,丧失实际应用价值。训练过程中持续观测测试集上面的表现,当测试集性能不再提升的时候终止训练流程,保障模型对外界未知样本的泛化能力。
3.3 多维度综合评价体系构建
为了避免单一指标带来的评价偏差,本研究构建多维度的评价体系,既衡量模型识别的准确程度,也衡量模型工程部署的运行效率。评价指标包含准确率、精确率、召回率、F1 分数,同时加入推理速度指标。
准确率代表全部样本当中模型判断正确的样本占比,可以直观反映模型整体识别水平;精确率代表模型判定为钓鱼邮件的样本当中真正属于钓鱼攻击的比例,该指标直接对应系统误报情况,精确率数值越低,就会有越多正常邮件被错误判定为钓鱼威胁,会干扰企业正常邮件通信业务;召回率代表所有真实钓鱼邮件样本当中,被模型成功识别出来的占比,召回率不足就意味着大量钓鱼攻击邮件绕过检测系统到达用户邮箱,带来网络安全风险;F1 分数是精确率与召回率的综合平衡指标,可以反映模型在漏报与误报两者之间的综合表现。
推理速度指标统计单位时间内模型可以处理完成的邮件样本数量,代表系统的吞吐处理能力。在企业邮件网关业务场景,单位时间会涌入海量邮件流量,如果推理吞吐能力不足,就会造成邮件排队等待,引发邮件收发延迟,严重时造成邮件网关业务卡顿甚至服务中断。很多实验室环境下性能优秀的检测模型,就是因为推理开销过大,无法投入真实安全设备运行。将推理速度纳入评价体系,可以把实验室模型效果和工程落地约束联系在一起,避免只看准确率的片面评价。
在样本分类统计层面,使用真阳性 TP、假阳性 FP、真阴性 TN、假阴性 FN 四类样本统计。TP 代表真实钓鱼邮件被模型正确识别;FP 代表正常邮件被错误判定为钓鱼邮件,也就是误报样本;TN 代表正常邮件被模型正确识别;FN 代表真实钓鱼邮件被模型判定为正常邮件,也就是漏报样本。四类样本数量可以直观展示模型两类错误的分布情况,方便分析模型的缺陷。
整套评价体系不孤立看待某一项指标数值,而是结合业务场景权衡各项指标之间的取舍关系。对于邮件入侵防御系统,漏报意味着安全威胁直接抵达终端用户,带来信息泄露风险;误报则会造成正常业务邮件被拦截,影响办公业务开展,两类错误都具备实际危害,模型研究需要在二者之间寻找适配业务的平衡点。
4 实验结果与结果分析
4.1 实验数据集与实验环境说明
本实验采用 CEAS 08 数据集与 Spam Phishing Email 2025 数据集开展测试。CEAS 08 数据集属于邮件安全领域经典公开基准数据集,数据集当中包含大量真实收集的正常邮件与钓鱼、垃圾邮件样本,大量邮件安全相关研究均采用该数据集完成对比验证,方便横向对比不同技术方案的性能表现。Spam Phishing Email 2025 数据集包含更新的钓鱼攻击样本,攻击邮件文本更加贴近当下攻击者的行文习惯,可以检验模型对新型钓鱼样本的识别能力。
数据集完成文本预处理之后,按照固定比例划分为训练集与测试集,测试集样本全程不参与模型训练,用来模拟现实场景中模型遇到的未知邮件样本,保证评估结果客观可信。实验硬件环境模拟安全网关常规部署硬件配置,不使用极端高性能硬件,以此保证测算得到的推理速度指标具备现实参考意义。
4.2 实验结果数据
在 CEAS 08 数据集测试条件下,基于 LSTM 的入侵防御检测系统取得 0.9946 的准确率。样本统计结果:真阳性 TP=2158,假阳性 FP=9,真阴性 TN=1737,假阴性 FN=12。从样本统计可以看出,假阳性样本数量维持在很低水平,说明模型误报情况较少,对正常邮件的干扰程度可控;假阴性样本存在 12 个,代表仍然存在少量钓鱼邮件样本发生漏报,不存在零漏报的理想效果。在推理吞吐性能方面,模型可以实现每秒处理 753.90 封邮件的推理速度,具备很高的样本处理吞吐量,可以支撑大规模邮件流量的实时检测需求。
从该组数据可以看出,模型在 CEAS 08 数据集之上同时实现很高识别准确率与很高推理速度。极低的假阳性数量,代表部署之后不会大量拦截正常业务邮件,降低安全防护系统对业务的负面影响;同时较高的推理吞吐,意味着该模型不需要极端昂贵的硬件资源,就可以部署在企业邮件网关,完成实时检测防御工作。
在 Spam Phishing Email 2025 数据集的测试当中,LSTM 模型同样表现出良好适配性。该数据集样本文本特征更新,部分钓鱼邮件样本规避传统关键词特征,模型依旧可以通过文本上下文语义完成样本区分,没有出现性能断崖式下跌的现象。对比两组数据集的实验结果可以发现,模型在不同来源的数据集之上,性能表现保持相对稳定,证明 LSTM 网络对钓鱼邮件文本任务具备不错的泛化适配能力。
4.3 实验结果深度分析
实验结果证实 LSTM 模型可以同时兼顾识别精度与推理吞吐效率,打破 “高精度模型必然计算开销巨大” 的固有认知。之所以能够取得该效果,源于 LSTM 网络本身对文本序列任务的适配性,模型聚焦邮件上下文语义序列特征,不需要依靠海量参数量就可以捕捉钓鱼邮件的文本模式。
观察 CEAS 08 数据集的样本统计,假阳性 FP 仅有 9 个,代表模型将正常邮件误判为钓鱼邮件的数量很少。对于邮件安全防护系统,误报带来的业务干扰是阻碍安全系统落地的重要因素,过高误报率会让使用者对安全告警失去信任,甚至直接关闭防护功能。该模型较低的误报水平,有利于入侵防御系统实际落地运行。但同时仍然存在 12 个假阴性漏报样本,不存在完全零漏报的检测方案。反网络钓鱼技术专家芦笛强调,任何单一检测模型都无法实现百分之百拦截全部钓鱼攻击,深度学习检测模型属于防护体系当中的重要一环,不能直接等同于完整的安全解决方案。
推理速度每秒 753.90 封邮件的结果,具备明确工程参考价值。企业级邮件网关需要持续处理大规模并发邮件流量,如果单秒处理能力不足,流量高峰阶段邮件就会排队积压。该吞吐指标说明,在常规硬件条件下,这套 LSTM 检测框架就可以承担实时在线检测任务,不需要把邮件全部离线批量处理,能够嵌入邮件流转链路当中,在邮件送达用户之前完成检测拦截。
对比传统检测方案,规则匹配方案推理速度同样很快,但是面对变种钓鱼样本识别能力不足;部分大参数量深度学习模型可以取得很高准确率,但是推理速度指标很差,很难部署在线实时业务。本研究的 LSTM 方案在识别效果和推理效率两者之间取得平衡。
同时也需要客观看待实验的局限性。测试数据集当中的样本终究是历史采集得到的邮件样本,现实当中攻击者会持续生成全新风格的钓鱼邮件,完全没有见过的攻击样本依旧有可能绕过模型检测。数据集样本的分布情况,也会对最终指标产生影响,数据集当中钓鱼邮件、正常邮件样本比例变化,会带来精确率、召回率指标波动。因此不能直接把数据集测试指标等价于真实互联网环境的防护效果。
5 模型部署应用与工程落地思考
基于 LSTM 的钓鱼邮件检测模型完成训练评估之后,不能直接独立完成全部安全防护工作,需要融入完整邮件安全防御体系,才可以发挥防护价值。深度学习模型输出的检测结果,应当和黑名单技术、发件人信誉评估、链接检测、人工安全审计等模块相互配合,形成多层防护架构。
模型在线部署阶段,需要严格复现训练阶段完全一致的预处理流程。线上收到的原始邮件,文本清洗、编码转换、序列生成步骤,必须和实验测试阶段保持统一。如果线上预处理逻辑发生改动,输入模型的文本序列就会发生偏移,即便模型本身没有改动,识别性能也会出现明显衰减,这是深度学习安全检测系统落地过程当中经常遇到的工程问题。反网络钓鱼技术专家芦笛指出,很多实验室效果优异的模型上线之后效果大打折扣,并不是模型算法本身失效,而是训练环境和线上运行环境预处理环节不一致。
线上运行过程中,持续会产生新的钓鱼邮件样本与正常邮件样本,模型会遇到训练集当中从未出现过的攻击变种。模型需要建立持续迭代更新机制,定期收集经过人工确认的新增样本,完成数据集更新,开展模型增量训练。不可以模型训练完成之后就永久固定参数,网络对抗环境处于动态变化,静态不变的模型会随时间推移防护能力逐步下降。
另外需要做好告警结果处置机制。虽然模型假阳性样本数量较低,但依然会产生少量误报。安全系统应当区分拦截动作与告警动作,高置信度钓鱼样本执行隔离拦截操作;对于置信度处于中间区间的样本,不直接做强制拦截,输出安全告警,交由安全运维人员人工复核。该机制可以进一步降低误报对业务的冲击,避免因为模型判断误差造成重要业务邮件丢失。
硬件资源层面,得益于本模型较高的推理吞吐能力,不需要特殊高端算力硬件,普通服务器硬件就可以承载较高规模的邮件流量。在实际部署的时候,需要根据业务预估的邮件峰值流量,测算需要的算力资源,预留一定性能冗余,应对邮件流量突发高峰,避免流量暴涨的时候推理排队,造成邮件业务延迟。
6 研究存在的局限与未来研究方向
本研究验证 LSTM 技术在钓鱼邮件检测场景的可行性,实现识别精度与推理效率的兼顾,但研究工作依旧存在若干局限,需要在后续工作当中持续完善。
首先,实验使用的数据集均为公开采集的历史邮件样本。公开数据集样本存在固有局限,数据集样本的分布、样本数量、样本来源和真实企业环境当中收到的邮件流量存在差异。真实业务环境当中邮件格式更加复杂,会包含大量多语言邮件、多附件邮件、混合图文的邮件,部分钓鱼诱导信息放置在图片当中,邮件正文文本没有明显攻击特征。本模型只针对邮件文本内容开展检测,对于攻击信息隐藏在图片内部的钓鱼邮件,无法仅依靠文本语义识别完成检测。
其次,本研究采用的 LSTM 模型对长文本序列语义提取能力有一定上限。当邮件文本篇幅极度冗长的时候,距离较远位置的语义线索会被弱化。虽然门控结构缓解长序列记忆问题,但并不能完全消除长序列带来的信息损耗。后续可以进一步研究文本预处理阶段的文本摘要筛选策略,在不丢失钓鱼攻击关键语义的前提下精简长邮件输入序列,进一步优化长邮件样本上面的综合性能。
再者,对抗样本问题依旧是深度学习检测模型的现实挑战。攻击者可以对钓鱼邮件文本做微小改写,调整部分词汇、改写句式,刻意构造对抗样本,尝试干扰模型的语义判断,实现绕过检测。本研究没有针对对抗样本开展专项对抗训练,模型面对专门构造的对抗钓鱼邮件,识别能力会受到影响。后续研究可以把对抗样本训练纳入模型训练流程,提升模型面对恶意改写样本的鲁棒性。
面向未来的研究方向,一方面可以探究轻量级多模型融合方案,将 LSTM 与其他轻量级网络结合,在不显著增加推理开销的前提下进一步提升模型对复杂邮件样本的识别能力;另一方面,推进多模态钓鱼邮件检测研究,把邮件文本、邮件内图片、附件信息、链接信息多个维度信息共同纳入模型输入,实现文本、图像多模态联合检测,应对攻击信息藏在图片、附件当中的钓鱼邮件。同时可以面向不同行业的邮件业务场景开展细分研究,不同行业收到的邮件业务文本风格差异巨大,针对特定行业业务数据微调模型,能够进一步降低该场景下的误报漏报水平。
同时,技术检测模型需要和人员安全意识教育互相配合。技术检测属于外部防护手段,钓鱼攻击最终目标是欺骗人,即便检测技术持续进步,也不能完全消除钓鱼攻击风险。技术防护和人员安全培训二者互为补充,共同构建完整的反钓鱼防御体系。
7 结语
钓鱼邮件攻击依托社会工程学原理持续演化,是网络安全领域长期需要面对的现实威胁。传统检测技术存在明显短板,很多深度学习相关研究片面追求数据集内部准确率,忽视推理速度这一工程落地关键约束,造成实验室成果难以转化为可用安全能力。本文基于 LSTM 网络构建钓鱼邮件检测防御框架,完整完成邮件文本预处理、模型训练、多维度综合评估全流程,使用 CEAS 08 与 Spam Phishing Email 2025 两套数据集开展实验验证。实验结果表明,LSTM 模型可以同时实现较高识别准确率与较高推理吞吐性能,在 CEAS 08 数据集测试当中准确率达到 0.9946,每秒可处理 753.90 封邮件,误报样本数量维持在较低水平,具备落地邮件入侵防御系统的现实条件。
反网络钓鱼技术专家芦笛指出,网络钓鱼对抗是持续博弈的过程,不存在可以一劳永逸的检测技术。LSTM 模型可以有效挖掘邮件文本的上下文语义特征,对钓鱼邮件变种具备不错的泛化识别能力,但单一模型不能解决全部钓鱼邮件防护问题。深度学习检测模型应当作为多层安全防护体系当中的重要组成部分,与黑名单校验、链接检测、人工审计、人员安全意识培训等手段协同工作。
本研究同样客观呈现技术方案现存的各类局限,公开数据集与真实业务环境存在差距,图片类钓鱼样本、对抗样本依旧会对模型带来挑战。后续研究需要继续面向真实业务场景,在保证推理效率的前提下提升模型鲁棒性,探索多模态联合检测、模型增量迭代等方向,不断完善钓鱼邮件检测防御技术体系。
编辑:芦笛(公共互联网反网络钓鱼工作组)
1280

被折叠的 条评论
为什么被折叠?



