论文题目:Research on residual attention-based mechanism autoencoder for microseismic denoising network model
期刊:Mechanical Systems and Signal Processing
摘要:深部工程环境的动态变化引起的噪声严重降低了P波和S波的到时拾取精度,进而影响震源定位的精度和灾害预警的有效性。针对微震信号去噪(RAA-MD)模型,提出了一种基于残差注意力的机制自动编码器。该模型将残差块的跳跃连接机制与动态挤压和通道注意模块相结合,通过自适应调整通道权重,显著提高了特征信息的传递效率和关键特征的识别效率。基于引汉调渭河工程的监测数据,对RAA-MD模型在不同初始信噪比和不同噪声环境条件下进行了系统验证。结果表明,与单纯使用普通卷积的自动编码网络(CNN-AE)、基于残差模块的自动编码网络(RES-AE)和基于注意机制的自动编码网络(CDSCAAE)模型相比,RAA-MD模型具有良好的去噪性能,特别是在处理低信噪比和复杂环境的微震信号时。随后,为了进一步验证RAA-MD模型的应用潜力,基于U-Net结构构建了P波和S波的到时拾取网络。对去噪前后信号的到达时间拾取精度进行了定量比较。结果表明,去噪后,P波和S波的到时拾取精度分别提高了85.94%和70.81%。最后,讨论了不同的网络深度结构、注意机制和数据集大小对去噪性能的影响,并与一维数据去噪领域中广泛使用的U形网络(U-Net)、剩余网络(ResNet)和递归神经网络(RNN)模型进行了比较分析。验证了基于残差注意力机制的微震信号去噪网络模型在微震信号处理中的显著优势及其在微震监测领域的重要应用价值。
一、研究背景:为什么微震信号去噪不能只看“波形变干净了没有”?
1.1 深部工程中的微震信号为什么容易受到噪声干扰?
微震监测技术能够对岩体内部破裂活动进行实时监测,因此已经被大量应用于地下工程、矿山、水电工程等地质灾害监测场景。但是在真实的深部工程环境中,传感器记录到的并不只有岩体破裂产生的有效微震信号,施工机械、电磁干扰、设备振动、水流、焊接、注浆以及其他现场活动都会形成不同类型的噪声和伪信号。对于后续微震监测而言,这些噪声并不是简单让波形“看起来更乱”,更关键的是它会影响真实微震事件识别、P 波与 S 波到时拾取以及震源定位,最终影响灾害预警结果的可靠性。
论文研究的汉江—渭河引水工程正是一个典型的深部复杂工程场景。秦岭输水隧洞总长度达到 98.3 km,最大埋深超过 2000 m,施工过程中面临岩爆等地质灾害风险,因此工程现场布置了微震监测系统对岩体活动进行持续监测。

论文 Figure 6:汉江—渭河引水工程现场发生的岩爆现象,用于说明深埋隧洞微震监测的工程背景。
现场采用加拿大 Engineering Seismology Group(ESG)的微震监测系统,由分析主机、数据采集设备以及 6 个单轴加速度传感器组成。传感器响应频率范围为 50 Hz~5 kHz,灵敏度为 30 V/g,传感器直径为 25.4 mm、高度为 122 mm;信号采样频率设置为 10 kHz,每次采集持续 400 ms。

论文 Figure 7:汉江—渭河引水工程微震监测系统布置图,包括传感器、采集设备、光纤传输、云服务器和分析中心。
实际施工环境中的噪声来源非常复杂,论文给出了电信号干扰、现场施工、水流、塌腔注浆以及焊接支护结构等典型噪声源。这意味着一个有效的微震去噪模型不仅需要处理具有明显周期性的规则噪声,还需要处理非结构化环境噪声以及多种噪声叠加形成的复杂混合噪声。

论文 Figure 8:现场典型噪声来源,包括电信号、施工噪声、水流、塌腔注浆和焊接支护结构。

论文 Figure 9:现场四类典型微震信号,包括 clean microseismic signal、electricity-microseismic signal、noise-microseismic signal 和 electricity-noise mixed microseismic signal。
1.2 传统去噪方法和已有深度学习方法分别有什么问题?
传统微震去噪方法通常基于数学变换和信号分解,例如 S-transform、Wavelet Transform(WT)、Empirical Mode Decomposition(EMD)以及 Variational Mode Decomposition(VMD)等。这些方法能够在特定条件下实现有效去噪,但在复杂工程场景中通常存在较强的方法和参数依赖。例如 WT 的去噪效果会受到小波基函数选择影响,为了找到合适的小波基往往需要大量试验;EMD 在采样率变化或者噪声发生波动时稳定性会下降;除此之外,不少传统方法还需要人工设定参数,并依赖较强的信号处理专业知识,因此难以形成完全自动化的微震数据处理流程。
随着深度学习的发展,U-Net、DnCNN、CNN、自编码器以及迁移学习等方法已经逐渐被用于微震去噪。深度学习最大的优势在于能够自动从大量样本中学习噪声与有效信号之间的非线性映射,减少人为设计特征和手动调参过程。但是论文指出,已有 AI 去噪方法仍然存在特征提取与噪声分离能力不足、泛化性能受限以及高维数据计算复杂度较高等问题,而传统自编码器在面对低 SNR 和复杂噪声环境时尤其容易出现性能瓶颈。
已有研究尝试将 Dynamic Squeeze-and-Channel Attention(DSCA)加入自编码器,通过动态调整不同特征通道的权重,让网络更加关注有效微震特征。不过,当网络继续加深时,又可能出现梯度消失和特征传递效率降低的问题,导致极端噪声情况下的去噪性能下降。
因此,这篇论文实际上试图同时解决两个问题:
-
深层网络中的有效特征如何稳定向后传递;
-
在大量噪声特征中,网络如何主动找到真正重要的微震特征。
作者的解决思路就是:Residual Block 负责改善特征传递,DSCA 负责改善特征选择,再利用 Autoencoder 完成从带噪信号到干净信号的端到端重构。
二、RAA-MD:Residual Block、DSCA 和 Autoencoder 是如何组合起来的?
2.1 Autoencoder:先压缩有效特征,再进行信号重构
Autoencoder 由 Encoder 和 Decoder 两部分组成。Encoder 将原始输入信号映射到更加紧凑的特征空间,Decoder 再根据隐藏空间中的特征恢复出与输入维度对应的输出信号。
Encoder 可以表示为:
Decoder 可以表示为:
其中,x 表示 Encoder 输入,X 表示 Encoder 输出,Y 表示 Decoder 输出,、
分别表示编码和解码过程中的权重,
、
为对应偏置,
为非线性函数。
对于微震去噪来说,理想情况就是 Encoder 从带噪信号中提取出与真实微震事件相关的有效表示,而 Decoder 根据这些有效表示重新生成尽可能接近 clean microseismic signal 的波形。

论文 Figure 1:Autoencoder 基本结构,包括 Input、Encoder、Hidden layer、Decoder 和 Output。
2.2 Residual Block:解决深层网络中的特征传递问题
单纯增加网络深度虽然能够增强特征提取能力,但也会增加梯度消失等训练困难。Residual Block 的核心思想是在普通卷积映射之外加入 skip connection,使输入特征可以绕过部分卷积层直接传递到输出端。
Residual Block 可以写成:
其中, 为 Residual Block 输入,
为网络学习得到的残差映射,
为输出。
论文中的残差映射写为:
![]()
这里的关键并不是公式本身有多复杂,而是输入 可以通过 shortcut 直接与卷积特征相加,因此即使网络逐渐加深,有效信息仍然能够更加顺畅地向深层传播。对于微震这种局部瞬态特征十分重要的一维信号来说,这种结构可以减少关键波形信息在多层卷积中的损失。

论文 Figure 2:Residual Block 原理图,重点观察主分支卷积特征与 shortcut 输入特征在输出端进行相加的过程。
2.3 DSCA:让模型主动增强重要通道、抑制无效通道
Residual Block 解决了“信息如何传下去”的问题,但它并不能直接告诉模型“哪些信息更重要”。因此作者进一步引入 Dynamic Squeeze-and-Channel Attention(DSCA)。
首先,通过 Global Average Pooling(GAP)提取每个通道的全局描述:
![]()
之后根据全局描述学习通道注意力:
动态调整后的注意力权重为:
![]()
最后利用各通道权重对输入特征进行重新加权:

其中, 表示输入特征,
表示输出特征,
是第 c 个通道的全局描述,C 为通道数量,
和
分别表示注意力权重和动态调整后的注意力权重。
从微震去噪角度理解,DSCA 相当于让网络在不同输入情况下重新判断各个特征通道的重要程度:与真实微震事件关系更密切的通道获得较高权重,而主要由噪声构成的通道则被压制。

论文 Figure 3:DSCA 模块原理图,展示 GAP、特征提取、Linear layer、Activation function 以及最终 Hadamard product 的过程。
2.4 RAA-MD 的整体网络结构
在 Encoder 中,RAA-MD 将 Residual Block 与 DSCA 串联,并在多个模块之后使用 Dropout。Residual Block 负责保持深层网络中的信息传递能力,DSCA 根据当前输入动态选择更加重要的通道,而 Dropout 用来减少过拟合。
Decoder 则主要由 ConvTranspose1d 和 DSCA 组成。ConvTranspose1d 逐步将压缩后的高维特征恢复到原始信号尺度,而每一次上采样之后继续使用 DSCA 对特征进行筛选,可以降低解码过程中将噪声重新放大的风险。
从论文 Figure 4 可以看到,编码端特征尺寸经历了大致如下变化:
3994×32 → 1997×64 → 998×128 → 499×256 → 497×256
随后 Decoder 再逐渐恢复:
499×256 → 998×128 → 1997×64 → 3994×32 → Output signal
因此 RAA-MD 的本质并不是简单地“给 Autoencoder 加一个 Attention”,而是在编码和解码两个方向持续利用注意力机制,同时使用 Residual Block 改善 Encoder 的深层信息传递。

论文 Figure 4:RAA-MD 整体网络结构,重点展示 Residual Block、DSCA、Dropout 和 ConvTranspose1d 在 Encoder/Decoder 中的排列方式以及特征尺度变化。

论文 Table 1:CNN-AE、RES-AE、CDSCA-AE 与 RAA-MD 四种网络的详细逐层结构,用于观察 Residual Block 与 DSCA 在不同对照模型中的配置差异。
三、数据集是怎样构造的?实验又是怎样训练的?
3.1 为什么论文没有直接使用现场混合信号作为监督标签?
真实工程现场采集到的带噪微震信号通常不知道对应的“绝对干净信号”到底是什么。如果直接拿这样的数据测试去噪模型,虽然可以肉眼观察波形是否变干净,却无法严格计算去噪结果与真实 clean signal 之间的 MSE,也很难公平比较不同网络。
为了解决这个问题,论文先从汉江—渭河引水工程中选取经过专家确认的 clean microseismic signals,然后将现场真实环境噪声与这些 clean signals 系统叠加,从而构建输入带噪信号和目标 clean signal 一一对应的 paired dataset。
最终数据集共包含 8502 组样本,分成三种噪声:
-
electricity-microseismic signal:2834 组;
-
noise-microseismic signal:2834 组;
-
electricity-noise mixed microseismic signal:2834 组。
其中 6000 组数据用于模型训练和测试,剩余 2502 组作为独立 validation set。
这种构造方式非常重要,因为模型面对的噪声仍然来源于真实工程环境,同时每一条带噪信号又具有明确的 clean reference,可以进行严格的定量评价。
3.2 训练设置
每条输入信号在进入网络之前独立进行归一化,并根据该组信号最大值将幅值调整到 -1~1。
模型训练的主要设置为:
-
epoch=100;
-
batch size=256;
-
optimizer=Adam;
-
learning rate=0.001;
-
如果训练集 loss 连续 20 个 epoch 没有下降,则提前停止训练;
-
采用 5-fold cross-validation;
-
6000 组训练/测试数据被划分成 5 个子集,每轮选择其中 1 个作为 test set,剩余 4 个作为 training set;
-
完成 5 轮训练之后选取满足要求的最佳权重;
-
最后再使用独立的 2502 组 validation data 进行验证;
-
网络输出完成之后进行 denormalization,恢复到工程可解释的原始数据尺度。
训练硬件为 Intel Core i5-13400F、NVIDIA GeForce RTX 4070 Ti 和 32 GB RAM,软件环境为 Python 3.11 与 PyTorch 2.2.2。

论文 Figure 5:RAA-MD 完整建模流程,包括 Raw data、Training/Testing set、Normalization、5-fold cross-validation、Optimal model、Denormalization 和 Output data。
3.3 对照模型
为了验证 Residual Block 和 DSCA 各自带来的提升以及二者组合后的协同作用,论文设计了四个结构:
CNN-AE:仅使用普通 Conv1d 的基础 Autoencoder。
RES-AE:在 Autoencoder 中引入 Residual Block,但不加入 DSCA。
CDSCA-AE:使用普通卷积并加入 DSCA,但不使用 Residual Block。
RAA-MD:同时使用 Residual Block 和 DSCA。
这种对照设计实际上对应了一个比较清晰的消融逻辑:如果 RES-AE 优于 CNN-AE,说明 Residual 有效;如果 CDSCA-AE 优于 CNN-AE,说明 DSCA 有效;如果 RAA-MD 又显著优于 RES-AE 和 CDSCA-AE,则说明二者组合具有进一步增益。
四、评价指标:论文中的 SNR 和 MSE 是怎么计算的?
论文主要使用 SNR 和 MSE 对去噪性能进行评价,其中 SNR 越大说明有效信号相对于残余噪声越强,而 MSE 越小说明去噪结果与 clean signal 越接近。
SNR 定义为:

残余噪声定义为:
其中, 为 clean microseismic signal 的采样值,
为 denoised signal 的采样值。
论文中的 MSE 写为:

其中, 为 clean microseismic signal 样本均值。
需要注意的是,论文虽然将 Eq.11 称为 MSE,但这里并不是最常见的 1/n 形式均方误差,而是利用 clean signal 的平方偏差和进行了归一化。如果准备复现论文,最好直接按照论文公式实现,而不要只根据“MSE”这个名称判断损失或者评价指标的具体计算方法。
五、核心实验结果:RAA-MD 到底比其他模型强在哪里?
5.1 5 折交叉验证:Residual 和 Attention 同时加入之后效果最好
论文首先比较四种模型在 5-fold cross-validation 中的 Loss。


论文 Figure 10:CNN-AE、RES-AE、CDSCA-AE 和 RAA-MD 在 5 折交叉验证中的 Training Loss 与 Test Loss。
从 Figure 10 可以看出,RAA-MD 在 5 轮训练和测试中的 Loss 都明显低于另外三个模型,说明 Residual Block 与 DSCA 的组合确实比单独使用其中一种机制更加有效。
这里需要特别说明论文正文中的一个数据书写问题:4.1.1 节正文写 RAA-MD 在训练集上的 5-fold maximum loss 为 0.032,但 Figure 10 柱状图对应数值约为 0.0032,两处存在一个数量级差异,因此如果后续进行复现或者引用这一数据,建议同时检查正文和 Figure 10,而不要直接忽略这一不一致。
相比 Loss,更有代表性的是 Figure 11 中汇总后的 MSE 和 SNR。
RAA-MD:
-
Training MSE=0.0030;
-
Test MSE=0.0034;
-
Training SNR=7.59 dB;
-
Test SNR=7.24 dB。
CNN-AE:
-
Training MSE=0.0087;
-
Test MSE=0.0089;
-
Training SNR=2.99 dB;
-
Test SNR=2.96 dB。
RES-AE:
-
Training MSE=0.0083;
-
Test MSE=0.0086;
-
Training SNR=3.17 dB;
-
Test SNR=3.12 dB。
CDSCA-AE:
-
Training MSE=0.0039;
-
Test MSE=0.0050;
-
Training SNR=6.42 dB;
-
Test SNR=5.53 dB。
相比 CNN-AE、RES-AE、CDSCA-AE,RAA-MD 在 Training set 上的 MSE 分别降低 65.51%、63.85% 和 23.07%,在 Test set 上分别降低 61.79%、60.46% 和 32.00%。
SNR 方面,RAA-MD 在 Training set 上分别提高 4.60、4.42 和 1.17 dB,在 Test set 上分别提高 4.28、4.12 和 1.71 dB。
从这组结果可以得到一个非常清晰的结论:仅加入 Residual Block 的 RES-AE 相比 CNN-AE 只有有限提升,而单独加入 DSCA 的 CDSCA-AE 已经带来了比较明显的性能改善;在此基础上进一步加入 Residual Block 后,RAA-MD 又继续获得明显增益,说明有效特征选择能力和深层特征传递能力是可以互补的。

论文 Figure 11:四种模型在 5-fold cross-validation 中的平均 Training/Test MSE 与 Training/Test SNR,是论文证明 RAA-MD 基础性能优势的核心结果图。
5.2 初始 SNR 越低,RAA-MD 的优势反而越明显
2502 组独立验证数据的初始 SNR 大约分布在 -8~4 dB 范围内,而且包含了大量低 SNR 信号,因此能够测试模型在强噪声情况下的稳定性。

论文 Figure 12:2502 组 validation data 的初始 SNR 分布。
论文将不同初始 SNR 区间的数据分别输入四种模型。总体来看,随着原始信号 SNR 增大,所有模型输出 SNR 都会提高,但是 RAA-MD 在各个区间基本保持领先,而且在最低 SNR 区域优势最明显。
当 initial SNR 位于 -8~-7 dB 时,RAA-MD 输出信号的 SNR 分别是:
-
CNN-AE 的 4.937 倍;
-
RES-AE 的 5.324 倍;
-
CDSCA-AE 的 4.151 倍。
也就是说,当输入信号本身已经被噪声严重淹没时,RAA-MD 并没有像普通 Autoencoder 一样快速失去有效信号恢复能力,这也是论文将“low-SNR denoising”作为其主要优势之一的原因。

论文 Figure 13:CNN-AE、RES-AE、CDSCA-AE 和 RAA-MD 在不同 initial SNR 区间上的输出 SNR 对比。
5.3 三种噪声环境下的去噪结果
论文进一步将噪声分为三类分别比较模型性能。
5.3.1 Electricity-microseismic signal
电信号干扰具有明显的周期性,因此属于结构相对规则的噪声。论文给出的一个典型样本中,Input SNR=1.51 dB。
不同模型输出约为:
-
CNN-AE:4.45 dB;
-
RES-AE:5.47 dB;
-
CDSCA-AE:5.86 dB;
-
RAA-MD:9.37 dB。
从波形上可以看到,CNN-AE、RES-AE 和 CDSCA-AE 去噪之后仍然残留部分周期干扰,而 RAA-MD 能够更加充分地去除周期成分,同时保存微震主波形。
5.3.2 Noise-microseismic signal
对于缺乏明显周期结构的普通环境噪声,网络不能简单依赖规则模式进行分离,因此难度进一步提高。在论文给出的典型样本中,Input SNR=-0.19 dB,而 RAA-MD 去噪后达到 4.47 dB,高于 CNN-AE 的 2.37 dB、RES-AE 的 2.79 dB 和 CDSCA-AE 的 4.03 dB。
5.3.3 Electricity-noise mixed microseismic signal
最困难的是周期电信号和不规则环境噪声共同存在的情况。在论文给出的典型样本中,Input SNR=-4.56 dB:
-
CNN-AE 去噪后 SNR=5.43 dB;
-
RES-AE=5.36 dB;
-
CDSCA-AE=10.28 dB;
-
RAA-MD=11.24 dB。
从不同噪声类型的整体统计结果来看,RAA-MD 同样保持领先。
对于 electricity-microseismic signal,RAA-MD 输出 SNR 比 CNN-AE、RES-AE、CDSCA-AE 分别高 4.70、4.37、1.72 dB。
对于 noise-microseismic signal,分别高 2.75、2.53、1.29 dB。
对于 electricity-noise mixed microseismic signal,分别高 2.84、2.73、1.47 dB。
论文同时指出,电信号具有较强的周期规律,因此相比随机环境噪声更容易被网络识别;随着噪声复杂程度提高,所有模型的去噪性能都会下降,只是 RAA-MD 的性能下降幅度相对更小。

论文 Figure 14:三种噪声环境下 CNN-AE、RES-AE、CDSCA-AE 和 RAA-MD 的典型去噪波形对比。

论文 Figure 15:三种噪声环境下四种模型的整体 SNR 对比。
5.4 RAA-MD 并不是所有极端噪声都能完全解决
论文比较值得肯定的一点是并没有只展示成功案例。在极端 electricity-noise mixed 场景中,当强噪声和有效信号特征严重缠绕时,RAA-MD 虽然能够降低噪声,却仍然可能留下明显残余,同时部分微震细节恢复效果不够理想。
因此作者认为,未来还可以继续调整 Attention module,或者加入 noise-adaptive learning module,通过动态表示不同复杂噪声分布进一步提高模型泛化能力。

论文 Figure 16:RAA-MD 在极端复杂噪声情况下的 unsatisfactory denoising results,用于展示模型当前仍然存在的局限。
六、去噪真正有用吗?作者进一步做了 P 波与 S 波到时拾取
如果一篇微震去噪论文只证明 SNR 变高,实际上仍然不能完全说明它对工程监测真正有帮助。因此作者进一步构建了基于 U-Net 的 P-wave 和 S-wave arrival-time picking network,用下游拾取任务验证 RAA-MD 的实际应用价值。
作者首先使用 RAA-MD 对 6220 组 noise-microseismic signals 进行去噪,然后分别将:
-
Clean signal;
-
Noise signal;
-
RAA-MD denoised signal;
输入训练好的到时拾取模型,观察 P、S 波拾取结果之间的差异。
从典型样本可以明显看到,Noise signal 中的噪声会让模型给出的 P-wave 和 S-wave arrival time 明显偏离真实位置,而经过 RAA-MD 去噪之后,预测位置重新接近 Clean signal。


论文 Figure 17:Clean signal、Noise signal 和 RAA-MD denoised signal 的 P-wave/S-wave arrival-time picking 结果,两组典型案例均显示去噪后预测位置明显恢复。
6.1 平均拾取误差
P-wave:
-
Clean signal:2.030 ms;
-
Noise signal:22.847 ms;
-
Denoised signal:3.212 ms。
S-wave:
-
Clean signal:2.261 ms;
-
Noise signal:13.052 ms;
-
Denoised signal:3.810 ms。
也就是说,加入噪声之后,P-wave 平均拾取误差相比 clean signal 增加 20.817 ms,S-wave 增加 10.791 ms;而经过 RAA-MD 之后,平均误差又显著下降到接近 clean signal 的水平。
与未经处理的 Noise signal 相比,RAA-MD 使:
P-wave arrival-time picking accuracy 提高 85.94%。
S-wave arrival-time picking accuracy 提高 70.81%。
这是整篇论文最有工程意义的一组结果,因为它证明 RAA-MD 的作用并不只是提高一个信号质量指标,而是能够直接改善后续微震事件解释过程。

论文 Figure 18:Clean、Noise 和 Denoised 三类信号的 P-wave 与 S-wave 平均绝对拾取误差。
6.2 不同误差阈值下的样本比例
论文还统计了 absolute error≤1 ms、3 ms、5 ms、10 ms 和 20 ms 时的样本比例。
P-wave 方面:
Clean signal 在 1、3、5、10、20 ms 内的比例分别为 48%、84%、88%、100%、100%。
Denoised signal 分别为 4%、56%、88%、96%、100%。
Noise signal 在 10 ms 内的样本比例为 0%,即 P-wave 的带噪拾取误差全部超过 10 ms,而即使放宽到 20 ms,也只有 36% 的样本满足要求。
S-wave 方面:
Clean signal 分别为 12%、80%、96%、100%、100%。
Denoised signal 分别为 0%、32%、80%、100%、100%。
Noise signal 分别为 0%、0%、4%、24%、96%。
这组分布进一步说明,虽然 RAA-MD 去噪后的结果还没有在所有严格误差区间完全达到 Clean signal 水平,但在 5~10 ms 这一范围内已经显著接近 Clean signal,尤其解决了原始 Noise signal 中大量严重错拾的问题。


论文 Figure 19:Clean、Noise 和 Denoised signals 在不同 absolute error 阈值下的 P-wave 与 S-wave 拾取样本比例。
七、进一步优化:网络越深越好吗?DSCA 就是最优 Attention 吗?
论文并没有在 RAA-MD 得到较好结果后直接结束,而是继续讨论网络深度、Attention 类型以及 dataset size 对结果的影响,这一部分实际上构成了从 RAA-MD 到最终 RCAA-MD 的优化过程。
7.1 网络深度:10 层最佳,并不是越深越好
作者比较了 6、8、10、12 layer 四种配置。
6 layer:
-
Training MSE=0.0044;
-
Validation MSE=0.0051;
-
Training SNR=5.96 dB;
-
Validation SNR=5.31 dB。
8 layer:
-
Training MSE=0.0031;
-
Validation MSE=0.0042;
-
Training SNR=7.46 dB;
-
Validation SNR=6.14 dB。
10 layer:
-
Training MSE=0.0028;
-
Validation MSE=0.0033;
-
Training SNR=7.81 dB;
-
Validation SNR=7.16 dB。
12 layer:
-
Training MSE=0.0035;
-
Validation MSE=0.0035;
-
Training SNR=7.02 dB;
-
Validation SNR=6.72 dB。
从 6 层增加到 10 层时,MSE 持续降低、SNR 持续提高,说明适当增加深度确实能够增强微震特征提取能力;但是继续增加到 12 层以后性能下降,因此最终 10 layer configuration 最优。

论文 Figure 20:6、8、10、12 层网络的 Training/Validation MSE 与 SNR 对比。
7.2 Attention 对比:Channel Attention 比原来的 DSCA 更强
作者进一步比较:
-
DSCA;
-
Channel Attention;
-
Spatial Attention;
-
Coordinate Attention;
-
Non-attention。
Figure 21 中的数据为:
DSCA
-
Train MSE=0.0031;
-
Validation MSE=0.0034;
-
Train SNR=7.50 dB;
-
Validation SNR=7.31 dB。
Channel Attention
-
Train MSE=0.0022;
-
Validation MSE=0.0023;
-
Train SNR=8.99 dB;
-
Validation SNR=8.59 dB。
Spatial Attention
-
Train MSE=0.0080;
-
Validation MSE=0.0080;
-
Train SNR=3.48 dB;
-
Validation SNR≈3.52 dB。
Coordinate Attention
-
Train MSE=0.0021;
-
Validation MSE=0.0025;
-
Train SNR=9.00 dB;
-
Validation SNR=8.19 dB。
Non-attention
需要注意,Coordinate Attention 在 Training set 上的部分指标甚至略优于 Channel Attention,但是模型真正更关注的是独立 Validation set 的泛化结果,因此作者最终认为 Channel Attention 综合表现最好。
相对于 Non-attention baseline,Validation SNR 的提高量分别为:
-
DSCA:+4.58 dB;
-
Channel Attention:+5.86 dB;
-
Spatial Attention:+0.76 dB;
-
Coordinate Attention:+5.46 dB。
相比 DSCA,Channel Attention 的 Validation MSE 降低 32.35%,Validation SNR 提高 1.28 dB。
相比 Spatial Attention,Validation MSE 降低 71.25%,SNR 提高 5.07 dB。
论文认为 Channel Attention 的优势与同时利用 GAP 和 Global Maximum Pooling(GMP)进行通道权重自适应学习有关。

论文 Figure 21:DSCA、Channel、Spatial、Coordinate 和 Non-attention 的 Training/Validation MSE 与 SNR 对比。
除了精度之外,论文还比较了 Params、FLOPs 和 inference time。其中:
Channel Attention:
-
Params=2.509729 M;
-
FLOPs=0.346492 G;
-
Inference time=3.000498 ms。
Coordinate Attention:
-
Params=2.51305 M;
-
FLOPs=0.346819 G;
-
Inference time=19.99974 ms。
Channel Attention 的 inference time 只有 Coordinate Attention 的约 15%,因此虽然二者去噪性能比较接近,但 Channel Attention 更适合计算资源有限或者需要较高实时性的工程环境。

论文 Table 2:DSCA、Channel、Spatial、Coordinate、Non-attention 五种模型的 Params、FLOPs 和 inference time。
7.3 Dataset size:数据越多总体越好,但 Channel Attention 在小样本下也保持领先
工程现场的数据量往往并不固定,而数据采集、清洗、标注和模型训练都需要成本,因此作者进一步比较了:
1000、2000、3000、4000、5000、6000
六种 dataset size。
整体趋势非常清楚:随着训练样本数量增加,不论是否加入 Attention,MSE 总体都会下降,说明更多训练数据有助于提高模型泛化能力。
更重要的是,Channel Attention 在所有 dataset size 下都保持最优或者非常突出的结果。
当 dataset size=1000 时:
Channel Attention MSE=0.0073。
当 dataset size=6000 时:
Channel Attention MSE=0.0022。
论文结论进一步指出,在 dataset size=6000 时,Channel Attention 的 MSE 相比其他三种 Attention 中的最优结果仍然降低 6.30%。
这说明 Channel Attention 的优势并不依赖某一个固定训练数据规模,在从小样本到较大数据集的多个条件下都具有较好的适应性。


论文 Figure 22:不同 dataset size 下各 Attention mechanism 的 MSE 和 SNR 对比。
八、从 RAA-MD 到 RCAA-MD:最终又和 U-Net、ResNet、RNN 比了一次
这里需要特别解释论文里的模型名称变化。
论文前半部分提出的是:
RAA-MD:Residual Attention-based mechanism Autoencoder for Microseismic Denoising
其中 Attention 使用 DSCA。
但是在 Discussion 中,作者发现 Channel Attention 的 Validation performance 比 DSCA 更好,因此在 6.4 节最终模型比较时,将采用 Channel Attention 的残差注意力自编码器称为:
RCAA-MD:Residual Channel Attention-based mechanism Autoencoder for Microseismic Denoising
因此读这篇论文时,可以把它理解为:
RAA-MD 是论文首先提出的主体框架,而 RCAA-MD 是经过 Attention 对比以后得到的进一步优化版本。
作者最终选择一维 U-Net、ResNet 和经典 RNN 作为对照模型。
8.1 最终去噪精度
RCAA-MD:
-
Train MSE=0.0023;
-
Validation MSE=0.0024;
-
Train SNR=8.86 dB;
-
Validation SNR=8.51 dB。
U-Net:
-
Train MSE=0.0082;
-
Validation MSE≈0.0083;
-
Train SNR=3.28 dB;
-
Validation SNR=3.18 dB。
ResNet:
-
Train MSE=0.0054;
-
Validation MSE=0.0081;
-
Train SNR=5.05 dB;
-
Validation SNR=3.29 dB。
RNN:
-
Train MSE=0.0088;
-
Validation MSE=0.0088;
-
Train SNR=2.94 dB;
-
Validation SNR=2.96 dB。
论文指出,在 Training set 上,RCAA-MD 的 SNR 相比 U-Net 高 5.58 dB,相比 ResNet 高 3.81 dB;其 Training MSE 相比次优 ResNet 降低 57.40%。
在 Validation set 上,RCAA-MD 的 SNR 比 ResNet 高 5.22 dB,比 RNN 高 5.55 dB,说明其优势不仅存在于训练数据,在独立数据上的泛化表现同样明显。
8.2 计算时间
RCAA-MD:
-
Train time=17 s;
-
Validation time=3 s。
U-Net:
-
Train time=13 s;
-
Validation time=8 s。
ResNet:
-
Train time=14 s;
-
Validation time=4 s。
RNN:
-
Train time=22 s;
-
Validation time=1 s。
因此 RCAA-MD 并不是训练时间最短的模型,U-Net 和 ResNet 的训练速度分别为 13 s 和 14 s;RNN 的推理速度最快,只需要 1 s。但是结合 SNR 和 MSE 可以看出,RCAA-MD 用相对有限的时间开销换取了远高于其他模型的去噪精度,论文因此认为它在denoising performance 与 computational efficiency 之间取得了更好的平衡。

论文 Figure 23:RCAA-MD、U-Net、ResNet、RNN 的 Training/Validation MSE、SNR,以及 Train/Validation time 对比,是论文最终模型性能总结图。
九、论文最终证明了什么?
从数据上来看,论文最重要的几个结果可以概括为:
-
原始 RAA-MD 在 5-fold cross-validation 中得到 Training MSE=0.0030、Test MSE=0.0034,Training SNR=7.59 dB、Test SNR=7.24 dB,显著优于 CNN-AE、RES-AE 和 CDSCA-AE。
-
当 initial SNR=-8~-7 dB 时,RAA-MD 输出 SNR 是 CNN-AE、RES-AE 和 CDSCA-AE 的 4.937、5.324 和 4.151 倍,说明模型在极低 SNR 情况下优势更加突出。
-
在 electricity-noise mixed microseismic signal 中,RAA-MD 相比 CNN-AE、RES-AE 和 CDSCA-AE 的输出 SNR 分别提高 2.84、2.73 和 1.47 dB。
-
RAA-MD 去噪之后,P-wave arrival-time picking accuracy 提高 85.94%,S-wave 提高 70.81%;P-wave 平均误差从 22.847 ms 降至 3.212 ms,S-wave 从 13.052 ms 降至 3.810 ms。
-
网络深度不是越深越好,10-layer configuration 最优,其 Training/Validation MSE 分别达到 0.0028/0.0033,SNR 达到 7.81/7.16 dB。
-
在多种 Attention 中,Channel Attention 的 Validation performance 最好,Validation MSE=0.0023、SNR=8.59 dB;相比 DSCA,MSE 再降低 32.35%,SNR 再提高 1.28 dB。
-
Channel Attention 在 1000~6000 不同 dataset size 下持续保持优势,当 dataset size 从 1000 增加到 6000 时,其 MSE 从 0.0073 降低到 0.0022。
-
最终的 RCAA-MD 得到 Train/Validation SNR=8.86/8.51 dB,Train/Validation MSE=0.0023/0.0024;相比 ResNet,其 Training MSE 降低 57.40%,Training SNR 提高 3.81 dB。
十、论文仍然存在的不足与后续改进方向
虽然 RAA-MD 和进一步优化后的 RCAA-MD 已经取得比较明显的性能优势,但论文自己也指出了几个仍然需要继续研究的问题。
首先,在极端复杂噪声环境中,如果强电信号、随机环境噪声与真实微震特征发生严重耦合,RAA-MD 仍然无法完全去除噪声,同时可能损失部分有效信号细节。因此未来可以引入更加明确的 noise-adaptive learning mechanism,通过动态描述当前输入的噪声分布提高复杂噪声情况下的泛化能力。
其次,虽然增加数据量能够明显提高性能,但真实工程现场获得大量高质量、可靠标注的数据本身具有较高成本,因此论文提出未来可以考虑 pre-training-fine-tuning 等迁移学习框架,提高模型在 data-scarce scenario 下的噪声抑制能力。
再次,最终的 RCAA-MD 虽然在去噪精度和计算效率之间取得了较好平衡,但其 Train/Validation time 仍然不是所有模型中最低,因此作者提出未来可以进一步采用 lightweight network structure,降低模型计算开销。
最后,作者认为这种 Residual + Attention + Autoencoder 的框架并不一定只能用于微震信号,还可以继续扩展到 mechanical vibration signal analysis 和 biomedical signal enhancement 等其他 time-series signal denoising 场景,但论文当前的实验仍然集中在微震数据上,因此跨领域泛化能力还需要后续实验进一步验证。
十一、总结
这篇论文比较有价值的一点,是它没有单纯通过“再堆一个更复杂的神经网络”来做微震去噪,而是针对现有 Autoencoder 的两个具体问题进行了结构性改进:利用 Residual Block 解决深层网络中梯度消失和特征传递效率下降的问题,再利用 Attention mechanism 提高网络识别关键微震特征、抑制噪声特征的能力。
最开始提出的 RAA-MD 使用 Residual Block + DSCA + Autoencoder,在 CNN-AE、RES-AE 和 CDSCA-AE 三组对照模型中已经取得最优结果,并且在低 SNR 与复杂混合噪声环境中表现出更明显的优势。更重要的是,作者没有只依赖 MSE 和 SNR,而是通过 P、S 波 arrival-time picking 进一步验证:去噪之后 P-wave 和 S-wave 的拾取精度分别提高 85.94% 和 70.81%,说明网络输出确实能够提高后续微震监测任务的可靠性。
在此基础上,作者继续对 Network Depth、Attention Mechanism 和 Dataset Size 进行分析,最终发现 10-layer configuration 更合适,同时 Channel Attention 的验证性能优于原始 DSCA,因此进一步形成 RCAA-MD。最终 RCAA-MD 在与 U-Net、ResNet 和 RNN 的比较中取得 Train/Validation SNR=8.86/8.51 dB、Train/Validation MSE=0.0023/0.0024,并在保持较低推理时间的情况下明显优于其他模型。
因此,从整篇论文的逻辑来看,其真正贡献并不只是“提出一个 RAA-MD 网络”,而是建立了一套从工程噪声问题 → 残差注意力自编码器 → 多噪声条件验证 → P/S 波应用验证 → 网络结构优化 → RCAA-MD的完整研究路线,对深部工程微震信号的智能去噪和自动化监测具有较明确的工程应用意义。
残差注意力自编码器用于微震信号去噪:RAA-MD 与 RCAA-MD&spm=1001.2101.3001.5002&articleId=163699196&d=1&t=3&u=e3a1960a8a8b47df96b773000893d8f4)
285
残差注意力自编码器用于微震信号去噪:RAA-MD 与 RCAA-MD&spm=1001.2101.3001.5003&articleId=163699196&d=1&t=3&u=7e9f9cac047442ada31ab5db18729a18)

被折叠的 条评论
为什么被折叠?



