(论文速读)EMAformer:通过嵌入护甲增强变压器时间序列预测

论文题目:EMAformer: Enhancing Transformer through Embedding Armor for Time Series Forecasting(EMAformer:通过嵌入护甲增强变压器时间序列预测)

会议:AAAI2025

摘要:多变量时间序列预测在许多领域都是至关重要的。虽然在Transformer架构方面取得了显著进展,但ittransformer仍然落后于最新的基于mlp的模型。我们将这种性能差距归因于不稳定的渠道间关系。为了弥补这一差距,我们提出了EMAformer,这是一个简单而有效的模型,它通过辅助嵌入套件来增强变形金刚,类似于增强其能力的盔甲。通过引入三个关键的归纳偏倚,即全局稳定性、相位灵敏度和跨轴特异性,EMAformer释放了Transformer架构的进一步潜力,在12个实际基准测试中实现了最先进的性能,并在MSE和MAE中平均减少了2.73%和5.15%的预测误差。这大大提高了基于变压器的多变量时间序列预测方法的实际适用性。代码可在https://github.com/PlanckChang/EMAformer上获得。


EMAformer:给 Transformer 穿上"嵌入盔甲",重夺时间序列预测王座

1. 背景:Transformer 在时间序列上的"跌宕起伏"

多变量时间序列预测(Multivariate Time Series Forecasting, MTSF)在能源、交通、气象等众多领域有着广泛应用。近年来,围绕"Transformer 是否适合时序预测"的争论从未停歇。

事情的发展线索大致如下:

  • Transformer 时代:Informer、Autoformer、FEDformer 等一系列工作将 Transformer 引入时序预测。
  • MLP 反击:DLinear(AAAI 2023)一记重锤,证明简单的线性模型就能打败各种 Transformer 变体,引发学界反思。
  • Transformer 反扑:iTransformer(ICLR 2024)提出"变量 token 化"(variate tokenization)——把每个通道的整段时序编码为一个 token,再做通道间注意力——成功复活了 Transformer 在 MTSF 上的竞争力。
  • MLP 再度领先:CycleNet(NeurIPS 2024)、TQNet(ICML 2025)等 MLP-based 方法再次超越 iTransformer。

这就引出了一个自然的问题:为什么 iTransformer 的自注意力机制在 MTSF 上仍然力不从心?


2. 核心诊断:通道间关系的"极度不稳定"

本文作者没有急于提出新模型,而是先做了一个精细的诊断实验。他们使用变异系数(Coefficient of Variation, CoV)来衡量通道间相关性随时间的波动程度:

先计算每天内各通道对的 Pearson 相关系数,再统计跨天的均值与标准差,最终得到 CoV = 标准差 / 均值。CoV > 1 意味着极度不稳定。

Fig.1 通道间相关的变异系数。我们通过首先测量每天内的相关性,然后计算每天的平均值和标准差来计算通道间的冠状病毒。CoV值大于1表明存在较大的变异性,表明局部通道间关系不稳定。这些发现表明,香草自注意力机制机制与这种快速变化的动态作斗争。

结果触目惊心:在 ETTh2 和 ETTm2 数据集上,大量通道对的 CoV 远超 1,部分甚至高达 37.00。这说明两个通道之间的相关性可能在某一时刻高度相关,下一时刻却几乎无关

这与 Transformer 成功的其他领域形成了鲜明对比:

  • NLP:一个词 token 在句子中的语义角色始终稳定;
  • CV:一个图像 patch 的空间上下文固定不变。

因此,论文得出核心结论:通道间相关性的剧烈波动,让自注意力机制不仅无效,甚至会起反效果(backfire)。iTransformer 与 MLP 的差距,根源正在于此。


3. 方法:三块"嵌入盔甲"

针对上述问题,论文提出 EMAformer(EMbedding Armor for Transformer)。核心思路极为简洁:不修改 Transformer 架构本身,只在输入嵌入层做文章,通过引入三种携带关键归纳偏置的辅助嵌入来"武装"Transformer。

📊 配图:Figure 2 —— EMAformer 整体架构图

3.1 问题设定

给定 C 个通道、过去 L 个时间步的观测,预测未来 H 步

在 iTransformer 的框架下,输入先做转置,再经线性投影得到 变量 token 嵌入

EMAformer 在此基础上叠加三种辅助嵌入。


3.2 第一块盔甲:Channel Embedding(通道嵌入)

目标:引入全局稳定性(Global Stability)偏置。

定义可学习嵌入矩阵,对第 i 个通道:

设计动机:同一个通道的嵌入在所有时间步上共享,构建一个稳定的全局表征,平滑局部的相关性波动。有了这个全局上下文,自注意力机制就能专注于真正相关的 token,而不是被噪声和虚假相关性所迷惑。


3.3 第二块盔甲:Phase Embedding(相位嵌入)

目标:引入相位敏感性(Phase Sensitivity)偏置。

给定预设周期长度 P,定义可学习嵌入矩阵 ,以观测窗口最后一个时刻 t 的相位索引检索:

设计动机:通道嵌入是时间无关的,会模糊掉时序细节。虽然通道间相关性整体不稳定,但它们往往在特定相位上呈现规律性对齐(这是周期性的一种体现)。相位嵌入让模型感知自身处于周期中的哪个位置,从而识别相位依赖的模式。


3.4 第三块盔甲:Joint Channel-Phase Embedding(联合通道-相位嵌入)

目标:引入跨轴特异性(Cross-Axis Specificity)偏置。

通道嵌入对所有时间步相同(通道特异、时间无关),相位嵌入对所有通道相同(时间特异、通道无关)。二者独立时无法捕捉"通道 × 时序"的耦合依赖。为此引入嵌入张量

设计动机:现实中不同传感器往往展现出各异的周期行为或时间错位,联合嵌入允许模型学习"通道 i 在相位 p 时的特定模式",提供更精细的表征。


3.5 嵌入融合与网络架构

四种嵌入逐元素相加,作为 Transformer Encoder 的输入:

Transformer Encoder 由 N 层堆叠而成,每层包含多头自注意力(MSA)与前馈网络(FFN),配合层归一化与残差连接。最终输出经 MLP 与矩阵转置得到预测结果

网络整体仍采用主流的 Reversible Instance Normalization(RevIN)的归一化-反归一化夹心结构来对抗分布偏移。


4. 实验结果

4.1 主实验:12 个基准上的全面领先

实验在 ECL、ETTh1/h2、ETTm1/m2、Traffic、Weather、Solar-Energy、PEMS03/04/07/08 共 12 个数据集上展开,与 TQNet、TimeXer、CycleNet、iTransformer、TimesNet、PatchTST、Crossformer、DLinear、SCINet 等 9 个强 baseline 对比,历史窗口固定为 $L=96$,预测长度取多个 horizon 后取平均。

📊 配表:Table 1 —— 多变量长期预测性能对比

结果亮点

  • EMAformer 在 24 个场景中 20 个排名第一,3 个排名第二;
  • 相对第二名平均降低 MSE 2.73%、MAE 5.15%
  • 在通道数超过 100 的数据集上,降幅扩大到 MSE 5.07%、MAE 7.57%
  • 在 PEMS04 和 PEMS08 上性能提升约 10%,尤为显著。

4.2 消融实验:三块盔甲缺一不可

对三种嵌入进行系统性消融,结果以雷达图呈现(MAE,经 max-min 归一化,距中心越远越好)。

 📊 配图:Figure 3 —— 消融研究雷达图

完整模型(Full)在所有数据集上一致表现最佳。不同数据集对各嵌入的敏感度有所差异,体现了数据集间的异质性,但三者协同始终优于任意子集组合。


4.3 注意力熵分析:嵌入如何"引导"注意力

为深入理解嵌入对注意力分布的影响,作者计算了最后一层 Transformer 的注意力分数熵(在周期第 0 相位处分析,以排除时间效应)。

📊 配表:Table 2 —— 注意力分数熵对比

核心发现

  • 原始模型(Only Token)的注意力熵接近最大值(以 ETT 为例,7 个通道的最大熵log7≈2.81),说明注意力几乎均匀分散,自注意力退化为平均池化,毫无区分性。
  • 加入 Channel Embedding 后熵显著下降,说明模型开始聚焦于真正相关的通道。
  • 加入完整嵌入(含 Phase)后熵略有回升,但仍低于原始模型——这是合理的,因为不同相位下通道间确实存在有意义的变化,Phase Embedding 捕捉到了这些有益的相位依赖信息。

4.4 泛化性:提升其他 Transformer 变体

将三种嵌入应用于 Reformer、Informer、Flowformer,在 ECL、Traffic、Weather 数据集上评估。

 📊 配表:Table 3 —— Transformer 变体性能对比

提升幅度相当可观:

  • ECL 上:MSE 提升 10.58%–13.89%,MAE 提升 8.19%–13.83%
  • Traffic 上:MSE 提升 6.49%–25.08%,MAE 提升 12.68%–17.89%
  • Weather 上:MSE 提升 1.21%–11.07%,MAE 提升 7.02%–20.30%

这充分证明了所提嵌入策略的通用性与有效性,而非仅对特定架构有效。


4.5 替换 Backbone:Transformer 的必要性

将 Transformer Encoder 替换为 MLP(保持其余超参数不变),与 CycleNet、TQNet 等最强 MLP baseline 对比。

📊 配图:Figure 4 —— MLP vs Transformer backbone 对比柱状图

两个关键结论:

  1. Transformer backbone 始终优于 MLP backbone,证明注意力机制在配备合适嵌入后仍有其不可替代的价值;
  2. 即便使用 MLP backbone,配备本文嵌入的模型在几乎所有数据集上仍超越 CycleNet 和 TQNet(PEMS07 除外,作者归因于未重新调参的超参数敏感性)。

4.6 极端实验:去掉历史信息会怎样?

将输入序列替换为其均值(经 RevIN 后约为零),即完全抹去历史信息,仅凭嵌入本身做预测。

📊 配图:Figure 5 —— 均值输入 vs 历史 baseline 对比

令人惊讶的是,即便如此,模型在 ETTh2、ETTm2、Solar、Weather 上的表现仍能匹配甚至超越部分 2022–2023 年的 baseline(DLinear、Crossformer、SCINet)。这说明三种嵌入共同学习到了极为丰富的数据集级全局模式,蕴含了不依赖具体历史片段的预测能力。


4.7 嵌入表征可视化

📊 配图:Figure 6 —— T-SNE 可视化(通道嵌入 + 相位/联合嵌入)

  • 通道嵌入(左):T-SNE 可视化显示,相关通道自然聚簇,差异大的通道被有效分离,符合全局稳定表征的设计目标;
  • 相位嵌入(右上)联合通道-相位嵌入(右下,通道 0):均清晰呈现出沿时间维度的周期性。尤其是联合嵌入,还揭示出日周期嵌套于周周期之内的多重周期结构,以及少量反映短期波动的散点。

4.8 周期长度 P 的选择

以日周期(P = 24 或 96 等,按数据频率)与周周期分别实验。

📊 配表:Table 4 —— 日周期 vs 周周期对比

两者差距不大,各数据集略有偏好。较长的周期虽能隐式包含短周期,但每个相位可用的训练样本减少,影响学习效果,因此建议按经验性能选择


4.9 资源开销

三种辅助嵌入带来的额外开销主要体现在 GPU 显存(来自额外参数),训练与测试时间增加不显著。整体开销在消费级 GPU(实验使用 RTX 4090)上完全可接受,与性能收益相比代价甚小。


5. 结论与展望

EMAformer 给出了一个优雅的答案:Transformer 在 MTSF 上的瓶颈不在架构,而在于缺乏合适的归纳偏置。通过引入三种轻量辅助嵌入——全局稳定的通道嵌入、相位敏感的相位嵌入、细粒度的联合通道-相位嵌入——无需触碰 Transformer 的任何一个参数,便实现了全面的性能跃升。

未来,作者计划探索:

  • 自适应周期:当前使用固定周期长度,未来希望自动检测数据中的变化周期;
  • 多重周期结构:联合嵌入可视化中已观察到日-周嵌套周期,值得深入挖掘;
  • 显式拓扑结构:在通道维度引入图结构,更精准地引导注意力机制。


内容概要:本文围绕基于三电平ANPC构网型逆变器的虚拟同步控制策略展开研究,提出了一种融合DPWMA调制、正负序分离锁相与电网电压前馈的复合控制策略,并通过Simulink仿真实现系统建模与多工况验证。研究表明,ANPC三电平拓扑具备开关损耗均衡、中点电位稳定和输出谐波低等优势,结合DPWMA调制可显著提升稳态电能质量;正负序分离锁相技术有效应对电网不平衡工况,确保并网电流对称性与功率稳定性;电网电压前馈控制则增强系统动态响应能力,抑制电压骤变或负载切换引起的冲击。整体策略在稳态精度、电网适应性和动态抗扰方面表现优异,适用于新能源并网与工业大功率变流场景。; 适合人群:具备电力电子、自动控制或电气工程相关背景,从事新能源发电、微电网、逆变器控制等方向的科研人员及研究生。; 使用场景及目标:①用于高比例新能源接入下的并网逆变器控制策略设计;②解决电网不平衡、电压扰动等复杂工况下的并网稳定性问题;③优化逆变器动态响应性能与电能质量,提升系统可靠性。; 阅读建议:建议结合文中提供的Simulink仿真模型与控制框图,逐步复现各模块功能,重点关注DPWMA调制实现、正负序分解算法与前馈-反馈协同控制逻辑,同时可通过修改电网参数测试系统鲁棒性,深化对控制机理的理解。
内容概要:本文围绕多渗透率电动汽车接入对配电网承载能力的影响展开研究,提出了一套基于Matlab的量化评估方法。研究构建了包含电动汽车充放电行为、分布式光伏出力及静止无功补偿装置(SVC)的多资源协同配电网基础模型,并建立了涵盖一次设备安全、负荷平稳性、电能质量和系统效率的多维评价指标体系。采用熵权法确定各指标的客观权重,结合模糊综合评价法构建双层承载能力评分模型,实现了对不同电动汽车渗透率下配电网承载能力的动态评估与灵敏度分析。通过算例仿真验证了模型的有效性,揭示了电动汽车接入对配电网运行状态的影响规律,为电网规划、扩容改造及高比例新能源接入下的主动管理提供了科学决策依据和技术支撑。; 适合人群:电力系统、电气工程及相关专业的高校研究生、科研人员以及从事电网规划、新能源接入评估、配电网运行管理的工程技术人员。; 使用场景及目标:①评估不同规模电动汽车接入对配电网安全性、电能质量及运行效率的影响;②为城市充电基础设施规划、电网扩容改造提供量化依据;③支持含高比例电动汽车的主动配电网优化调度与风险预警研究。; 阅读建议:读者在学习过程中应重点关注多维评价指标体系的构建逻辑与熵权-模糊综合评价模型的实现步骤,建议结合文中提供的Matlab代码进行仿真复现,深入理解电动汽车渗透率变化对各项指标的灵敏度影响,从而掌握配电网承载能力动态评估的核心方法。
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

这张生成的图像能检测吗

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值