PaperInfive:五分钟了解一篇前沿论文
全文总结:本文提出了一种基于Transformer的时间序列预测模型的有效设计,通过引入两个关键组件:Patching和通道独立结构。与之前的工作相比,它可以捕获局部语义信息,并受益于更长的回溯窗口。该模型不仅在监督学习方面优于其他基线,而且在自监督表示学习和迁移学习方面证明了其潜能。
题目:A Time Series is Worth 64 Words: Long-Term Forecasting with Transformers
作者:Yuqi Nie
期刊/会议:ICLR
时间:2023
链接:https://arxiv.org/pdf/2211.14730.pdf
源码:https://github.com/yuqinie98/patchtst
问题背景
近年来,基于Transformer的模型在时间序列预测的有效性收到挑战,作者认为Transformer的潜力尚未完全发掘,主要基于以下几个方面的原因:
- 大多数模型使用逐点注意力,实际能提取到的信息非常有限,忽略了Patch的重要性;
- 通道独立在CNN和线性模型中效果很好,但尚未应用于基于transformer的模型。
基于以上两个问题,作者试图通过提出一种通道无关的**patch time series Transformer (PatchTST)**模型来重塑基于Transformer-based Model,主要包括了以下两个模块:
- Patching:通过将时间步长聚合到子序列级Patching中来增强局部性并捕获在点级无法获得的全面语义信息;
- Channel-independence:对于多变量时间序列预测而言,对每一个变量单独预测,多个变量的序列共享Embedding和Transformer参数。
研究方法
1. 有监督学习
PatchTST的模型结构如上图所示,接下来我们逐模块介绍:
1. Input Univariat Series
首先是输入部分,本文作者采用了Channel Independence,所以模型的输入为多元时间序列中的其中一条序列(Univariat Series) x ( i ) ∈ R 1 × L \boldsymbol{x}^{\left( i \right)}\in \mathbb{R}^{1\times L} x(i)∈R1×L, L L L表示时间序列的长度。
2. Instance Norm + Patching
Instance Norm:以帮助减轻训练数据和测试数据之间的分布偏移效应。它简单地将每个时间序列 x ( i ) \boldsymbol{x}^{\left( i \right)} x(i)以均值为0,标准差为1进行归一化,在输出时将平均值和标准差添加回预测值中。
Patching:将每个输入单变量时间序列 x ( i ) \boldsymbol{x}^{\left( i \right)} x(i)划分为可以重叠或不重叠的patch。假设每一个Patch的长度为 P P P,两个连续Patch的初始时刻之间的距离为 S S S,那么Patching后的序列维度为 x p ( i ) ∈ R P × N \boldsymbol{x}_{p}^{\left( i \right)}\in \mathbb{R}^{P\times N} xp(i)∈RP×N,表示一共分为了 N N N个Patch,其中每个Patch的长度为 P P P,其中 N = [ ( L − P ) S ] + 2 N=\left[ \frac{\left( L-P \right)}{S} \right] +2 N=[



2622

被折叠的 条评论
为什么被折叠?



