【PaperInFive-时间序列预测】PatchTST:开启基于Patch的长时序预测新浪潮(普林斯顿大学)

PaperInfive:五分钟了解一篇前沿论文
在这里插入图片描述


全文总结:本文提出了一种基于Transformer的时间序列预测模型的有效设计,通过引入两个关键组件:Patching和通道独立结构。与之前的工作相比,它可以捕获局部语义信息,并受益于更长的回溯窗口。该模型不仅在监督学习方面优于其他基线,而且在自监督表示学习和迁移学习方面证明了其潜能。


题目:A Time Series is Worth 64 Words: Long-Term Forecasting with Transformers
作者:Yuqi Nie
期刊/会议:ICLR
时间:2023
链接https://arxiv.org/pdf/2211.14730.pdf
源码https://github.com/yuqinie98/patchtst

问题背景

近年来,基于Transformer的模型在时间序列预测的有效性收到挑战,作者认为Transformer的潜力尚未完全发掘,主要基于以下几个方面的原因:

  1. 大多数模型使用逐点注意力,实际能提取到的信息非常有限,忽略了Patch的重要性
  2. 通道独立在CNN和线性模型中效果很好,但尚未应用于基于transformer的模型。

基于以上两个问题,作者试图通过提出一种通道无关的**patch time series Transformer (PatchTST)**模型来重塑基于Transformer-based Model,主要包括了以下两个模块:

  • Patching:通过将时间步长聚合到子序列级Patching中来增强局部性并捕获在点级无法获得的全面语义信息;
  • Channel-independence:对于多变量时间序列预测而言,对每一个变量单独预测,多个变量的序列共享Embedding和Transformer参数。

研究方法

1. 有监督学习

PatchTST的模型结构如上图所示,接下来我们逐模块介绍:

1. Input Univariat Series

首先是输入部分,本文作者采用了Channel Independence,所以模型的输入为多元时间序列中的其中一条序列(Univariat Series) x ( i ) ∈ R 1 × L \boldsymbol{x}^{\left( i \right)}\in \mathbb{R}^{1\times L} x(i)R1×L L L L表示时间序列的长度。

2. Instance Norm + Patching

Instance Norm:以帮助减轻训练数据和测试数据之间的分布偏移效应。它简单地将每个时间序列 x ( i ) \boldsymbol{x}^{\left( i \right)} x(i)以均值为0,标准差为1进行归一化,在输出时将平均值和标准差添加回预测值中。
Patching:将每个输入单变量时间序列 x ( i ) \boldsymbol{x}^{\left( i \right)} x(i)划分为可以重叠或不重叠的patch。假设每一个Patch的长度为 P P P,两个连续Patch的初始时刻之间的距离为 S S S,那么Patching后的序列维度为 x p ( i ) ∈ R P × N \boldsymbol{x}_{p}^{\left( i \right)}\in \mathbb{R}^{P\times N} xp(i)RP×N,表示一共分为了 N N N个Patch,其中每个Patch的长度为 P P P,其中 N = [ ( L − P ) S ] + 2 N=\left[ \frac{\left( L-P \right)}{S} \right] +2 N=[

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值