Transformer模型-5-Multi-Head Attention

原创

已于 2024-10-06 16:58:54 修改 · 1.6k 阅读

标签

#transformer #深度学习 #人工智能 #语言模型 #easyui

于 2024-09-20 11:15:09 首次发布

低功耗蓝牙项目，需要一块懂省电的板

思澈 SF32LB52 芯片，BLE 协议栈深度优化，上手即开发

点击查看

上图红色圈中的部分为 Multi-Head Attention，是由多个Self-Attention组成的，虽然Encoder与Decoder中都有Multi-Head Attention，但他们略有区别。Encoder block包含一个 Multi-Head Attention，而Decoder block包含两个 Multi-Head Attention。

Decoder block包含两个 Multi-Head Attention，其中第一层的多头注意力用到Masked，第二层其数据组成则是由 Encoder输出数据的3/4直接送入( Encoder输出的另外1/4数据入了Add&Norm层) 再加上由Decoder的Outputs进入的经Token Embedding和Position Enbedding计算后得的向量，经过第一层多头注意力后的数据

注意力

Attention函数可以描述为将query和一组key-value对映射到输出，其中query、key、value和输出都是向量。输出为value的加权和，其中分配给每个value的权重通过query与相应key的兼容函数来计算。
—— 来自(www.yiyibooks.cn/yiyibooks/A…

QKV的理解

在《Attention is all you need》论文中首次提出Transformer时构建了三个辅助向量QKV。而所谓QKV也就是Q(Query 查询)，K(Key 键值)，V(Value 实际的特征信息)。他们本质上是代表了三个独立的矩阵，都是我们原本的序列X做了不同的线性变换之后的结果，都可以作为X的代表。简单的可理解成：

Q=XWQK=XWKV=XWV*Q*=*X**W**Q**K*=*X**W**K**V*=*X**W**V*

如下图所示：

其中 WQ,WK和WV*W**Q*,*W**K*和*W**V*是三个可训练的参数矩阵，输入矩阵X分别与WQ,WK和WV*W**Q*,*W**K*和*W**V*相乘，生成Q, K和V，相当于经历了一次线性变换。Attention不直接使用X，而是使用经过矩阵乘法生成的三个矩阵，因为使用三个可训练的参数矩阵，可增强模型的拟合能力。

多头注意力

什么是多头注意力

所谓多头，是分别将线性的变换之后的QKV切分为H份，然后对每一份进行后续的self-attention操作。最后再连接并做线性回归产生输出。如下图：

观察上图的多头注意力结构的中间的Scaled Dot-Product Attention(点积自注意力)，我们可以把拆为理解为高维向量被拆分为H分低维向量，并在H个低维空间里求解各自的self-Attention。

多头注意力的理解

代码层面: 把原始的维度切成H份，假如h=8(切成8份)，每份则为512/8=64。在每个64维做相关度(即相乘)计算
原理层面: 把原来在一个高维空间里衡量一个文本的任意两个字之间的相关度，变成了在8维空间里去分别衡量任意两个字的相关度的变化

工作原理

QKV获取

经过position embedding 与 word embedding 计算后得到的向量x进入

低功耗蓝牙项目，需要一块懂省电的板

思澈 SF32LB52 芯片，BLE 协议栈深度优化，上手即开发

点击查看

最低0.47元/天解锁文章