LSTM简单实例

最新推荐文章于 2025-01-16 22:08:32 发布

原创最新推荐文章于 2025-01-16 22:08:32 发布 · 4.4k 阅读

17 ·

本内容遵循CC 4.0 BY-SA版权协议

标签

#python #深度学习 #神经网络

这篇博客介绍了如何使用TensorFlow实现LSTM神经网络进行手写数字识别，详细讲解了LSTM的结构和工作原理，包括忘记门、输入门、细胞状态和输出门，并通过代码展示了动态RNN的使用方法。

个人笔记感谢指正

LSTM_tensorflow

1.导入包

import tensorflow as tf
from tensorflow.examples.tutorials.mnist import input_data

2.导入mnist手写数据集

mnist = input_data.read_data_sets('MNIST_data/',one_hot=True)

3.设置相应的参数

n_inputs = 28  #单个LSTM神经元接受的向量维度
max_time = 28  #一次输入的时间跨度
lstm_size = 100 #隐藏层数
n_classes = 10  #输出种类数
batch_size = 50  #批次的大小
n_batch = mnist.train.num_examples // batch_size  #计算批次数

4.定义占位变量

#None表示这一个维度值可以为任意值
x = tf.placeholder(tf.float32,[None,784])
y = tf.placeholder(tf.float32,[None,10])

5.初始化权重与偏置

#初始化权重
weights = tf.Variable(tf.truncated_normal([lstm_size,n_classes],stddev=0.1)) 
#初始化偏置
biases = tf.Variable(tf.constant(0.1,shape=[n_classes]))

#注意：单个LSTM神经元输出的都是标量，只有多个LSTM神经元组成的LSTMCell输出的才是标量，而且这里的weights是LSTMCell与最后全连接层之间的参数，LSTMCell中的参数不需要我们去设置

6.定义RNN网络（包括最后的全连接层）

def RNN(X,weights,biases):
    inputs = tf.reshape(X,[-1,max_time,n_inputs])
    lstm_cell = tf.contrib.rnn.BasicLSTMCell(lstm_size)
    outputs, final_state = tf.nn.dynamic_rnn(lstm_cell,inputs,dtype=tf.float32) 
    results = tf.nn.softmax(tf.matmul(final_state[1],weights) + biases)
    return results

#tf.contrib.rnn.BasicLSTMCell(hidden_units)函数：其实就是定义一个LSTM神经元组成的一层，但是我们只需要传入该层的units的大小，至于该层的权重与偏置并不需要我们去设置

#tf.nn.dynamic_rnn(lstm_cell,inputs,dtype=tf.float32): Creates a recurrent neural network specified by RNNCell cell

7.代价函数与优化器设置

prediction = RNN(x,weights,biases)

cross_entropy = tf.reduce_mean(tf.nn.softmax_cross_entropy_with_logits(labels=y,logits=prediction))

train_step = tf.train.AdamOptimizer(1e-4).minimize(cross_entropy)

correct_prediction = tf.equal(tf.argmax(prediction,1),tf.argmax(y,1))

accuracy = tf.reduce_mean(tf.cast(correct_prediction,tf.float32))

init = tf.global_variables_initializer()  #return An Op that initializes global variables in the graph.

8.会话编写

with tf.Session() as sess:
    sess.run(init)
    for epoch in range(6):
        for batch in range(n_batch):
            batch_xs, batch_ys = mnist.train.next_batch(batch_size)
            sess.run(train_step,feed_dict={x:batch_xs,y:batch_ys})

        acc = sess.run(accuracy,feed_dict={x:mnist.test.images,y:mnist.test.labels})
        print('Iter' + str(epoch) + ',Testing Accuracy' + str(acc))

9.LSTM原理分析

参考来源：https://blog.csdn.net/mch2869253130/article/details/89150043
注意：下述公式中的乘法都是元素乘法不是矩阵乘法
在这里插入图片描述

1.忘记门

在这里插入图片描述
第一步是决定从细胞状态里扔掉什么信息（也就是保留多少信息）。将上一步细胞状态中的信息选择性的遗忘。
实现方式：通过sigmoid层实现的“忘记门”。以上一步的 $h_{t-1}$ 和本次的输 $入x_{t}$ ,然后为 $C_{t-1}$ 的每一个数字输出一个0-1的值，记为 $f_{t}$

2.输入层门

在这里插入图片描述
第二步是决定在细胞状态里存什么。将新的信息选择性的记录到细胞状态中。
实现方式：
sigmoid层（输入门层）决定我们要更新什么值，这个概率表示为 $i_{t}$
tanh层创建一个候选值向量 $C~\widetilde{C}$ 将会被增加到细胞状态中。我们将会在下一步把这两个结合起来更新细胞状态。

3.更新细胞状态(细胞状态)

在这里插入图片描述
更新旧的细胞状态实现方式： $f_{t}$ 表示忘记上一次信息 $C_{t-1}$ 的程度。 $i_{t}$ 表示加入本次候选值 $C~\widetilde{C}$ 的程度，这一步我们真正实现了移除哪些旧的信息，增加哪些新信息，最后得到了本细胞的状态(所以 $C_{t}$ 中可以以相应的比例保存其它LSTM单元中的信息，至于每个LSTM所含比例是通过模型训练来确定的,这样 $C_{t}就可以融合本次LSTM中的信息,也可以自动根据需要融合其他LSTM的信息,不至于随着hidden_unit的增大而丢失最初的LSTM单元的信息$ )

4.输出门(隐藏状态)

在这里插入图片描述
最后，我们要决定作出什么样的预测。实现方式：
1.我们通过sigmoid层（输出层门）来决定输出的本细胞状态 $C_{t}$ 的哪些信息( $o_{t}$ 即为控制选择 $C_{t}$ 中信息的参数)
2.然后我们将细胞状态通过tanh层（使值在-1~1之间），然后与sigmoid层的输出( $o_{t}$ )相乘得到最终的输出.综上所述, $C_{t}$ 与 $h_{t}$ 中都包含本次的LSTM单元以及前面的所有的LSTM单元的信息

5.具体分析

在这里插入图片描述
⊙ 是element-wise乘，即按元素乘
介绍下各个变量的维度，LSTM cell的输出 $h_{t}$ 的维度是黄框里隐藏层神经元的个数，记为d,即矩阵 $W_{f},W_{i},W_{c},W_{o}$ 的行数.t 时刻LSTM cell的输入为 $x_{t}$ 的维度记为n,最终的输入时 $h_{t-1}$ 与 $x_{t}$ 的结合, $h_{t-1},x_{t}]$ ,其维度为 $d + n$ ,所有矩阵即矩阵 $W_{f},W_{i},W_{c},W_{o}$ 的维度是 $[d, d + n]$ ,所有的向量包括 $b_{f},b_{i},b_{c},b_{o},f_{t},i_{t},o_{t},h_{t},h_{t-1},C_{t},C_{t-1})$ 的维度都是 $d$ .(注意: $W_{f},W_{i},W_{c},W_{o}$ ,是所有神经元的权重,因而是2维的 $[d, d + n]$ ).
例子:
在这里插入图片描述

6.tf.nn.dynamic_rnn(,inputs,)函数与tf.contrib.rnn.BasicLSTMCell(lstm_size)

参考链接:https://blog.csdn.net/u010960155/article/details/81707498

tf.nn.dynamic_rnn的返回值有两个：outputs和state
为了描述输出的形状，先介绍几个变量，batch_size是输入的这批数据的数量，max_time就是这批数据中序列的最长长度，如果输入的三个句子，那max_time对应的就是最长句子的单词数量，cell.output_size其实就是rnn cell中神经元的个数。
outputs. outputs是一个tensor
如果time_major $= =$ True，outputs形状为 [max_time, batch_size, cell.output_size ]
如果time_major $= =$ False（默认），outputs形状为 [ batch_size, max_time, cell.output_size ]
state. state是一个tensor
state是最终的状态，也就是序列中最后一个cell输出的状态。一般情况下state的形状为 [batch_size, cell.output_size ]，但当输入的cell为BasicLSTMCell时, state的形状为[2，batch_size, cell.output_size ]，其中2也对应着LSTM中的cell state和hidden state
在这里插入图片描述
上图中方框代表一个LSTM_cell,LSTM_cell中可以设置多个多个神经元，函数tf.contrib.rnn.BasicLSTMCell(lstm_size)参数lstm_size即为设置LSTM_cell中神经元的个数，因此上图中所有的LSTM_cell中神经元的个数都为lstm_size(图中的lstm_size为5).

而图中的参数step是通过tf.nn.dynamic_rnn()的参数inputs的格式设置的，详情如下：
inputs的格式为[-1,max_time,n_inputs ]时，max_time的大小即为step的个数，图中网络的max_time就是2.

至于为什么会函数tf.nn.dynamic_rnn()会有两个返回值 $o u t p u t s$ 与 $s t a t e$ (个人理解)，是因为RNN神经网络不仅需要在横向设置LSTM也需要在纵向设置LSTM，例如上图的模块可能不止一个， $o u t p u t$ 可以作为另一个上图所示模块的输入，而state用于提取最后一层最后一个神经元输出的结果，即网络的result或者prediction