LSTM简单实例

这篇博客介绍了如何使用TensorFlow实现LSTM神经网络进行手写数字识别,详细讲解了LSTM的结构和工作原理,包括忘记门、输入门、细胞状态和输出门,并通过代码展示了动态RNN的使用方法。
个人笔记 感谢指正

LSTM_tensorflow

1.导入包
import tensorflow as tf
from tensorflow.examples.tutorials.mnist import input_data
2.导入mnist手写数据集
mnist = input_data.read_data_sets('MNIST_data/',one_hot=True)
3.设置相应的参数
n_inputs = 28  #单个LSTM神经元接受的向量维度
max_time = 28  #一次输入的时间跨度
lstm_size = 100 #隐藏层数
n_classes = 10  #输出种类数
batch_size = 50  #批次的大小
n_batch = mnist.train.num_examples // batch_size  #计算批次数
4.定义占位变量
#None表示这一个维度值可以为任意值
x = tf.placeholder(tf.float32,[None,784])
y = tf.placeholder(tf.float32,[None,10])
5.初始化权重与偏置
#初始化权重
weights = tf.Variable(tf.truncated_normal([lstm_size,n_classes],stddev=0.1)) 
#初始化偏置
biases = tf.Variable(tf.constant(0.1,shape=[n_classes]))

#注意:单个LSTM神经元输出的都是标量,只有多个LSTM神经元组成的LSTMCell输出的才是标量,而且这里的weights是LSTMCell与最后全连接层之间的参数,LSTMCell中的参数不需要我们去设置

6.定义RNN网络(包括最后的全连接层)
def RNN(X,weights,biases):
    inputs = tf.reshape(X,[-1,max_time,n_inputs])
    lstm_cell = tf.contrib.rnn.BasicLSTMCell(lstm_size)
    outputs, final_state = tf.nn.dynamic_rnn(lstm_cell,inputs,dtype=tf.float32) 
    results = tf.nn.softmax(tf.matmul(final_state[1],weights) + biases)
    return results

#tf.contrib.rnn.BasicLSTMCell(hidden_units)函数:其实就是定义一个LSTM神经元组成的一层,但是我们只需要传入该层的units的大小,至于该层的权重与偏置并不需要我们去设置

#tf.nn.dynamic_rnn(lstm_cell,inputs,dtype=tf.float32): Creates a recurrent neural network specified by RNNCell cell

7.代价函数与优化器设置
prediction = RNN(x,weights,biases)

cross_entropy = tf.reduce_mean(tf.nn.softmax_cross_entropy_with_logits(labels=y,logits=prediction))

train_step = tf.train.AdamOptimizer(1e-4).minimize(cross_entropy)

correct_prediction = tf.equal(tf.argmax(prediction,1),tf.argmax(y,1))

accuracy = tf.reduce_mean(tf.cast(correct_prediction,tf.float32))

init = tf.global_variables_initializer()  #return An Op that initializes global variables in the graph.
8.会话编写
with tf.Session() as sess:
    sess.run(init)
    for epoch in range(6):
        for batch in range(n_batch):
            batch_xs, batch_ys = mnist.train.next_batch(batch_size)
            sess.run(train_step,feed_dict={x:batch_xs,y:batch_ys})

        acc = sess.run(accuracy,feed_dict={x:mnist.test.images,y:mnist.test.labels})
        print('Iter' + str(epoch) + ',Testing Accuracy' + str(acc))
9.LSTM原理分析

参考来源:https://blog.csdn.net/mch2869253130/article/details/89150043
注意:下述公式中的乘法都是元素乘法不是矩阵乘法
在这里插入图片描述

1.忘记门

在这里插入图片描述
第一步是决定从细胞状态里扔掉什么信息(也就是保留多少信息)。将上一步细胞状态中的信息选择性的遗忘 。
实现方式:通过sigmoid层实现的“忘记门”。以上一步的ht−1h_{t-1}ht1和本次的输入xt入x_{t}xt,然后为Ct−1C_{t-1}Ct1的每一个数字输出一个0-1的值,记为ftf_{t}ft

2.输入层门

在这里插入图片描述
第二步是决定在细胞状态里存什么。将新的信息选择性的记录到细胞状态中。
实现方式:
sigmoid层(输入门层)决定我们要更新什么值,这个概率表示为iti_{t}it
tanh层创建一个候选值向量C~\widetilde{C}C将会被增加到细胞状态中。 我们将会在下一步把这两个结合起来更新细胞状态。

3.更新细胞状态(细胞状态)

在这里插入图片描述
更新旧的细胞状态实现方式:ftf_{t}ft表示忘记上一次信息Ct−1C_{t-1}Ct1的程度。iti_{t}it表示加入本次候选值C~\widetilde{C}C的程度, 这一步我们真正实现了移除哪些旧的信息,增加哪些新信息,最后得到了本细胞的状态(所以CtC_{t}Ct中可以以相应的比例保存其它LSTM单元中的信息,至于每个LSTM所含比例是通过模型训练来确定的,这样Ct就可以融合本次LSTM中的信息,也可以自动根据需要融合其他LSTM的信息,不至于随着hiddenunit的增大而丢失最初的LSTM单元的信息C_{t}就可以融合本次LSTM中的信息,也可以自动根据需要融合其他LSTM的信息,不至于随着hidden_unit的增大而丢失最初的LSTM单元的信息CtLSTM,LSTM,hiddenunitLSTM)

4.输出门(隐藏状态)

在这里插入图片描述
最后,我们要决定作出什么样的预测。 实现方式:
1.我们通过sigmoid层(输出层门)来决定输出的本细胞状态CtC_{t}Ct的哪些信息(oto_{t}ot即为控制选择CtC_{t}Ct中信息的参数)
2.然后我们将细胞状态通过tanh层(使值在-1~1之间),然后与sigmoid层的输出(oto_{t}ot)相乘得到最终的输出.综上所述,CtC_{t}Cthth_{t}ht中都包含本次的LSTM单元以及前面的所有的LSTM单元的信息

5.具体分析

在这里插入图片描述
⊙ 是element-wise乘,即按元素乘
介绍下各个变量的维度,LSTM cell的输出hth_{t}ht的维度是黄框里隐藏层神经元的个数,记为d,即矩阵Wf,Wi,Wc,WoW_{f},W_{i},W_{c},W_{o}Wf,Wi,Wc,Wo的行数.t 时刻LSTM cell的输入为xtx_{t}xt的维度记为n,最终的输入时ht−1h_{t-1}ht1xtx_{t}xt的结合,[ht−1,xt][h_{t-1},x_{t}][ht1,xt],其维度为d+nd+nd+n,所有矩阵即矩阵Wf,Wi,Wc,WoW_{f},W_{i},W_{c},W_{o}Wf,Wi,Wc,Wo的维度是[d,d+n][d,d+n][d,d+n],所有的向量包括(bf,bi,bc,bo,ft,it,ot,ht,ht−1,Ct,Ct−1)(b_{f},b_{i},b_{c},b_{o},f_{t},i_{t},o_{t},h_{t},h_{t-1},C_{t},C_{t-1})(bf,bi,bc,bo,ft,it,ot,ht,ht1,Ct,Ct1)的维度都是ddd.(注意:Wf,Wi,Wc,WoW_{f},W_{i},W_{c},W_{o}Wf,Wi,Wc,Wo,是所有神经元的权重,因而是2维的[d,d+n][d,d+n][d,d+n]).
例子:
在这里插入图片描述
在这里插入图片描述
在这里插入图片描述

6.tf.nn.dynamic_rnn(,inputs,)函数与tf.contrib.rnn.BasicLSTMCell(lstm_size)

参考链接:https://blog.csdn.net/u010960155/article/details/81707498

tf.nn.dynamic_rnn的返回值有两个:outputs和state
为了描述输出的形状,先介绍几个变量,batch_size是输入的这批数据的数量,max_time就是这批数据中序列的最长长度,如果输入的三个句子,那max_time对应的就是最长句子的单词数量,cell.output_size其实就是rnn cell中神经元的个数。
outputs. outputs是一个tensor
如果time_major======True,outputs形状为 [max_time, batch_size, cell.output_size ]
如果time_major======False(默认),outputs形状为 [ batch_size, max_time, cell.output_size ]
state. state是一个tensor
state是最终的状态,也就是序列中最后一个cell输出的状态。一般情况下state的形状为 [batch_size, cell.output_size ],但当输入的cell为BasicLSTMCell时, state的形状为[2,batch_size, cell.output_size ],其中2也对应着LSTM中的cell state和hidden state
在这里插入图片描述
上图中方框代表一个LSTM_cell,LSTM_cell中可以设置多个多个神经元,函数tf.contrib.rnn.BasicLSTMCell(lstm_size)参数lstm_size即为设置LSTM_cell中神经元的个数,因此上图中所有的LSTM_cell中神经元的个数都为lstm_size(图中的lstm_size为5).

而图中的参数step是通过tf.nn.dynamic_rnn()的参数inputs的格式设置的,详情如下:
inputs的格式为[-1,max_time,n_inputs ]时,max_time的大小即为step的个数,图中网络的max_time就是2.

至于为什么会函数tf.nn.dynamic_rnn()会有两个返回值outputsoutputsoutputsstatestatestate(个人理解),是因为RNN神经网络不仅需要在横向设置LSTM也需要在纵向设置LSTM,例如上图的模块可能不止一个,outputoutputoutput可以作为另一个上图所示模块的输入,而state用于提取最后一层最后一个神经元输出的结果,即网络的result或者prediction

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值