Abstract
提出了Factuality Analysis and Classification Task(FACT),对于任务一的分类任务,效果最好的是采用RNN的方法,采用的是训练有关事件单词及其附近的嵌入数据,对于任务二,采用简单的建模方法。
Introduction
介绍
Factuality Classification
1.Task1 description
把一个事件分成三类,确定的事件发生,确定的事件不发生,和不确定的事件。训练一个分类器来预测给定文本中事件的类别。
数据处理:把长句切分成单独的短句。
2.RNN+Word Embeddings
preprocessing:句子分割成单词,每个单词使用word2vec进行embedding,使每个单词成为300维的向量,为了区分句子代表的事件,还在这300维的向量中添加一个额外的位,凑成301维,这个位的值取决于是否为事件。使用nltk进行POS-Tags。
padding:填充句子,标准化模型的输入,把短句子填充成最长的句子长度。
class weights
RNN:一层GRU200个神经元,最后一层3维输出,使用交叉熵损失函数,优化器使用Adam。最好的迭代次数为25-30次,取28次,batch_size取30。
results:精准度,召回率,F1-macro,Acc
3.RNN+char level
preprocessing:
RNN:两层LSTM每个75个单元,最后输出为3维。。。。
Results analysis:
Future work:
4.Random Forest with Tag counts
preprocessing:
Random Forest:
5.SVC with Tag counts + Word Embeddings
preprocessing:
SVC
results
Event Identification
1.task2 description
此任务是task1的前一步,旨在自动识别给定文本中的事件。输入是纯文本(plain text),输出表示事件单词的索引。
2.Baseline
3.Verbs detection
使用nltk Stanford POS-Tagger进行词性分析,名词事件只占总数的16.5%, 提出了只要是动词,就标记为事件,在精确率,召回率,F1-macro都取得了较高的成绩,高的精确率正是由于把全部的动词都划分为事件。
4.Verbs detection + Nouns detection
将名词事件包含到分类器中
5.Future work
本文介绍了FactualityAnalysisandClassificationTask(FACT)的任务,包括事件发生的确定性分类和事件识别。在任务一中,使用RNN和词嵌入数据达到最佳效果,通过GRU进行分类,取得高精度、召回率和F1-macro分数。任务二中,提出动词检测方法,显著提升精确率。此外,还探讨了随机森林和SVM的建模方法。

1262

被折叠的 条评论
为什么被折叠?



