文本嵌入与失业预测:机器学习的双重应用
文本嵌入用于知识库检索
在文本嵌入用于知识库检索的研究中,为了提高问题嵌入的表示质量,研究人员采取了一系列步骤。首先,将SQuAD开发集和训练集合并,创建了一个更大的语料库,其中包含98169个问题和20963个段落。接着,从这个语料库中随机选取5K个问题嵌入和对应的段落嵌入作为召回任务的验证集,10K个作为损失计算任务的验证集,剩余部分则作为训练数据。
研究人员的目标是让正确的问题 - 段落对在嵌入空间中更接近。为此,他们的检索模型进行了以下操作:
1. 对问题嵌入进行微调,使最接近的段落嵌入成为对应问题嵌入的真实配对。
2. 对段落嵌入进行微调,使最接近的问题嵌入成为对应段落嵌入的真实配对。
3. 结合前两步改进后的问题和段落嵌入,进一步微调问题嵌入。
以下是不同模型在问题嵌入和段落嵌入上的召回率表现:
| 模型 | 问题嵌入 recall@1 | 问题嵌入 recall@1 改进率 (%) | 问题嵌入平均召回率 | 问题嵌入平均召回率改进率 (%) |
| — | — | — | — | — |
| Only ELMO | 28.40% ± 0.06% | – | 49.70% ± 0.02% | – |
| ELMO w/ IDF | 32.60% ± 0.04% | 4.20% ± 0.1% | 54.20% ± 0.06% | 4.50% ± 0.08% |
| FCRR | 40.50% ± 0.02% | 12.10% ± 0.08% | 64.30% ± 0.03% | 14.60% ± 0.05% |
| FCRR + ConvR
超级会员免费看
订阅专栏 解锁全文

678

被折叠的 条评论
为什么被折叠?



