文本嵌入技术的研究与应用进展

本文为博客 VIP 文章,开通 VIP 后可阅读全文

开通 VIP

摘要

【目的】 本文对国内外已经发表的自然语言处理领域有关文本嵌入的研究进行较深入的分析和对比,详细描述文本嵌入的知识结构和发展脉络,以及针对不同领域、不同数据集的模型改进方法,讨论流行的嵌入模型,比较每个模型在文本嵌入中的优缺点,同时指出文本嵌入所面临的挑战,提出可能的解决方案。【方法】 检索Web of Science 数据库、CNKI 数据库和万方数据,获取国内外文本嵌入研究的相关文献,运用内容分析法对文献做系统梳理分析,对这些文献中利用的文本嵌入技术以及改进方案、建模思想、生成过程等方面进行对比与分析。【结果】 经过去重和合并,保留内容最相关的61篇文献。文本嵌入方法可以归纳为三类:基于频率的文本嵌入、基于神经网络的文本嵌入和基于主题建模的文本嵌入。针对语料库的规模大小、多义词嵌入、通用嵌入的域适应等文本嵌入所面临的挑战,从被调查的研究文章中提出了可能的解决方案。

关键词: 文本嵌入; 自然语言处理; 内容分析法

引言

文本分析是自然语言处理(NLP)的主要任务之一。文本本身是由单词、字符等比较小的单元组成,而计算机或者机器学习模型无法像人类一样阅读和理解文本。因此,文本必须要以计算机可以理解并且可以区分的方式来表示。自然语言处理任务包括文本分类、情感分析、文本聚类和机器翻译, 文本表示的质量对自然语言处理任务的性能有很大影响。

分布式矢量表示或嵌入是自然语言处理的最新成果之一。文本嵌入作为文本表示的一种方法,是将文本投影到向量空间来测量文本之间语义距离的方法。通过低维空间中的某些保留结构的嵌入,可以促进涉及聚类[1-2]和文件检索[3]的文本分析和处理系统的许多领域[4],因为文本的语义结构可能会变得更容易估计。一些广泛使用的文本嵌入方法包括使用术语频率(TF)或逆文本频率(IDF)的方法[5],以及基于主题建模的方法,称为潜在狄利克雷分配(LDA[6-8]

另外,目前正在研究使用神经网络嵌入文本的方法。基于神经网络的代表性嵌入方法包括Word-2Vec [9]Doc2Vec [10]BERT[11]Word2Vec预测输入单词的相邻单词,而Doc2Vec预测输入文本中的单词。基于神经网络的方法[12-13]采用了诸如长短期记忆(LSTM)之类的神经网络、卷积神经网络(CNN)和前馈神经网络来提取文本特征,从而生成文本嵌入。这些模型正确地抓住了文本的语义并考虑了单词的顺序,但是它们很难训练[14],并且大多数模型只考虑了局部上下文中单词的第一级共现,并且忽略了主题之类的其他有用的信息。为了克服这些不足,引入了双向语言模型,例如来自转换器的双向编码器表示(BERT),以提高下游任务的性能。

文本表示的方法已经从词嵌入、句子嵌入逐渐发展到了文本嵌入。国内外已经出现了大量的文本嵌入建模方法,但是正如上文列举的,建模的基础模型种类繁多,目前还没有详细的研究针对这些基础建模方法进行分类、对比、梳理。本文对国内外有关文本嵌入的研究进行深入的分析,详细了解文本嵌入技术的知识结构和发展脉络,以及针对不同领域、不同数据集的应用和模型改进方法,通过对比流行的嵌入模型,指出文本嵌入所面临的挑战,提出可能的解决方案。

1 数据来源及方法

为了了解国内外对于文本嵌入研究的进展情况,采用主题词文本documenttext)和嵌入embedding)进行预检索。英文数据库选择Web of Science核心合集;中文数据库选择CNKI和万方。最终确定英文检索式:标题: (“document embedding*”OR “text embedding*”),文献类型限定articleproceedings paperreview;中文检索式:(主题:文本嵌入” OR “文档嵌入),通过初步判断,通常学位论文的观点会以论著的形式发表在学术期刊上,因此,文献类型限定为研究论文。

Web of Science核心合集检索结果为106条。通过浏览研究内容,去除不相关的内容,最后保留相关研究44条。英文数据库检索日期是20211213日。CNKI数据库检索结果是97条学术期刊论文,万方数据库检索结果是43条,选择核心期刊论文以后缩小范围到19条,然后,将两个中文数据库的结果合并去重。中文数据库检索日期是20211213日。

对三个数据库检索到的结果进行逐一判读,排除文学写作、文本水印嵌入、文本加密、系统设计与开发方面的研究,只留下与文本分类、聚类、文本分析、相似度计算、文本处理有关的嵌入任务的论文。运用内容分析法对文献作系统梳理分析,保留内容最相关的文献,最终得到61篇。

为了定性分析,设计了两个表格:第一个描述61篇文献里有关文本嵌入研究的基本模型、改进方法以及目的和贡献;另一个表格将文献里所描述的文本嵌入方法进行归类,分别描述每一类的优缺点。

2 文本嵌入知识结构和进展分析

经过阅读梳理每项研究的贡献、用途以及对模型的改进方法,归类汇总不同嵌入模型下的应用,以及针对不同研究目的对算法模型的改进措施,见表1。根据文献的研究内容,将论文里面提出的关于文本嵌入的方法归纳为三类:基于频率的文本嵌入、基于神经网络的文本嵌入和基于主题建模的文本嵌入,见表2。下面将做详细的分析和对比。

1   61篇文本嵌入研究论文应用模型以及贡献

Table 1  Application models and contributions of 61 text embedding research papers

基础模型

改进模型

应用

改进效果

BOW

1.基于词袋的支持向量机(BOW-SVM);
2. BOWSVM和径向基函数(RBF)建模的文档嵌入

社会风险分类;
安全事件报告

1. BOW-SVM模型与仅使用文档嵌入相比,AUCf1-score值最高,分
72%66%[15]
2. BOW-SVM模型对BBS帖子进行社会风险分类比PV-SVM模型效果好[16]

TF-IDF

1.多协同训练(MCT);
2.将经典术语频率(TF)统计信息整合到数学方程式

文档分类;
作者分析;
情感分析;
将临床文本映射到医学代码;
缺陷修复;
维护和增强短文本的语义表示

1. MCT增强了传统SSL方法的分类性能。NB分类器的性能提升更为明显[17]
2. GPE-WS模型在9个数据集上试验,和其它方法相比,性能均排名前四分之一[18]

Word2vec(Skip-gramPV-DBOW )

1.使用具有多个判别分析(multiple discri-minant analysisMDA);
2.提出一种概念性短文本嵌入(CSE)模型,为每个短文本分配关联的概念,然后将概念化结果引入学习概念短文本嵌入中;
3.基于流形约束提出新的目标函数(semi-DBOW);
4.自动化语义丰富系统,基于内容的流行度预测系统开发语义丰富的文章相似度方法(W2V-PPS)
5.提出一种表示文档集合的方法Babel2V-ec
6.短文本嵌入自动编码器(Short Texts Em-bedding AutoEncoders: STE-AE);
7.利用Jaccard相似系数x IDF 整合时间序列(EDM-JBW);
8.个性增强的概率矩阵分解方法(P2MF)

情感分类;
预测与网络安全领域相关的新闻文章的受欢迎程度;
提高文本分类性能;
提取有区别的低维短文本嵌入;
新闻事件检测;
推荐系统提高推荐性能

1. 判别式文档嵌入的准确性提高了 21%[19]
2. aCSE-1Ours)在数据集Twitter
的召回率超过了最佳基线模型TWE 5.3%PV-DM9.0%[20]
3. semi-DBOW在分离文档的正负面情绪方面表现良好;70% 的情感标签得到很好改进[21]
4. W2V-PPS比基线模型表现更好,在预测新闻四种受欢迎程度上F分数产生是 98%76%71% 72%[22]
5. Babel2Vec的最佳Micro-F1 12 个测试集中有 8 个优于BOW表示的最佳精度,在不以大类为主的 Macro-F1结果的分析中,Babel2V-ec 排名第一[23-24]
6. P2MF分别获得了大约3%21%36%6% 16% 的均方根误差性能增益[25]

Doc2Vec

1. 基于负采样的域适应的单词和文档的分布式表示学习方法;
2.一种视觉分析系统,用于探索神经文档嵌入;
3.PathEmb(路径嵌入)的全局路径相似性搜索算法,该算法结合了随机游走和文档嵌入技术;
4.提出一种细粒度的移动应用程序聚类模型,利用词嵌入和文档嵌入来合并相似的簇;
5.引入一种新的跨主题作者属性归属方法;
6.新的链接预测方法,通过反映技术词的功能上下文来预测文档之间的潜在链接;
7.构建文档嵌入模型中最优维度及最优窗口的选择模型,并根据文本用词和文档主题语义特征构建了高维空间中的文档嵌入向量;
8.自动、高效且细粒度的恶意软件分析方法mal2vec

解决了来自不同域的文档嵌入的域分离问题;
对产品,应用程序进行分类;
学习隐藏在文档中的作者的语义,句法和语法模式,识别作者写作风格;
链接预测,预测相似但不相关的文档之间的联系;

NLP之一文搞懂word2vec、Elmo、Bert演变 导读 自然语言处理本质是解决文本相关的问题,我们可以把它的任务分为大致两部分:预训练产生词向量以及对词向量进行操作(下游NLP具体任务)。在自然语言处理中有词向量模型word2vec、Elmo以及Bert等,也有RNN,LSTM等下游encoding模型,初学者很容易搞混,下面就分别介绍这几个模型之间的区别和联系,以及NLP技术发展之路。 word2vec 1.原理 word2vec是一种编码方式,于2013年由google实验室提出,它的特点是将所有词表示成低位稠密向量,它解决了one-hot词袋编码的 阅读详情

相关推荐

基于大语言模型的问答技术研究进展综述

基于大语言模型的问答技术研究进展综述 文森 1,2,钱力 1,2,3,胡懋地 1,2,常志军 1,2 1 (中国科学院文献情报中心 北京 100190) 2 (中国科学院大学经济管理学院信息资源管理系 北京 100190) 3 (国家新闻出版署学术期刊新型出版知识服务重点实验室 北京 100190) 摘要: 【目的】全面回顾和概述基于大语言模型的问答技术发展现状、机制原理以及应用趋势,为后续开展相 关研究提供参考借鉴。 【文献范围】选取基于大模型的问答技术相关的 73 篇文献。 【方法】系统梳理大语言

强化学习曾小健 1228

Python-按word2vec格式存储的BERT预训练模型

按word2vec格式存储的BERT预训练模型

AIGC领域文本嵌入:助力知识图谱构建

知识图谱(Knowledge Graph, KG)作为结构化知识的核心载体,已广泛应用于智能搜索、推荐系统、问答交互等场景。传统知识图谱构建依赖人工标注规则驱动,面临“冷启动”(低资源领域难以构建)、“规模瓶颈”(海量非结构化文本处理效率低)、“语义缺失”(浅层特征无法捕捉复杂语义)三大挑战。AIGC技术的兴起为知识图谱构建提供了新范式:通过文本嵌入(Text Embedding)将非结构化文本转换为低维稠密向量,利用向量空间的数学性质(如余弦相似度)实现实体、关系的自动化挖掘。

AI 原生应用开发的博客 946

SimpleDoc2Vec:Doc2Vec应用于IMDB上的情感分类

段落向量情感分类IMDB 说明文件: 来源文章 文章最好的解释 简单的代码说明 建议的方法(对实际问题的最佳近似) 步骤0: 清除数据集(StopWords,稀有字符...) 步骤1,生成单词的向量: 使用了Train和Unsup文档(75K Docs),未使用其他25k。 效果最佳的培训课程将单独产生 第2步: 文档向量是根据之前的训练生成的(Doc2Vec.infer_vector()) 第三步: 对分类器进行了训练(50%的训练,50%的测试,按初始设置细分) 发现但未解决的问题 在这种方法下,不可能估算出本文所揭示的结果 发现的最小错误为11.9%(DBOW,历元30,大小100) 余弦没有达到训练或没有达到至少在DM中所期望的程度 使用所有数据进行训练并采用训练中生成的向量可以降低误差 如何使其运作? 下载数据集 将解压缩的文件夹(aclImdb)保存在

文本嵌入演变、可视化和应用的综合指南

文本嵌入演变、可视化和应用的综合指南

安静的软件工程师 1256

doc2vec 和bert的应用示例

doc2vec 是一种自然语言处理技术,可以用来将文本文档转换为向量。这种技术可以用来聚类文本文档、执行文档相似性搜索以及将文本文档其他数据进行分类。 一个常见的应用示例是将 doc2vec 用于新闻分类。在这种情况下,你可以训练 doc2vec 模型,使它学会将新闻文档转换为向量。然后,你可以使用聚类算法将新闻文档分成若干类别,或者使用分类器将新闻文档分类为“体育”、“政治”、“娱乐”等不同的...

weixin_42596011的博客 258

语言模型及Word2vecBert简析

将句子的概率分解为各个单词条件概率的乘积,如果文本较长, 条件概率的估算会非常困难(维数灾难),所以就规定当前词只和它前面的n个词有关,更前面的词无关,每一个词只基于其前面N个词计算条件概率 —— N-gram语言模型,一般N取1到3之间。词的静态表征,不能解决同义词问题,如水果中的“苹果”和苹果公司的“苹果”,词向量表示是一样的,而实际上这两词的意思完全不一样。,来作为我们每个词的向量表示(词向量),用于nlp下游任务的输入或用于NLP模型的词嵌入。单词序列:[我, 狗, 被, 了, 咬]

沧海之巅的专栏 1147

【NLP-02】文本表达---词袋模型、TF-IDF、Word2Vec、Doc2Vec、FastText和Universal Sentence Encoder模型

NLP常见的句向量和词向量

qq_38614074的博客 2658

【必学收藏】预训练语言模型在通用文本嵌入中的关键作用:一文掌握GPTE核心技术应用

该文系统综述了预训练语言模型在通用文本嵌入中的关键作用,详细介绍了文本嵌入的基本概念、应用场景及架构,分析了模型规模对性能的影响,并汇总了多模态及代码嵌入模型。文章指出了GPTE的未来发展方向,包括解决安全和偏见问题、利用结构信息以及扩展推理能力,同时提供了大模型学习资料和路线图,帮助读者入门并深入学习AI大模型技术

2401_85325726的博客 922

Gecko: 革新文本嵌入技术从LLMs中提取知识以增强检索性能

文本嵌入模型是自然语言处理(NLP)中的基石,它们将文本输入转换为固定大小的向量,使得语义相似的文本在向量空间中彼此接近。这些嵌入模型广泛应用于多种NLP任务,如语义相似性度量、文档检索、聚类和分类等。早期的嵌入模型,例如Word2Vec和GloVe,主要关注于词或短语的嵌入。随着技术发展,像SBERT和Universal Sentence Encoder这样的模型开始提供更通用的文本嵌入,以支持广泛的下游任务。然而,这些模型在跨任务和跨领域的泛化能力上仍面临挑战。

人工智能前沿分享 1238

M3E Models:引领文本嵌入技术的新潮流

在当今信息爆炸的时代,文本数据的处理和分析变得愈发重要。M3E Models,作为MokaAI训练的开源文本嵌入模型,正逐渐成为中文自然语言处理领域的新宠。本文将深入探讨M3E Models的最新发展技术趋势和研究热点,以及其未来的发展前景。 ## 引言 随着技术的不断进步,文本嵌入模型已经成为了自然语言处理的核心组件。M3E Models在处理大规模中文数据集方面的优势,使其在文本相似度、...

gitblog_02575的博客 928

深度解析 Qwen3 Embedding:基于大模型的文本嵌入重排序技术突破

自然语言处理信息检索领域,文本嵌入重排序技术始终是支撑搜索引擎、问答系统、推荐系统等核心应用的底层基石。随着大语言模型(LLM)的快速发展,如何将其强大的语义理解能力注入传统嵌入重排序框架,成为学术界工业界共同探索的前沿方向。近日,阿里巴巴通义实验室的研究员们提出了基于Qwen3大模型的新一代文本嵌入重排序模型系列,在多语言语义表征、复杂指令理解及跨模态检索等任务上实现了突破性进展

m0_59164520的博客 1543

Python-BERT生成句向量BERT做文本分类文本相似度计算

本文基于Google开源的BERT代码进行了进一步的简化,方便生成句向量做文本分类

超越标注:合成数据引领下的文本嵌入技术革新

Doc2query(Nogueira 等人,2019)、InPars(Bonifacio 等人,2022)和 Promptagator(Dai 等人,2022)生成未标记文档的综合查询,然后将其用于文档扩展或模型训练。SGPT (Muennighoff, 2022)、GTR (Ni et al., 2022b) 和 Udever (Zhang et al., 2023a) 凭经验证明了文本嵌入的缩放规律,但它们的性能仍然落后于 E5 (Wang等人,2022b)和 BGE(Xiao 等人,2023)。

qq_59084968的博客 903

BGE大模型中文版完全指南:从入门到精通掌握文本嵌入技术

在当今信息爆炸的时代,如何让计算机真正理解中文文本的含义?BAAI bge-large-zh-v1.5作为顶尖的中文文本嵌入模型,为您提供了完美的解决方案!🚀 这款模型在C-MTEB中文评测基准中取得了64.53分的优异成绩,成为中文自然语言处理领域的明星产品。 ## 🔍 什么是文本嵌入技术文本嵌入技术就像是给文字装上了"数字身份证",将复杂的语言信息转化为计算机能够理解的数值向量。B

gitblog_00505的博客 813

大白话Bert-掌握最前沿Embedding结构

讲解Bert的训练和微调过程,并通过实例讲解Bert的代码应用过程课程: 资料: 代码:

word2Vec进阶 -Bert

Word2Vec进阶 - Bert – 潘登同学的NLP笔记 文章目录Word2Vec进阶 - Bert -- 潘登同学的NLP笔记Bert介绍BERT的结构Bert的输入Bert的输出预训练任务Masked Language Model(MLM)Next Sentence Prediction(NSP)总结 Bert介绍 BERT,全称是Pre-training of Deep Bidirectional Transformers for Language Understanding。注意其中的每一个词都

weixin_52185313的博客 1202
上一篇: 垂直领域知识图谱构建及应用平台的设计与实现
下一篇: 数据密集型超算现状、挑战以及未来发展趋势
罗思付之技术屋
博客等级 码龄3年 2805粉丝 · 519原创
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

罗思付之技术屋

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值