公司与客户沟通中的虚伪检测:技术、评估与应用洞察
在当今复杂的社会和商业环境中,准确识别言语和行为中的虚伪成分至关重要。无论是在政治、商业还是日常交流中,虚伪的表达可能会误导决策、破坏信任。本文将深入探讨虚伪检测的相关技术、评估方法以及与其他相关概念的区别。
系统架构
虚伪检测器的系统架构包含主要检测引擎和数据组件两部分。主要检测引擎有基于最近邻的学习方法和支持向量机树核(SVM TK)学习方法。最近邻学习用于快速检测并具有可解释性,当找到最近邻模板时,检测器会解释为何将给定文本分类为虚伪或非虚伪。而SVM TK学习则用于通过扩大训练集来迭代提高检测准确性,虽不具备最近邻方法的可解释性和速度优势,但能保证更高的检测精度。
数据组件包括训练集形成器、特定领域本体和实体匹配。系统在找到候选邻居时,会尝试协调“说”和“做”部分的实体,只有在突出实体协调成功时,才会对当前文本和候选最近模板进行泛化。
为实现更高的检测精度并减少手动标记,我们采用迭代方式扩展包含虚伪内容的黄金(精简)文本集。具体步骤如下:
1. 将手动构建的初始模板应用于原始文本集,得到当前精简集。
2. 使用SVM TK从精简集构建分类模型。
3. 将分类模型应用于原始集,生成更大的精简训练集。
4. 重复上述步骤,直到模型不再改进(最新迭代的F1增益低于0.3%)。
评价
我们从多个与虚伪相关的网络来源收集“说 - 做”句子和段落,还使用Twitter搜索API获取相关推文,并利用客户投诉的终极欺骗数据集。同时,为每个数据源准备了负面数据集。
在学习过程中,采用两步学习法:
1. 第一步
超级会员免费看
订阅专栏 解锁全文


被折叠的 条评论
为什么被折叠?



