本文主要是学习参考杨秀璋老师的博客,笔记总结。
原文链接
文章目录
书山有路勤为径,学海无涯苦作舟(行行代码要手敲)

零、吃水不忘挖井人
一、数据预处理(分词-清洗-特征提取-权重)
数据的预处理直接影响后续模型分析的好坏,数据预处理是在对数据进行一些初步的处理:
- 缺失值缺失
- 噪声处理
- 中文分析
数据预处理的基本步骤,中文分词,词性标注,数据清洗,特征分词(向量空间模型存储),权重计算(TF-IDF)等:

1.中文分词
在得到语料之后,首先需要做的就是对中文语料进行分词。
需要通过一定的分词技术把句子分割成空格连接的词序列。
2.数据清洗及停用词过滤
在中文分词技术得到分完词的语料后,可能会存在脏数据和停用词等现象。
本文是关于自然语言处理的学习笔记,主要内容包括数据预处理(分词、清洗、特征提取、权重计算)、Jieba分词的安装与使用、数据清洗的停用词过滤、特征提取的向量空间模型和余弦相似度、以及TF-IDF权重计算。通过实例展示了如何使用Jieba进行中文分词,以及如何运用TF-IDF进行文本特征提取,最终实现了文本聚类。
订阅专栏 解锁全文

2979

被折叠的 条评论
为什么被折叠?



