1、语料相关说明
第一种方法是去网上下载相关语料,我这里有一份复旦大学中文文本分类时用的语料模型,分为训练集和测试集两部分,约220M,包括了常用的中文词汇。训练文本的大小直接决定了算法的训练效果,如果你有更合适的语料库可以用自己的。
2、中文训练语料的处理
首先去网下载相关的语料文本,然后将其打开后另存为,注意选utf-8编码格式。
文本文件准备好,现在开始用python对此txt文档进行处理。
# 此函数作用是对初始语料进行分词处理后,作为训练模型的语料
def cut_txt(old_file):
import jieba
global cut_file # 分词之后保存的文件名
cut_file = old_file + '_cut.txt'
try:
fi = open(old_file, 'r', encoding='utf-8')
except BaseException as e: # 因BaseException是所有错误的基类,用它可以获得所有错误类型
print(Exception, ":", e) # 追踪错误详细信息
text = fi.read() # 获取文本内容
new_text = jieba.cut(text, cut_all=False) # 精确模式
str_out = ' '.join(new_text).replace(',', '').replace('。', '').replace('?', '').replace('!', '') \
.replace('“', '').replace('”'


1289

被折叠的 条评论
为什么被折叠?



