一、下载点击打开链接
把下载的文件放到linux的一个目录下,如 /home/user/LDA/,然后执行如下命令
cd /home/user/LDA/
gunzip GibbsLDA++-0.2.tar.gz
tar -xf GibbsLDA++-0.2.tar
cd \GibbsLDA++-0.2
二、安装,源代码里两个源文件有错,缺少包含头文件
执行如下命令,报错
make clean
make
解决方法
1. utils.cpp 找不到 'atof'函数,补上include: #include <cstdlib>
2. lda.cpp 找不到 'printf' 函数,补上 #include <cstdio>
然后执行make clean和make就ok了
三、语料准备
文件格式是dat。这是最原始的txt文件。你也可以用任何软件存成txt文件之后,直接把后缀改成dat就行。
文件内容:
第1行是你总共的文章篇数
第2行到第M行就是你的那些文章,每篇文章占一行。对于英文来说,每个词之间已经用空格分开了,但是中文不行,所以你要先对文章进行分词和去停用词。
注意:文章格式是ANSI,文章中不能有空行
四、运行
lda -est [-alpha <double>] [-beta <double>] [-ntopics <int>] [-niters <int>] [-savestep <int>] [-twords <int>] -dfile <string>
例如
src/lda -est -alpha 0.5 -beta 0.1 -ntopics 100 -niters 1000 -savestep 100 -twords 20 -dfile /home/leichen/LDA/data.dat
参数alpha是0.5(这个可以先不管),参数beta是0.1(这个也可以先不管),产生100个topic,运算迭代1000次,每迭代100次之后的结果都保存出来,每个topic包含出现概率最大的前20个词,要运算的文件是/home/leichen/LDA/data.dat
五、结果
结果文件存在你的测试文件所在的目录,对于本文就是/home/leichen/LDA/
model-final.others 设置的参数
model-final.phi 每个主题下的词概率分布
model-final.tassign 每篇文章的各个词被指定的主题编号
model-final.theta 每篇文章的主题概率分布
model-final.twords 每个主题下的前20个主题词
wordmap.txt 词典
本文详细介绍了GibbsLDA++的下载、安装过程,以及语料准备和运行参数设置。在安装时需修改源代码,解决缺失头文件的问题。语料需为特定格式的dat文件,内容经过分词处理。运行示例展示了如何配置参数进行主题模型训练,并列举了训练完成后输出的文件内容。

3601

被折叠的 条评论
为什么被折叠?



