GibbsLDA++的使用

本文详细介绍了GibbsLDA++的下载、安装过程,以及语料准备和运行参数设置。在安装时需修改源代码,解决缺失头文件的问题。语料需为特定格式的dat文件,内容经过分词处理。运行示例展示了如何配置参数进行主题模型训练,并列举了训练完成后输出的文件内容。

一、下载点击打开链接

  把下载的文件放到linux的一个目录下,如 /home/user/LDA/,然后执行如下命令

cd /home/user/LDA/

gunzip GibbsLDA++-0.2.tar.gz

tar -xf GibbsLDA++-0.2.tar

cd \GibbsLDA++-0.2


二、安装,源代码里两个源文件有错,缺少包含头文件

执行如下命令,报错

make clean

make

解决方法

1. utils.cpp 找不到 'atof'函数,补上include: #include <cstdlib>
2. lda.cpp 找不到 'printf' 函数,补上 #include <cstdio>

然后执行make clean和make就ok了


三、语料准备

文件格式是dat。这是最原始的txt文件。你也可以用任何软件存成txt文件之后,直接把后缀改成dat就行。

文件内容:

第1行是你总共的文章篇数

第2行到第M行就是你的那些文章,每篇文章占一行。对于英文来说,每个词之间已经用空格分开了,但是中文不行,所以你要先对文章进行分词和去停用词。

注意:文章格式是ANSI,文章中不能有空行


四、运行

 lda -est [-alpha <double>] [-beta <double>] [-ntopics <int>] [-niters <int>] [-savestep <int>] [-twords <int>] -dfile <string>

例如

src/lda -est -alpha 0.5 -beta 0.1 -ntopics 100 -niters 1000 -savestep 100 -twords 20 -dfile /home/leichen/LDA/data.dat

参数alpha是0.5(这个可以先不管),参数beta是0.1(这个也可以先不管),产生100个topic,运算迭代1000次,每迭代100次之后的结果都保存出来,每个topic包含出现概率最大的前20个词,要运算的文件是/home/leichen/LDA/data.dat


五、结果

结果文件存在你的测试文件所在的目录,对于本文就是/home/leichen/LDA/

model-final.others 设置的参数

model-final.phi    每个主题下的词概率分布

model-final.tassign  每篇文章的各个词被指定的主题编号

model-final.theta  每篇文章的主题概率分布

model-final.twords 每个主题下的前20个主题词

wordmap.txt 词典




评论 2
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值