探索对话智能新高度:C3KG——中文常识对话知识图谱
项目简介
在当前的常识知识库中,信息往往是孤立的,这限制了对话模型对下一步行动的理解和规划。为解决这一问题,我们推出了创新项目——C3KG(Chinese Commonsense Conversation Knowledge Graph)。C3KG是一个融合社会常识知识与对话流程信息的大规模多轮对话数据集,并构建了首个中文常识对话知识图谱。我们的研究已被2022年ACL年会Findings论文集收录。
如果你的代码或研究与我们的工作相关,请引用以下论文:
@inproceedings{li2022c3kg,
title={C3KG: A Chinese Commonsense Conversation Knowledge Graph},
author={Li, Dawei and Li, Yanran and Zhang, Jiayi and Li, Ke and Wei, Chen and Cui, Jianwei and Wang, Bin},
booktitle={Findings of the Association for Computational Linguistics: ACL 2022},
pages={1369--1383},
year={2022}
}
资源发布
所有发布的资源,包括C3KG、ATOMIC_ZH以及CConv数据集,都可以在此处下载。
快速上手
数据与模型准备
- 下载ATOMIC2020,并将
train.tsv,test.tsv, 和dev.tsv文件放入./data目录下。 - 安装LTP4工具包,并将Base2模型放入
./model目录。 - 下载我们的SBERT-ATOMIC语义相似度模型并放入
./model目录。
数据预处理
- 在
./preprocess/get_trans.py文件中重写request_dev()函数,使用你喜欢的翻译模型或API。 - 执行
preprocess.sh脚本以进行数据预处理。
或者,你可以直接使用已翻译好的ATOMIC_Chinese.tsv, head_shortSentence.csv, head_phrase.csv文件,可以从此处下载。
构建C3KG
执行construct.sh脚本来获取C3KG。请注意,CConv数据集同样可在上述链接中找到。
许可证
我们的数据遵循CC BY 4.0许可,而代码则遵循Apache License 2.0许可。
C3KG旨在推动中文对话系统的智能水平,让机器能更好地理解人类对话的内在逻辑和常识推理。通过整合社会常识知识与对话流程,我们可以期待更加自然、流畅的人机交互体验。无论你是AI开发者、科研人员还是对对话系统感兴趣的爱好者,C3KG都值得你尝试和探索。现在就加入,让我们共同开启对话智能的新篇章!
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考



