探索对话智能新高度:C3KG——中文常识对话知识图谱

探索对话智能新高度:C3KG——中文常识对话知识图谱

项目简介

在当前的常识知识库中,信息往往是孤立的,这限制了对话模型对下一步行动的理解和规划。为解决这一问题,我们推出了创新项目——C3KG(Chinese Commonsense Conversation Knowledge Graph)。C3KG是一个融合社会常识知识与对话流程信息的大规模多轮对话数据集,并构建了首个中文常识对话知识图谱。我们的研究已被2022年ACL年会Findings论文集收录。

如果你的代码或研究与我们的工作相关,请引用以下论文:

@inproceedings{li2022c3kg,
  title={C3KG: A Chinese Commonsense Conversation Knowledge Graph},
  author={Li, Dawei and Li, Yanran and Zhang, Jiayi and Li, Ke and Wei, Chen and Cui, Jianwei and Wang, Bin},
  booktitle={Findings of the Association for Computational Linguistics: ACL 2022},
  pages={1369--1383},
  year={2022}
}

资源发布

所有发布的资源,包括C3KG、ATOMIC_ZH以及CConv数据集,都可以在此处下载。

快速上手

数据与模型准备

  1. 下载ATOMIC2020,并将train.tsv, test.tsv, 和 dev.tsv 文件放入./data目录下。
  2. 安装LTP4工具包,并将Base2模型放入./model目录。
  3. 下载我们的SBERT-ATOMIC语义相似度模型并放入./model目录。

数据预处理

  1. ./preprocess/get_trans.py文件中重写request_dev()函数,使用你喜欢的翻译模型或API。
  2. 执行preprocess.sh脚本以进行数据预处理。

或者,你可以直接使用已翻译好的ATOMIC_Chinese.tsv, head_shortSentence.csv, head_phrase.csv文件,可以从此处下载。

构建C3KG

执行construct.sh脚本来获取C3KG。请注意,CConv数据集同样可在上述链接中找到。

许可证

我们的数据遵循CC BY 4.0许可,而代码则遵循Apache License 2.0许可。

C3KG旨在推动中文对话系统的智能水平,让机器能更好地理解人类对话的内在逻辑和常识推理。通过整合社会常识知识与对话流程,我们可以期待更加自然、流畅的人机交互体验。无论你是AI开发者、科研人员还是对对话系统感兴趣的爱好者,C3KG都值得你尝试和探索。现在就加入,让我们共同开启对话智能的新篇章!

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值