对话语料库

用于训练中英文对话系统的语料库 Datasets for Training Chatbot System

用于对话系统的中英文语料 本项目收集了一些从网络中找到的用于训练中文(英文)聊天机器人的对话语料
 

公开语料

搜集到的一些数据集如下,点击链接可以进入原始地址

dgk_shooter_min.conv.zip 
中文电影对白语料,噪音比较大,许多对白问答关系没有对应好

The NUS SMS Corpus 
包含中文和英文短信息语料,据说是世界最大公开的短消息语料

ChatterBot中文基本聊天语料 
ChatterBot聊天引擎提供的一点基本中文聊天语料,量很少,但质量比较高

Datasets for Natural Language Processing 
这是他人收集的自然语言处理相关数据集,主要包含Question Answering,Dialogue Systems, Goal-Oriented Dialogue Systems三部分,都是英文文本。可以使用机器翻译为中文,供中文对话使用

小黄鸡 
据传这就是小黄鸡的语料:xiaohuangji50w_fenciA.conv.zip (已分词) 和 xiaohuangji50w_nofenci.conv.zip (未分词)
 

未公开语料

这部分语料,网络上有所流传,但由于我们能力所限,或者原作者并未公开,暂时未获取。只是列举出来,供以后继续搜寻。

微软小冰
版权

所有原始语料归原作者所有

联系 何云超

原文地址:https://github.com/candlewill/Dialog_Corpus

--------------------- 本文来自 u013378306 的CSDN 博客 ,全文地址请点击:https://blog.csdn.net/u013378306/article/details/72654418?utm_source=copy

猜你喜欢

转载自blog.csdn.net/Suan2014/article/details/82977640
今日推荐