Python利用结巴模块统计《水浒传》词频

中文分词是中文文本处理的一个基础性工作,结巴分词利用进行中文分词。其基本实现原理有三点:

基于Trie树结构实现高效的词图扫描,生成句子中汉字所有可能成词情况所构成的有向无环图(DAG) 
采用了动态规划查找最大概率路径, 找出基于词频的最大切分组合 
对于未登录词,采用了基于汉字成词能力的HMM模型,使用了Viterbi算法 
下面利用结巴分词队水浒传的词频进行了统计

猜你喜欢

转载自blog.csdn.net/try2035/article/details/84618004
今日推荐