自然语言处理-词干提取

[人工搬运,资料来自百度百科]

词干提取

    在词法学和信息检索里, 词干提取是去除词缀得到词根的过程(得到单词最一般的写法)。对于一个词的形态词根,词干并不需要完全相同;相关的词映射到同一个词干一般能得到满意的结果,即使该词干不是词的有效根。从1968年开始在计算机科学领域出现了词干提取的相应算法。很多搜索引擎在处理词汇时,对同义词采用相同的词干作为查询拓展,该过程叫做归并。词干提取项目一般涉及到词干提取算法或词干提取器。

举例

    一个面向英语的词干提取器,例如要识别字符串“cats”、“catlike”和“catty”是基于词根“cat”;stemmer”、“stemming”和“stemmed”是基于词根“stem”。一根词干提取器可以简化词 “fishing”,“fished”,“fish”和“fisher” 为同一个词根“fish”。

猜你喜欢

转载自blog.csdn.net/weixin_42152696/article/details/86083358