倒排索引和正排索引的优化点

搜索系统中对于索引和字典的存储主要面临两大挑战:

1.数据压缩

2.快速地检索和排序

正排表的存储有如下两个点来压缩数据:

1.正排表词在在DOC中出现的为止采用单调递增差分存储,这样存储这个数字序列的时候可以用尽可能少的字节数来存,达到压缩效果

2.在存储文档中所有WORD ID的时候在最后一个词后面插入一个NULL,并且采用非结构化方式存储可以减少很多冗余的DOCID的存储

猜你喜欢

转载自rrsongzi-gmail-com.iteye.com/blog/2218871