solr增量索引配置

solr增量索引配置
1.在进行增量索引前,首先要弄懂几个必要的属性,以及数据库建表事项,和dataimporter.properties
                   data-config.xml里面的数据
  <!--  transformer 格式转化:HTMLStripTransformer 索引中忽略HTML标签   --->
  <!--  query:查询数据库表符合记录数据   --->
  <!--  deltaQuery:增量索引查询主键ID    --->    注意这个只能返回ID字段
  <!--  deltaImportQuery:增量索引查询导入数据  --->
  <!--  deletedPkQuery:增量索引删除主键ID查询  ---> 注意这个只能返回ID字段
                   数据库配置注意事项
1.如果只涉及添加,与修改业务,那么数据库里只需额外有一个timpstamp字段
就可以了,默认值为当前系统时间,CURRENT_TIMESTAMP(笔者的数据为mysql的)
2.如果还涉及删除业务,那么数据里就需额外再多添加一个字段isdelete,int类型的
用0,1来标识,此条记录是否被删除,当然也可以用其他字段标识,ture或false都可以

                             dataimporter.properties
这个配置文件很重要,它是用来记录当前时间与上一次修改时间的,通过它能够找出,那些,新添加的,修改的,或删除的记录

       下面为笔者当时测试时的一个演示,其中添加,修改,删除,都涉及了
  

Java代码 复制代码  收藏代码
  1.   <dataConfig>     
  2.     <!---   此段话配置的是一个MySQL的数据源,(数据源也可以配置在solrconfig.xml中)  --->  
  3.       <dataSource name="mydb" type="JdbcDataSource" driver="com.mysql.jdbc.Driver" url="jdbc:mysql://localhost/test" user="root" password="ninemax"/>  
  4.   
  5.   
  6. <document>  
  7.      <!--  下面分别来介绍属性(如有错误,欢迎指出) -->  
  8.      <!--  pk="ID" 这个很有必要,因为其中的增量索引查询主键ID时需要  -->  
  9.       <!--  dataSource="mydb"   这个引用名字是引用上面数据源的名字 -->  
  10.       <!--  name="myinfo"   这个名字必须唯一,存在多个实体时 -->  
  11.        <!--  query="select  *  from myinfo WHERE isdelete=0   query查询是指  
  12.              查询出表里所有的符合条件的数据,因为笔者测试的有删除业务,所以  
  13.        where  后面有一个限定条件isdelete=0,意思为查询未被删除的数据  
  14.          
  15.        (注意这个query查询只对第一次全量导入有作用,对增量导入不起作用)  
  16.        -->  
  17.        <!--  
  18.        deltaQuery="select ID  from myinfo where my_date > '${dataimporter.last_index_time}'"   
  19.        deltaQuery的意思是,查询出所有经过修改的记录的ID  
  20.        可能是修改操作,添加操作,删除操作产生的  
  21.        (此查询只对增量导入起作用,而且只能返回ID值)  
  22.        -->  
  23.        <!--  
  24.        deletedPkQuery="select ID from myinfo where isdelete=1"    
  25.        此操作值查询那些数据库里伪删除的数据的ID(即isdelete标识为1的数据)  
  26.        solr通过它来删除索引里面对应的数据  
  27.        (此查询只对增量导入起作用,而且只能返回ID值)  
  28.        -->  
  29.        <!--  
  30.         deltaImportQuery="select * from myinfo where ID='${dataimporter.delta.ID}'"  
  31.         次查询是获取以上两步的ID,然后把其全部数据获取,根据获取的数据  
  32.         对索引库进行更新操作,可能是删除,添加,修改  
  33.         (此查询只对增量导入起作用,可以返回多个字段的值,一般情况下,都是返回所有字段的列)  
  34.        -->  
  35.          
  36.          
  37.        
  38.      <entity pk="ID"  dataSource="mydb" name="myinfo" query="select  *  from myinfo WHERE isdelete=0 "   
  39.       deltaQuery="select ID  from myinfo where my_date > '${dataimporter.last_index_time}'"   
  40.             deletedPkQuery="select ID from myinfo where isdelete=1"             
  41.       deltaImportQuery="select * from myinfo where ID='${dataimporter.delta.ID}'"  
  42.         
  43.      >  
  44.      <!--  此条记录有必要说一下,ID指定大写的,与上面语句中的对应起来---->  
  45.        
  46.       <field column="ID" name="id"/>  
  47.        <field column="name" name="name"/>  
  48.        <field column="address" name="address"/>  
  49.        <field column="age" name="age"/>  
  50.         <field column="my_date" name="my_date"/>  
  51.          <field column="isdelete" name="isdelete"/>  
  52.       </entity>  
  53.        
  54.   
  55. </document>  
  56.   
  57.   </dataConfig>    

猜你喜欢

转载自weitao1026.iteye.com/blog/2266942