solr的使用

solr的原理不和大家一一讲述，主要讲solr在使用过程中的注意事项

一.solr建立服务

首先是安装solr，安装步骤省略。。。。（不要说我懒，安装步骤导出都是。。。）

成功之后需要在solr里面建立一个针对你的业务的服务，我想建立一个叫做discuz的服务

./bin/solr create -c discuz

然后你在你的solr目录：solr-5.5.3/server/solr/ 下看见了discuz ，这是你刚刚创建的，针对某一业务的整个搜索配置都是在这个目录下配置的。

discuz目录解析：

1.conf :配置文件（索引、分词库、停词库等等配置）

2.core.properties

3.data

二.建立索引

建立索引就是数据库和solr建立一个关系，可以满足数据库数据定时导入solr里面，方面solr实现搜索。那么怎么建立索引呢？

在solr-5.5.3/server/solr/discuz/conf/data-config.xml 里面

<dataConfig>
    <dataSource type="JdbcDataSource"
        driver="com.mysql.jdbc.Driver"
        url="jdbc:mysql://11.11.11.11:800/database"
        user="root" password="123456"/>
    <document>
        <entity name="database" query="SELECT * FROM table;  "  
 deltaQuery="SELECT id  FROM table  where  `create` > unix_timestamp('${dataimporter.last_index_time}' ;  " 
  deltaImportQuery="SELECT * FROM table where id =${dataimporter.delta.tid}"  pk='tid'>
            <field column="id" name="id" />
            <field column="subject" name="subject" />
            <field column="views" name="views" />
           <field column="vip" name="vip" />
            <field column="message" name="message" />
            <field column="create" name="create" />
        </entity>
    </document>
</dataConfig>

dataConfig 里面是对数据库导入的一个配置

dataSource：数据库连接配置

document：数据库索引配置

entity：name= 数据库名字

query=全量导入数据的sql

deltaQuery：增量导入的id

deltaImportQuery：增量导入的sql

解释一下全量和增量：正常数据库导入solr第一次是全部导入，但是随着时间的变化数据库和solr数据不一致，这时候需要再次导入，按时间技术，半小时或者更合适的时间，只需要增量导入即可，更合适的时间再次全量导入即可

field 这些是返回字段的定义

==到现在数据库和solr的关系完事了，下面是solr自身对这些字段的处理

三.solr 对展示字段以及搜索的配置

在solr-5.5.3/server/solr/discuz/conf/solrconfig.xml

1.添加一下代码

<schemaFactory class="ManagedIndexSchemaFactory">
      <bool name="mutable">true</bool>
      <str name="managedSchemaResourceName">managed-schema</str>
 </schemaFactory>

在conf下面的 managed-schema 文件里对索引配置

1.配置中文分词mmseg4j

<!-- mmseg4j-->
    <fieldType name="text_mmseg4j_complex" class="solr.TextField" positionIncrementGap="100" >  
        <analyzer type="index">  
           <tokenizer class="com.chenlb.mmseg4j.solr.MMSegTokenizerFactory" mode="complex" dicPath="solr-5.5.3/server/solr/discuz/conf/dic"/>  
           <filter class="solr.StopFilterFactory" ignoreCase="true" words="stopwords.txt"/>
           <filter class="solr.SynonymFilterFactory" synonyms="synonyms.txt" ignoreCase="true" expand="true"/>
        </analyzer>
        <analyzer type="query">
           <tokenizer class="com.chenlb.mmseg4j.solr.MMSegTokenizerFactory" mode="complex" dicPath="solr-5.5.3/server/solr/discuz/conf/dic"/> 
           <filter class="solr.StopFilterFactory" ignoreCase="true" words="stopwords.txt"/>
           <filter class="solr.SynonymFilterFactory" synonyms="synonyms.txt" ignoreCase="true" expand="true"/>
        </analyzer>
    </fieldType>  
    <fieldType name="text_mmseg4j_maxword" class="solr.TextField" positionIncrementGap="100" >  
        <analyzer>  
            <tokenizer class="com.chenlb.mmseg4j.solr.MMSegTokenizerFactory" mode="max-word" dicPath="solr-5.5.3/server/solr/discuz/conf/dic"/>
        </analyzer>  
    </fieldType>
    <fieldType name="text_mmseg4j_simple" class="solr.TextField" positionIncrementGap="100" >  
        <analyzer>  
            <tokenizer class="com.chenlb.mmseg4j.solr.MMSegTokenizerFactory" mode="simple" dicPath="solr-5.5.3/server/solr/discuz/conf/dic"/>     
        </analyzer>  
        </fieldType>
    <!-- mmseg4j-->

solr-5.5.3/server/solr/discuz/conf/dic:中文分词的分词库目录，在改目录下放word.dic分词文件

stopwords.txt：停词文件

synonyms.txt：近义词文件

analyzer type="index"：索引检查分词、停词、近义词

analyzer type="query"：查找检查分词、停词、近义词

2.配置索引字段、字段类型、查询字段的中文分词类型

<field name="submes" type="text_mmseg4j_complex" indexed="true" stored="true" required="true" multiValued="true" />
<field name="id" type="int" indexed="true" stored="true" required="true" multiValued="false" />
<field name="vip" type="int" indexed="true" stored="true" required="true" multiValued="false" />
<field name="views"    type="int" indexed="true" stored="true" required="true" multiValued="false" />
<field name="create" type="int" indexed="true" stored="true" required="true" multiValued="false" />
<field name="subject" type="string" indexed="true" stored="true" required="true" multiValued="false" />
<field name="message" type="text_general" indexed="true" stored="true" required="true" multiValued="false" />
<copyField source="subject" dest="submes" />
<copyField source="vip" dest="submes" />
<copyField source="views" dest="submes" />
<copyField source="create" dest="submes" />

field 字段定义了solr展示的类型

name：字段名字

type：字段类型（如果是要进行查询的字段，类型为中文分词类型如：text_mmseg4j_complex）

indexed：true

stored:true

required:true

multiValued：查询字段设置为true ，其他为false

copyField : 拷贝需要索引的字段到整合字段中 submes是本列子中的整合字段 solr查询也是查询这个字段

这个字段可以根据多个字段进行权重设置，并且打分，排序

四.重启solr

discuz配置都已经更改完，现在需要重启生效：

./bin/solr restart

对于一些大的网站而言，重启整个solr回导致其他业务无法搜索，所以可以搞一个zookeep 来一个分布式管理就可以了

五.使用

1.增量导入，在你的solr使用界面上左边下拉框找到discuz

下面出现的

Dataimport：是执行增量全量导入的

query：搜索

analysis：分词

无法加载图片，根据很难形容，但是打开这个界面就知道了

2.搜索打分：有的时候我们除了想根据匹配度排序外，还想根据浏览量、创建时间、是否是vip等综合因素排序，

在curl请求时请求参数要加上下面的值：

$params['defType'] = 'edismax' ;

$params['bf'] = "sum(linear(vip,1000,0),linear(sqrt(log(linear(views,1,2))),100,0),sqrt(log(create)))";

bf里面的参数是solr支持的打分标准的函数，具体使用参考http://mxsfengg.iteye.com/blog/352191 详解很不完善，后续还会完善，如有问题随时提问

猜你喜欢