漫谈大数据 - Spark on Hive & Hive on Spark

Hive原来的计算模型是MR，频繁操作磁盘（将中间结果写入到HDFS中）效率低。而Hive On Spark中使用了RDD（Dataframe）,然后运行在spark集群上面。元数据保存在mysql中，其中包含了hive表的描述信息，描述了那些数据库、表，以及表有多少列，每一列都是什么类型，还要描述表的数据保存在HDFS的什么位置。

Hive元数据库的功能

　　hive的元数据（metadata）建立了一种映射关系，执行HQL是，先到Mysql元数据库中查找描述信息，然后根据描述信息生成任务，然后将任务下发到spark集群中执行。hive on spark使用的仅仅是hive的标准和规范，不需要有hive数据库一样可以使用。要使用Hive的标准需要将hive的配置文件放在spark的conf目录下。没有安装Hive组件也没有影响。

Hive开启MetaStore服务

修改 hive/conf/hive-site.xml 新增如下配置：

<?xml version="1.0"?>
<?xml-stylesheet type="text/xsl" href="configuration.xsl"?>
<configuration>
    <property>
      <name>hive.metastore.warehouse.dir</name>
      <value>/user/hive/warehouse</value>
    </property>
    <property>
      <name>hive.metastore.local</name>
      <value>false</value>
    </property>
    <property>
      <name>hive.metastore.uris</name>
      <value>thrift://node01:9083</value>
    </property>
 </configuration>

后台启动 Hive MetaStore服务

nohup /export/servers/hive/bin/hive --service metastore 2>&1 >> /var/log.log &

漫谈大数据 - Spark on Hive & Hive on Spark

Spark on hive 与 Hive on Spark 的区别

Hive查询流程及原理

Hive将SQL转成MapReduce执行速度慢

Hive On Spark优化

Hive元数据库的功能

Hive开启MetaStore服务

猜你喜欢