Spark SQL join的三种实现方式 - 代码天地

Spark SQL join的三种实现方式

其他 2018-11-05 20:31:39 阅读次数: 0

引言

join是SQL中的常用操作，良好的表结构能够将数据分散到不同的表中，使其符合某种规范(mysql三大范式)，可以最大程度的减少数据冗余，更新容错等，而建立表和表之间关系的最佳方式就是join操作。

对于Spark来说有3种Join的实现，每种Join对应的不同的应用场景(SparkSQL自动决策使用哪种实现范式)：

　　1.Broadcast Hash Join：适合一张很小的表和一张大表进行Join；

　　2.Shuffle Hash Join：适合一张小表(比上一个大一点)和一张大表进行Join；

　　2.Sort Merge Join：适合两张大表进行Join；

前两者都是基于Hash Join的，只不过Hash Join之前需要先shuffle还是先brocadcast。下面详细解释一下这三种Join的具体原理。

Hash Join

先来看看这样一条SQL语句：select * from order,item where item.id = order.i_id，参与join的两张表是order和item，join key分别是item.id以及order.i_id。现在假设Join采用的是hash join算法，整个过程会经历三步：

　　1.确定Build Table以及Probe Table：这个概念比较重要，Build Table会被构建成以join key为key的hash table，而Probe Table使用join key在这张hash table表中寻找符合条件的行，然后进行join链接。Build表和Probe表是Spark决定的。通常情况下，小表会被作为Build Table，较大的表会被作为Probe Table。

　　2.构建Hash Table：依次读取Build Table(item)的数据，对于每一条数据根据Join Key(item.id)进行hash，hash到对应的bucket中(类似于HashMap的原理)，最后会生成一张HashTable，HashTable会缓存在内存中，如果内存放不下会dump到磁盘中。

　　3.匹配：生成Hash Table后，在依次扫描Probe Table(order)的数据，使用相同的hash函数(在spark中，实际上就是要使用相同的partitioner)在Hash Table中寻找hash(join key)相同的值，如果匹配成功就将两者join在一起。

猜你喜欢

转载自www.cnblogs.com/duodushuduokanbao/p/9911256.html

Spark SQL join的三种实现方式

Spark SQL 操作HDFS的三种方式（八）

spark sql 给dataframe列重命名的三种方式

Spark SQL 之 Join 实现

Spark SQL 之 Join

Spark SQL Join类型

Spark sql的join

spark三种连接join

Spark SQL中Join常用的几种实现

elasticsearch使用spark sql来实现join

使用 spark sql extensions 实现 skew join

Spark SQL之Join优化

Spark SQL Join原理分析

谈谈Spark Sql中的join

Atitit 数据join 的原理与java实现 Atitit join表连接的原理与实现 13、SQL Server 表连接的三种方式　　(1) Merge Join 　　(2) Nested

spark编程基础（三）-- Spark SQL

SQL join 三种扩展用法

畅聊Spark（三）SQL

理解Spark SQL(三）—— Spark SQL程序举例

Spark SQL的整体实现逻辑

Spark SQL 实现列转行

[Spark]-Join方式的实现

Spark 三种方式查询数据

spark案例三用Spark_Sql_DataSet实现

Spark的join实现的3种方式(与Hive中的join对比)

使用Spark SQL进行Cassandra Join (Java)

spark sql 之join等函数用法

Spark SQL

spark笔记-spark sql

【Spark】Spark SQL原理、编译、配置及运行方式详述

今日推荐

openKylin 社区生态委员会第六次会议圆满召开

阿里云正式发布通义千问 2.5

Python 3.13 发布首个 Beta：实验性自由线程模式和 JIT、改进交互式解释器

Stack Overflow 拿我的代码去训练 AI 大模型，还封了我的账号

Pop!_OS 的 COSMIC 桌面完成 App Store 上架工作

报告：Django 仍然是 74% 开发者的首选

《2024 年一季度互联网投融资运行情况》研究报告

15 年前上了“FFmpeg 耻辱柱”，今天他还得谢谢咱——腾讯QQPlayer一雪前耻？

TIOBE 5 月榜单：Fortran “复活”进入 Top 10

GCC 14.1 发布

面壁智能发布 Eurux-8x22B 开源大模型 —— 堪称「理科状元」

开源日报 | 谷歌扶持鸿蒙上位；开源Rabbit R1；Docker加持的安卓手机；微软的焦虑和野心；海尔电器把开放平台关了

周排行

计算机组成与设计（七）—— 除法器

Integer Approximation(分治+枚举)

大话数据库索引

windows10系统JDK的配置及下载地址

mysql实现秒值转换中原六仔平台搭建

Codeforces Round #556 (Div. 1)

百练1064 网线主管

Codeforces 995F Cowmpany Cowmpensation

子集生成之增量构造法，位向量法，二进制法

ERROR: cmd.exe failed with args /c "/APK\gradle\rungradle.bat...

每日归档

更多

2024-05-10(38)

2024-05-09(35)

2024-05-08(42)

2024-05-07(14)

2024-05-06(40)

2024-05-05(0)

2024-05-04(7)

2024-05-03(19)

2024-05-02(0)

2024-05-01(4)