对spark算子aggregateByKey的理解 - 代码天地

对spark算子aggregateByKey的理解

其他 2018-10-12 09:50:22 阅读次数: 0

案例

aggregateByKey算子其实相当于是针对不同“key”数据做一个map+reduce规约的操作。

举一个简单的在生产环境中的一段代码
有一些整理好的日志字段，经过处理得到了RDD类型为(String,(String,String))的List格式结果，其中各个String代表的是：(用户名,(访问时间,访问页面url))
同一个用户可能在不同的时间访问了不同或相同的页面，为了合并同一个用户的访问行为，写了下面这段代码，用到aggregateByKey。

val data = sc.parallelize(
List(
("13909029812",("20170507","http://www.baidu.com")),("18089376778",("20170401","http://www.google.com")),("18089376778",("20170508","http://www.taobao.com")),("13909029812",("20170507","http://www.51cto.com")) ) ) data.aggregateByKey(scala.collection.mutable.Set[(String, String)](), 200)((set, item) => { set += item }, (set1, set2) => set1 union set2).mapValues(x => x.toIterable).collect

结果：

res12: Array[(String, Iterable[(String, String)])] = Array((18089376778,Set((20170401,http://www.google.com), (20170508,http://www.taobao.com))), (13909029812,Set((20170507,http://www.51cto.com), (20170507,http://www.baidu.com))))

分解分析：##

aggregateByKey(参数1)(参数2，参数3)

过程：对于data的某个key，参数1为初始化值，在参数2的函数中，初始值和该key的每一个value传入函数进行操作，所有返回的结果在参数3中进行规约。

参数1

  scala.collection.mutable.Set[(String, String)]()

new 了一个空的set集合，做为初始值

参数2
(set, item) => {
set += item
}
一个类似于map的映射函数，将该key的每一个value（在本案例之是(访问时间，访问url)）作为item，将其放入set中并返回。
可知某个key的所有value都会返回一个含有该value的set
参数3
(set1, set2) => set1 union set2
该key的所有value得到的set进行union规约。并返回

最终结果：得到了每一个用户在所有时间的访问url的行为信息。

作者：Entry_1
链接：https://www.jianshu.com/p/09912beb1350
來源：简书
简书著作权归作者所有，任何形式的转载都请联系作者获得授权并注明出处。

猜你喜欢

转载自www.cnblogs.com/cxhfuujust/p/9776353.html

对spark算子aggregateByKey的理解

Spark算子中aggregateByKey算子的理解【Java版纯代码】

Spark算子之aggregateByKey详解

Spark core算子aggregateByKey实例

spark-聚合算子aggregatebykey

Spark高级算子：mapPartitionsWithIndex，aggregate，aggregateByKey

Spark中aggregateByKey算子详解介绍

spark-aggregateByKey

spark aggregateByKey与aggregate

Spark——aggregateByKey 案例

Spark操作—aggregate、aggregateByKey详解

spark 使用aggregateByKey 代替groupbyKey

Spark编程：combineByKey与aggregateByKey异同

Spark算子中combineByKey算子的理解（包含mapPartitionsWithIndex算子和parallelizePairs算子）【Java版纯代码】

站在算子角度理解spark分区策略

【Spark】spark使用aggregateByKey替代groupBeKey

spark算子

【Spark】算子

spark 算子

【Spark九十七】RDD API之aggregateByKey

由aggregateByKey看到spark的性能调优

(二)常用Shuffle类算子：groupByKey、reduceByKey、aggregateByKey 和 sortByKey

spark算子详解------spark算子分类

Spark中的groupByKey,reduceByKey,combineBykey,和aggregateByKey的比较和区别

【spark】二 reduceByKey、reduceByKeyLocally、groupByKey、combineByKey、aggregateByKey 区别 [待补充]

Spark_Spark算子_repartitionAndSortWithinPartitions

spark transformation算子

Spark算子练习

Spark常用算子详解

spark重要的几个算子

今日推荐

基于大语言模型的开源知识库问答系统 MaxKB GitHub Star 数量突破 5,000 个！

美国拟限制 AI 大模型出口中国和俄罗斯

苹果将与 OpenAI 达成协议，将 ChatGPT 应用于 iPhone

openKylin 社区生态委员会第六次会议圆满召开

阿里云正式发布通义千问 2.5

Python 3.13 发布首个 Beta：实验性自由线程模式和 JIT、改进交互式解释器

Stack Overflow 拿我的代码去训练 AI 大模型，还封了我的账号

Pop!_OS 的 COSMIC 桌面完成 App Store 上架工作

《2024 年一季度互联网投融资运行情况》研究报告

报告：Django 仍然是 74% 开发者的首选

15 年前上了“FFmpeg 耻辱柱”，今天他还得谢谢咱——腾讯QQPlayer一雪前耻？

TIOBE 5 月榜单：Fortran “复活”进入 Top 10

周排行

记一下去大梅沙的准备（2018-05-26）

Spring 注解事务

基于HTTP协议的客户端缓存

阿里云rds 备份和还原

[PHP] 几个拖慢 PHP 程序/API 运行速度的点

python 代码风格------------PEP8规则

js控制json生成菜单——自制菜单（一）

将字符串: 'k:1|k1:2|k2:3|k3:4 ' ,处理成 python 字典: {'k':1, 'k1':2, ...}

微信小程序转支付宝小程序

Qt551.窗口滚动条

每日归档

更多

2024-05-13(18)

2024-05-12(0)

2024-05-11(38)

2024-05-10(38)

2024-05-09(35)

2024-05-08(42)

2024-05-07(14)

2024-05-06(40)

2024-05-05(0)

2024-05-04(7)