RDD原理

 

  • textFile方法底层封装的是读取MR读取文件的方式,读取文件之前先split,默认split大小是一个block大小
  • RDD提供计算最佳位置,体现了数据本地化。体现了大数据中“计算移动数据不移动”的理念
  • K,V格式的RDD
    • 如果RDD里面存储的数据都是二元组对象,那么这个RDD我们就叫做K,V格式的RDD
  • RDD的弹性(容错)
    • partition数量,大小没有限制,体现了RDD的弹性
    • RDD之间依赖关系,可以基于上一个RDD重新计算出RDD
  • RDD的分布式
    • RDD是由Partition组成,partition是分布在不同节点上的

 

猜你喜欢

转载自www.cnblogs.com/xiangyuguan/p/11203150.html
rdd