- textFile方法底层封装的是读取MR读取文件的方式,读取文件之前先split,默认split大小是一个block大小
- RDD提供计算最佳位置,体现了数据本地化。体现了大数据中“计算移动数据不移动”的理念
- K,V格式的RDD
- 如果RDD里面存储的数据都是二元组对象,那么这个RDD我们就叫做K,V格式的RDD
- RDD的弹性(容错)
- partition数量,大小没有限制,体现了RDD的弹性
- RDD之间依赖关系,可以基于上一个RDD重新计算出RDD
- RDD的分布式
- RDD是由Partition组成,partition是分布在不同节点上的