大数据学习路线（明了）

学习阶段一：

大家好我是大数据班的张鑫，
声明：本文转至http://blog.csdn.net/yuexianchang/article/details/52468291

首先我们先看一下此图：

在这里插入图片描述

一、入门准备

1、linux操作基础

Linux的介绍，Linux的安装：VMware Workstation虚拟软件安装过程、CentOS虚拟机安装过程
Linux的常用命令：常用命令的介绍、常用命令的使用和练习（文件操作、用户管理与权限、免密登陆配置与网络管理）
Linux系统进程管理基本原理及相关管理工具如ps、pkill、top、htop等的使用；
Linux启动流程，运行级别详解，chkconfig详解
VI、VIM编辑器：VI、VIM编辑器的介绍、VI、VIM扥使用和常用快捷键
Linux磁盘管理，lvm逻辑卷，nfs详解
Linux系统文件权限管理：文件权限介绍、文件权限的操作
Linux的RPM软件包管理：RPM包的介绍、RPM安装、卸载等操作
yum命令，yum源搭建
Linux网络：Linux网络的介绍、Linux网络的配置和维护防火墙配置
Shell编程：Shell的介绍、Shell脚本的编写
Linux上常见软件的安装：安装JDK、安装Tomcat、安装mysql,web项目部署

13）linux高级文本处理命令cut、sed、awklinux

14）定时任务crontab

二、离线计算系统

1、hadoop快速入门

hadoop背景介绍
分布式系统概述
离线数据分析流程介绍
集群搭建
集群使用初步

2、HDFS增强

HDFS的概念和特性
HDFS的shell(命令行客户端)操作
HDFS的工作机制
NAMENODE的工作机制
java的api操作
案例1：开发shell采集脚本

3、MAPREDUCE详解

自定义hadoop的RPC框架
Mapreduce编程规范及示例编写
Mapreduce程序运行模式及debug方法
mapreduce程序运行模式的内在机理
mapreduce运算框架的主体工作流程
自定义对象的序列化方法
MapReduce编程案例

4、MAPREDUCE增强

Mapreduce排序
自定义partitioner
Mapreduce的combiner
mapreduce工作机制详解

5、MAPREDUCE实战

maptask并行度机制-文件切片
maptask并行度设置
倒排索引
共同好友

6、federation介绍和hive使用

Hadoop的HA机制
HA集群的安装部署
集群运维测试之Datanode动态上下线
集群运维测试之Namenode状态切换管理
集群运维测试之数据块的balance
HA下HDFS-API变化
hive简介
hive架构
hive安装部署
hvie初使用

7、hive增强和flume介绍

HQL-DDL基本语法
HQL-DML基本语法
HIVE的join
HIVE 参数配置
HIVE 自定义函数和Transform
HIVE 执行HQL的实例分析
HIVE最佳实践注意点
HIVE优化策略
HIVE实战案例
Flume介绍
Flume的安装部署

四、Flume分布式日志框架

flume简介-基础知识
flume安装与测试
flume部署方式
flume source相关配置及测试
flume sink相关配置及测试
flume selector 相关配置与案例分析
flume Sink Processors相关配置和案例分析
flume Interceptors相关配置和案例分析
flume AVRO Client开发
flume 和kafka 的整合

五、内存数据库redis

redis特点、与其他数据库的比较
如何安装redis
如何使用命令行客户端
redis的字符串类型
redis的散列类型
redis的列表类型
redis的集合类型
如何使用java访问redis【a.python访问redis,scala访问redis】
redis的事务(transaction)
redis的管道(pipeline)
redis持久化(AOF+RDB)
redis优化
redis的主从复制
redis的sentinel高可用
twemproxy,codis实战
redis3.x集群安装配置

六、Storm上下游及架构集成

kafka是什么
kafka体系结构
kafka配置详解
kafka的安装
kafka的存储策略
kafka分区特点
kafka的发布与订阅
zookeeper协调管理
java编程操作kafka
scala编程操作kafka
flume 和kafka 的整合
Kafka 和storm 的整合

七、Storm从入门到精通

Storm的基本概念
Storm的应用场景
Storm和Hadoop的对比
Storm集群的安装的linux环境准备
zookeeper集群搭建
Storm集群搭建
Storm配置文件配置项讲解
集群搭建常见问题解决
Storm常用组件和编程API：Topology、 Spout、Bolt
Storm分组策略(stream groupings)
使用Strom开发一个WordCount例子
Storm程序本地模式debug、Storm程序远程debug
Storm事物处理
Storm消息可靠性及容错原理
Storm结合消息队列Kafka：消息队列基本概念(Producer、Consumer、Topic、Broker等)、消息队列Kafka使用场景、Storm结合Kafka编程API
Storm Trident概念
Trident state 原理
Trident开发实例
Storm DRPC(分布式远程调用)介绍
Storm DRPC实战讲解
Storm和Hadoop 2.x的整合：Storm on Yarn

八、scala编程

scala解释器、变量、常用数据类型等
scala的条件表达式、输入输出、循环等控制结构
scala的函数、默认参数、变长参数等
scala的数组、变长数组、多维数组等
scala的映射、元组等操作
scala的类，包括bean属性、辅助构造器、主构造器等
scala的对象、单例对象、伴生对象、扩展类、apply方法等
scala的包、引入、继承等概念
scala的特质
scala的操作符
scala的高阶函数
scala的集合
scala数据库连接

九、内存计算体系Spark

Spark介绍
Spark应用场景
Spark和Hadoop MR、Storm的比较和优势
RDD
Transformation
Action
Spark计算PageRank
Lineage
Spark模型简介
Spark缓存策略和容错处理
宽依赖与窄依赖
Spark配置讲解
Spark集群搭建
集群搭建常见问题解决
Spark原理核心组件和常用RDD
数据本地性
任务调度
DAGScheduler
TaskScheduler
Spark源码解读
性能调优
Spark和Hadoop2.x整合：Spark on Yarn原理

十、SparkStreaming应用实战
Spark-Streaming简介
Spark-Streaming编程
实战：StageFulWordCount
Flume结合Spark Streaming
Kafka结合Spark Streaming
窗口函数
ELK技术栈介绍
ElasticSearch安装和使用
Storm架构分析
Storm编程模型、Tuple源码、并发度分析
Storm WordCount案例及常用Api分析

十一、机器学习算法

1、python及numpy库

机器学习简介
机器学习与python
python语言–快速入门
python语言–数据类型详解
python语言–流程控制语句
python语言–函数使用
python语言–模块和包
phthon语言–面向对象
python机器学习算法库–numpy
机器学习必备数学知识–概率论

2、常用算法实现
knn分类算法–算法原理
knn分类算法–代码实现
knn分类算法–手写字识别案例
lineage回归分类算法–算法原理
lineage回归分类算法–算法实现及demo
朴素贝叶斯分类算法–算法原理
朴素贝叶斯分类算法–算法实现
朴素贝叶斯分类算法–垃圾邮件识别应用案例
kmeans聚类算法–算法原理
kmeans聚类算法–算法实现
kmeans聚类算法–地理位置聚类应用
决策树分类算法–算法原理
决策树分类算法–算法实现

张心情

发布了77 篇原创文章 · 获赞 24 · 访问量 1万+

私信关注