Hadoop入门进阶

作者: 小柑 | 来源:发表于2015-07-16 14:20 被阅读3281次

    看到一篇讲解Hadoop生态系统还比较全的文章,分享给大家~

    Hadoop是什么?

    Hadoop是一个开发和运行处理大规模数据的软件平台,是Apache的一个用java语言实现开源软件框架,实现在大量计算机组成的集群中对海量数据进行分布式计算。

    Hadoop生态系统:

    Hadoop框架中最核心设计就是:HDFS和MapReduce.HDFS提供了海量数据的存储,MapReduce提供了对数据的计算。

    详情:

    HDFS--Hadoop生态圈的基本组成部分是Hadoop分布式文件系统(HDFS)。HDFS是一种数据分布式保存机制,数据被保存在计算机集群上,HDFS为HBase等工具提供了基础。

    MapReduce--Hadoop的主要执行框架是MapReduce,它是一个分布式、并行处理的编程模型,MapReduce把任务分为map(映射)阶段和reduce(化简)。由于MapReduce工作原理的特性,Hadoop能以并行的方式访问数据,从而实现快速访问数据。

    Hbase--HBase是一个建立在HDFS之上,面向列的NoSQL数据库,用于快速读/写大量数据。HBase使用Zookeeper进行管理,确保所有组件都正常运行。

    Zookeeper--用于Hadoop的分布式协调服务。Hadoop的许多组件依赖于Zookeeper,它运行在计算机集群上面,用于管理Hadoop操作。

    Pig--它是MapReduce编程的复杂性的抽象。Pig平台包括运行环境和用于分析Hadoop数据集的脚本语言(Pig Latin)。其编译器将Pig Latin翻译成MapReduce程序序列。

    Hive--Hive类似于SQL高级语言,用于运行存储在Hadoop上的查询语句,Hive让不熟悉MapReduce开发人员也能编写数据查询语句,然后这些语句被翻译为Hadoop上面的MapReduce任务。像Pig一样,Hive作为一个抽象层工具,吸引了很多熟悉SQL而不是Java编程的数据分析师。

    Sqoop是一个连接工具,用于在关系数据库、数据仓库和Hadoop之间转移数据。Sqoop利用数据库技术描述架构,进行数据的导入/导出;利用MapReduce实现并行化运行和容错技术。

    Flume提供了分布式、可靠、高效的服务,用于收集、汇总大数据,并将单台计算机的大量数据转移到HDFS。它基于一个简单而灵活的架构,并提供了数据流的流。它利用简单的可扩展的数据模型,将企业中多台计算机上的数据转移到Hadoop

    也就会说如果你要学习Hadoop,就一定需要知道以上技术才算了解!

    然而网络上详细的、系统的讲解Hadoop生态系统的博文和课程都较少,但是实验楼有这样一个课程详细而系统的介绍了Hadoop生态环境,希望对Hadoop感兴趣的小伙伴有所帮助~

    Hadoop课程:

    【Hadoop入门进阶课程】

    课程较为全面、系统的介绍了Hadoop生态环境,对生态圈中的组件进行讲解并进行上机练习;

    课程实验:

    Hadoop介绍及1.X伪分布式安装

    介绍了Hadoop生态圈和版本衍化,讲解了Hadoop部署所需的环境和过程

    Hadoop2.X 64位编译

    由于Hadoop官网提供的安装包只支持32位,64位服务器需要手动编译,编译重要的是配置好环境

    Hadoop2.X 64位环境搭建

    与本系列第1个实验这个实验重点介绍的Hadoop2.X部署,相比Hadoop1.X增加了YARN组件

    HDFS原理及操作

    介绍Hadoop1.X下HDFS原理,并用三个例子进行演示

    MapReduce原理及操作

    介绍了MapReduce原理并动手计算了NCDC的最低温度和平均温度

    MapReduce应用案例

    通过练习MapReduce案例,加深对MapReduce原理的了解

    Pig介绍、安装与应用案例

    首先介绍了Pig,然后介绍Pig的安装和应用案例,可以体验到使用Pig是一件非常简单的事情

    Hive介绍和安装部署

    本课先介绍了Hive,然后安装MySql,最后进行部署Hive并进行验证

    Mahout介绍、安装与应用案例

    简单介绍了Mahout,并描述了Mahout的部署和应用案例

    HBase介绍、安装与应用案例

    本课程先介绍了HBase的原理,然后讲解了HBase的安装和基本命令操作

    Sqoop介绍、安装与操作

    介绍了Sqoop两个版本的异同,然后介绍了Sqoop的安装部署,最后用例子演示数据导入/导出

    Flume介绍与安装

    对Flume进行了介绍,并描述了Flume的部署过程

    Chukwa介绍与安装部署

    简单介绍了Chukwa并在此基础上描述了安装部署过程

    相关课程

    基础课:

    【Hadoop部署及管理】

    【HIVE教程】

    【HBASE教程】

    【Mahout教程】

    【Mapreduce编程系列】

    项目课:

    【问答网站推荐系统】

    【武侠小说词频统计】

    以上课程均可到实验楼网站免费在线学习,无需搭建环境,文档引导~

    另外:自己在网上找了以下资料:

    hadoop 生态圈图

    大数据脑图

    希望以上内容能对大数据感兴趣的小伙伴有所帮助~

    via:实验楼(www.shiyanlou.com)官方微信

    相关文章

      网友评论

      • kHodor:挺好,对于要上手的人来说很全面了。。。赞~

      本文标题:Hadoop入门进阶

      本文链接:https://www.haomeiwen.com/subject/olfpqttx.html