美文网首页大数据程序员Kyligence
史上最快! 10小时大数据入门实战(五)-分布式计算框架MapR

史上最快! 10小时大数据入门实战(五)-分布式计算框架MapR

作者: 紫霞等了至尊宝五百年 | 来源:发表于2018-06-24 18:30 被阅读41次
目录

1 MapReduce概述

2 MapReduce编程模型之通过wordcount词频统计分析案例入门

MapReduce执行流程


  • InputFormat





  • OutputFormat
    OutputFormt接口决定了在哪里以及怎样持久化作业结果。Hadoop为不同类型的格式提供了一系列的类和接口,实现自定义操作只要继承其中的某个类或接口即可。你可能已经熟悉了默认的OutputFormat,也就是TextOutputFormat,它是一种以行分隔,包含制表符界定的键值对的文本文件格式。尽管如此,对多数类型的数据而言,如再常见不过的数字,文本序列化会浪费一些空间,由此带来的结果是运行时间更长且资源消耗更多。为了避免文本文件的弊端,Hadoop提供了SequenceFileOutputformat,它将对象表示成二进制形式而不再是文本文件,并将结果进行压缩。

3 MapReduce核心概念


3.1 Split

3.2 InputFormat

4 MapReduce 1.x 架构




5 MapReduce 2.x 架构

6 Java 实现 wordCount


clean package
上传到Hadoop服务器
全路径没有问题

7 重构

8 Combiner编程

9 Partitoner


10 JobHistoryServer

相关文章

网友评论

    本文标题:史上最快! 10小时大数据入门实战(五)-分布式计算框架MapR

    本文链接:https://www.haomeiwen.com/subject/imokyftx.html