PDF
Hadoop发展历史1Hadoop(1):Hadoop是什么大数据ContentsHadoop发展历史 ..................................................................................... 1Hadoop基础概念 ..................................................................................... 2Hadoop生态 .......................................................................................... 3是一个分布式的大数据处理框架,在年击败超级计算机,成为最快排序数据的系统,用时秒。Hadoop发展历史年,和在的基础之上开发了,一款开源搜索引擎年,发表了的论文,这是其为存储海量搜索数据而设计的文件系统年,基于论文实现了分布式文件存储系统,命名为;同年发表了编程模型,用于大规模数据的并行分析计算年,基于,在中也实现了该功能年,成为的项目并改名为,当时还只能在个节点上运行。也加入并将扩展到可以在上千节点的集群上运行年,开始在个节点的集群上使用年,成为的顶级项目,许多其他公司例如等也开始使用总体来讲,基本上是跟着的步伐来的: Hadoop基础概念2Hadoop基础概念HDFS是一个主从架构,一个集群包含一个和多个。暴露文件系统命名空间,允许用户以文件的方式存储;在其内部一个文件会被切分成一个或者多个块存储在一系列的数据节点上。主节点,管理集群的文件命名空间、元数据等,并控制客户端访问。真正存储的数据是不会经过的。数据节点,通常每个机器上部署一个该节点来管理存储,根据的调度来执行块的创建、删除、复制等操作MapReduce是一个并行计算的编程模型,最早由谷歌提出,用来处理其海量的网页数据,为搜索引擎服务。能够通过集群的方式进行水平扩展,可以利用廉价的计算机进行计算,处理海量的数据。一般分为三步:Map每一个计算节点对本地数据应用map方法,将结果输出到临时存储。Shuffle计算节点对上一步的输出进行重新分布,保证同一个下的数据都在同一个节点之上Reduce并行的处理每一个的数据如下是一个统计单次出现频次的的典型过程: Hadoop生态3Hadoop生态除了本身之外,还有不少框架是围绕着而服务的,主要包括有以下:Apache Flume分布式的日志收集聚合系统Apache Hadoop YARN的资源管理任务调度框架Apache HBase分布式大数据数据库,基于和Apache Hive基于的数仓查询工具,可以通过来进行读写Presto分布式大数据查询引擎Apache Oozie的工作流调度系统Apache Pig基于的大规模数据分析平台,提供的语言叫,把数据分析请求转换为一系列经过优化处理的运算Apache Sqoop一个在和传统关系型数据库之间数据传输的工具Apache Zookeeper分布式协调系统Apache Impala为提供的一个查询引擎Apache Solr基于的搜索引擎Apache Spark一个大数据分析引擎Apache Storm一个分布式实时计算系统参考

HTML view coming soon.

Download PDF for the full formatted version.