Apache Hadoop
1、Hadoop介绍
Hadoop是Apache旗下的java语言实现开源软件框架,是一个开发和运行处理大规模数据的软件平台。允许使用简单的编程模型在大量计算机集群上对大型数据集进行分布式处理。
狭义上说,Hadoop指Apache这款开源框架,核心组件有:
- HDFS(分布式文件系统):解决海量数据存储
- YARN(作业调度和集群资源管理的框架):解决资源任务调度
- MAPREDUCE(分布式运算编程框架):解决海量数据计算
Hadoop生态圈
庞大体系,随着生态系统的成长,新出现的项目越来越多,对于非Apache主管的项目,对Hadoop是很好的补充或者更高层的抽象。如:
hdfs:分布式文件系统
mapduce:分布式运算程序开发框架
hive:基于Hadoop的分布式数据仓库,提供基于SQL的查询数据操作
hbase:基于Hadoop的分布式海量数据库
zookeeper:分布式协调服务基础组件
mahout:基于mapreduce/spark/flink等分布式运算框架的机器学习算法库
oozie:工作流调度框架
sqoop:数据导入导出工具(比如用于mysql和hdfs之间)
flume:日志数据采集框架
impala:基于hive的实时sql查询分析