当前位置:网站首页>图书 > 正文 >>

HADOOP生态系统及开发

图书信息

作者深圳市讯方技术股份有限公司
出版社西安电子科技大学
ISBN9787560669212
条形码9787560669212 ; 978-7-5606-6921-2
出版时间2023-08-01
页数256页
分类计算机/网络
价格定价: ¥49.0

内容简介

本书主要围绕Hadoop及其生态系统中的各种工具展开讲解,重点介绍大数据分析处理的整体流程,剖析每个环节中所使用的不同组件的技术原理和特点。本书内容共分为七个模块:模块一为大数据基础概述,主要讲述大数据的概念、来源、应用场景、大数据时代的机遇和挑战等相关内容;模块二至模块六以Hadoop生态系统为基础,系统地讲解了分布式文件系统HDFS、分布式计算框架MapReduce、分布式资源管理器YARN、分布式NoSQL数据库HBase、分布式数据仓库Hive、数据采集系统Flume和分布式发布订阅消息系统Kafka,每一个模块均附有大量的实训内容,操作指导步骤详细,以方便读者掌握相关知识;模块七为大数据日志分析综合项目案例,通过案例将前面模块所学的内容融会贯通,以方便读者掌握大数据开发的核心流程。

本书由深圳市讯方技术股份有限公司与重庆机电职业技术大学共同编写,并以新时代中国特色社会主义思想为思政面,每个模块均融入思政元素,内容丰富、概念清晰,可作为大数据相关专业的教材,也可作为大数据领域技术人员及编程爱好者的参考用书。

目录

  1. HADOOP生态系统及开发 目录
  2. 模块一 大数据基础概述 1
  3. 1.1 大数据的概念和价值 1
  4. 1.2 大数据的来源 3
  5. 1.3 大数据的应用场景 3
  6. 1.4 大数据时代的机遇和挑战 6
  7. 1.5 Hadoop及其生态系统简介 8
  8. 1.6 大数据行业的人才需求状况 11
  9. 知识巩固 12
  10. 模块二 Hadoop分布式文件系统HDFS 13
  11. 2.1 HDFS概述及基本概念 13
  12. 2.1.1 HDFS概述 13
  13. 2.1.2 HDFS的基本概念 14
  14. 2.2 HDFS的系统架构与适用场景 16
  15. 2.2.1 HDFS的系统架构 16
  16. 2.2.2 HDFS的适用场景 18
  17. 2.3 HDFS的操作方式 19
  18. 2.3.1 常用Shell命令 19
  19. 2.3.2 HDFS的数据写入流程 21
  20. 2.3.3 HDFS的数据读取流程 22
  21. 2.4 HDFS的关键特性 23
  22. 2.4.1 HDFS的架构设计特性 23
  23. 2.4.2 HDFS的高可用性 23
  24. 2.4.3 元数据持久化 25
  25. 2.4.4 HDFS的联邦存储机制 27
  26. 2.4.5 HDFS的数据副本机制 28
  27. 2.4.6 HDFS的数据存储策略 30
  28. 2.4.7 HDFS的数据完整性保障 31
  29. 2.4.8 HDFS的其他关键特性 32
  30. 技能实训 32
  31. 实训2.1 基础实训环境准备 32
  32. 实训2.2 HDFS的安装部署与配置 42
  33. 实训2.3 HDFS的读写API操作 53
  34. 知识巩固 61
  35. 模块三 分布式计算框架MapReduce和分布式资源管理器YARN 62
  36. 3.1 MapReduce和YARN概述 62
  37. 3.1.1 MapReduce概述 62
  38. 3.1.2 YARN概述 63
  39. 3.2 MapReduce和YARN的工作过程与架构 64
  40. 3.2.1 MapReduce的基本工作过程 64
  41. 3.2.2 Shuffle过程 66
  42. 3.2.3 YARN的组件架构 70
  43. 3.2.4 MapReduce on YARN任务调度流程 73
  44. 3.2.5 YARN RM的HA方案 74
  45. 3.3 YARN的资源管理和任务调度 75
  46. 3.3.1 资源管理及分配模型 75
  47. 3.3.2 调度器的介绍 75
  48. 3.3.3 Capacity调度器的特点与管理 78
  49. 3.3.4 Fair调度器的特点与管理 82
  50. 3.3.5 Capacity调度器与Fair调度器的对比与选型 82
  51. 技能实训 83
  52. 实训3.1 YARN集群的部署 83
  53. 实训3.2 单词计数(WordCount)程序的编写 88
  54. 知识巩固 93
  55. 模块四 分布式NoSQL数据库HBase 94
  56. 4.1 HBase概述 94
  57. 4.1.1 HBase简介 94
  58. 4.1.2 HBase与RDB的对比 95
  59. 4.1.3 HBase的应用场景 95
  60. 4.1.4 行存储与列存储 96
  61. 4.1.5 Key-Value存储模型 97
  62. 4.2 HBase的架构 97
  63. 4.2.1 HBase架构介绍 97
  64. 4.2.2 Master 99
  65. 4.2.3 RegionServer 99
  66. 4.2.4 Region 100
  67. 4.2.5 ColumnFamily 102
  68. 4.2.6 各个组件之间的逻辑关系 103
  69. 4.3 HBase的关键流程 104
  70. 4.3.1 写流程 104
  71. 4.3.2 读流程 106
  72. 技能实训 106
  73. 实训4.1 HBase的安装与配置 106
  74. 实训4.2 HBase命令行之Shell操作 117
  75. 实训4.3 HBase的API操作 124
  76. 知识巩固 129
  77. 模块五 分布式数据仓库Hive 130
  78. 5.1 Hive概述 130
  79. 5.1.1 数据仓库的概念及特点 130
  80. 5.1.2 Hive的概念与HiveQL简介 131
  81. 5.1.3 Hive的应用场景 131
  82. 5.1.4 Hive与传统数据仓库比较 132
  83. 5.1.5 Hive的优缺点 133
  84. 5.2 Hive的架构原理 133
  85. 5.2.1 Hive的架构 133
  86. 5.2.2 Hive的存储模型与数据模型 134
  87. 5.2.3 Hive的存储格式 136
  88. 5.3 Hive的基本操作 138
  89. 5.4 HiveQL的应用 138
  90. 5.4.1 数据定义语言(DDL)讲解 138
  91. 5.4.2 数据操纵语言(DML)讲解 140
  92. 5.4.3 数据查询语言(DQL)讲解 140
  93. 技能实训 141
  94. 实训5.1 Hive的安装与部署 141
  95. 实训5.2 数据定义操作的具体实现 148
  96. 实训5.3 数据操纵操作的具体实现 158
  97. 实训5.4 查询操作的具体实现 165
  98. 知识巩固 171
  99. 模块六 Hadoop其他大数据生态组件 172
  100. 6.1 数据采集系统Flume 172