最新公告
  • 欢迎您光临牛品源码网,本站秉承服务宗旨 履行“站长”责任,销售只是起点 服务永无止境!立即加入我们
  • Hadoop构建数据仓库实践

    资源名称:Hadoop构建数据仓库实践

    作者简介:

    王雪迎,毕业于中国地质大学计算机专业,高级工程师,拥有20年数据库、数据仓库相关技术经验。曾先后供职于北京现代商业信息技术有限公司、北京在线九州信息技术服务有限公司、华北计算技术研究所、北京优贝在线网络科技有限公司,担任DBA、数据架构师等职位。

    资源目录:

    第1章 数据仓库简介

    1.1 什么是数据仓库 1

    1.1.1 数据仓库的定义 1

    1.1.2 建立数据仓库的原因 3

    1.2 操作型系统与分析型系统 5

    1.2.1 操作型系统 5

    1.2.2 分析型系统 8

    1.2.3 操作型系统和分析型系统对比 9

    1.3 数据仓库架构 10

    1.3.1 基本架构 10

    1.3.2 主要数据仓库架构 12

    1.3.3 操作数据存储 16

    1.4 抽取-转换-装载 17

    1.4.1 数据抽取 17

    1.4.2 数据转换 19

    1.4.3 数据装载 20

    1.4.4 开发ETL系统的方法 21

    1.4.5 常见ETL工具 21

    1.5 数据仓库需求 22

    1.5.1 基本需求 22

    1.5.2 数据需求 23

    1.6 小结 24

    第2章 数据仓库设计基础

    2.1 关系数据模型 25

    2.1.1 关系数据模型中的结构 25

    2.1.2 关系完整性 28

    2.1.3 规范化 30

    2.1.4 关系数据模型与数据仓库 33

    2.2 维度数据模型 34

    2.2.1 维度数据模型建模过程 35

    2.2.2 维度规范化 36

    2.2.3 维度数据模型的特点 37

    2.2.4 星型模式 38

    2.2.5 雪花模式 40

    2.3 Data Vault模型 42

    2.3.1 Data Vault模型简介 42

    2.3.2 Data Vault模型的组成部分 43

    2.3.3 Data Vault模型的特点 44

    2.3.4 Data Vault模型的构建 44

    2.3.5 Data Vault模型实例 46

    2.4 数据集市 49

    2.4.1 数据集市的概念 50

    2.4.2 数据集市与数据仓库的区别 50

    2.4.3 数据集市设计 50

    2.5 数据仓库实施步骤 51

    2.6 小结 54

    第3章 Hadoop生态圈与数据仓库

    3.1 大数据定义 55

    3.2 Hadoop简介 56

    3.2.1 Hadoop的构成 57

    3.2.2 Hadoop的主要特点 58

    3.2.3 Hadoop架构 58

    3.3 Hadoop基本组件 59

    3.3.1 HDFS 60

    3.3.2 MapReduce 65

    3.3.3 YARN 72

    3.4 Hadoop生态圈的其他组件 77

    3.5 Hadoop与数据仓库 81

    3.5.1 关系数据库的可扩展性瓶颈 82

    3.5.2 CAP理论 84

    3.5.3 Hadoop数据仓库工具 85

    3.6 小结 88

    第4章 安装Hadoop

    4.1 Hadoop主要发行版本 89

    4.1.1 Cloudera Distribution for Hadoop(CDH) 89

    4.1.2 Hortonworks Data Platform(HDP) 90

    4.1.3 MapR Hadoop 90

    4.2 安装Apache Hadoop 91

    4.2.1 安装环境 91

    4.2.2 安装前准备 92

    4.2.3 安装配置Hadoop 93

    4.2.4 安装后配置 97

    4.2.5 初始化及运行 97

    4.3 配置HDFS Federation 99

    4.4 离线安装CDH及其所需的服务 104

    4.4.1 CDH安装概述 104

    4.4.2 安装环境 106

    4.4.3 安装配置 106

    4.4.4 Cloudera Manager许可证管理 114

    4.5 小结 115

    第5章 Kettle与Hadoop

    5.1 Kettle概述 117

    5.2 Kettle连接Hadoop 119

    5.2.1 连接HDFS 119

    5.2.2 连接Hive 124

    5.3 导出导入Hadoop集群数据 128

    5.3.1 把数据从HDFS抽取到RDBMS 128

    5.3.2 向Hive表导入数据 132

    5.4 执行Hive的HiveQL语句 134

    5.5 MapReduce转换示例 135

    5.6 Kettle提交Spark作业 143

    5.6.1 安装Spark 143

    5.6.2 配置Kettle向Spark集群提交作业 146

    5.7 小结 149

    第6章 建立数据仓库示例模型

    6.1 业务场景 150

    6.2 Hive相关配置 152

    6.2.1 选择文件格式 152

    6.2.2 支持行级更新 159

    6.2.3 Hive事务支持的限制 164

    6.3 Hive表分类 164

    6.4 向Hive表装载数据 169

    6.5 建立数据库表 174

    6.6 装载日期维度数据 179

    6.7 小结 180

    第7章 数据抽取

    7.1 逻辑数据映射 182

    7.2 数据抽取方式 185

    7.3 导出成文本文件 191

    7.4 分布式查询 196

    7.5 使用Sqoop抽取数据 200

    7.5.1 Sqoop简介 200

    7.5.2 CDH 5.7.0中的Sqoop 203

    7.5.3 使用Sqoop抽取数据 203

    7.5.4 Sqoop优化 207

    7.6 小结 208

    第8章 数据转换与装载

    8.1 数据清洗 210

    8.2 Hive简介 214

    8.2.1 Hive的体系结构 215

    8.2.2 Hive的工作流程 216

    8.2.3 Hive服务器 218

    8.2.4 Hive客户端 221

    8.3 初始装载 231

    8.4 定期装载 236

    8.5 Hive优化 246

    8.6 小结 254

    第9章 定期自动执行ETL作业

    9.1 crontab 256

    9.2 Oozie简介 260

    9.2.1 Oozie的体系结构 260

    9.2.2 CDH 5.7.0中的Oozie 262

    9.3 建立定期装载工作流 262

    9.4 建立协调器作业定期自动执行工作流 271

    9.5 Oozie优化 275

    9.6 小结 276

    第10章 维度表技术

    10.1 增加列 278

    10.2 维度子集 285

    10.3 角色扮演维度 292

    10.4 层次维度 298

    10.4.1 固定深度的层次 299

    10.4.2 递归 302

    10.4.3 多路径层次 310

    10.4.4 参差不齐的层次 312

    10.5 退化维度 313

    10.6 杂项维度 316

    10.7 维度合并 323

    10.8 分段维度 329

    10.9 小结 335

    第11章 事实表技术

    11.1 事实表概述 336

    11.2 周期快照 337

    11.3 累积快照 343

    11.4 无事实的事实表 349

    11.5 迟到的事实 354

    11.6 累积度量 360

    11.7 小结 366

    第12章 联机分析处理

    12.1 联机分析处理简介 367

    12.1.1 概念 367

    12.1.2 分类 368

    12.1.3 性能 371

    12.2 Impala简介 371

    12.3 Hive、SparkSQL、Impala比较 377

    12.3.1 Spark SQL简介 377

    12.3.2 Hive、Spark SQL、Impala比较 379

    12.3.3 Hive、Spark SQL、Impala性能对比 382

    12.4 联机分析处理实例 387

    12.5 Apache Kylin与OLAP 399

    12.5.1 Apache Kylin架构 399

    12.5.2 Apache Kylin安装 401

    12.6 小结 407

    第13章 数据可视化

    13.1 数据可视化简介 408

    13.2 Hue简介 410

    13.2.1 Hue功能快速预览 411

    13.2.2 配置元数据存储 412

    13.3 Zeppelin简介 415

    13.3.1 Zeppelin架构 415

    13.3.2 Zeppelin安装配置 416

    13.3.3 在Zeppelin中添加MySQL翻译器 421

    13.4 Hue、Zeppelin比较 425

    13.5 数据可视化实例 426

    13.6 小结 434

    资源截图:

    1.png

    RIPRO主题是一个优秀的主题,极致后台体验,无插件,集成会员系统
    牛品源码 » Hadoop构建数据仓库实践

    常见问题FAQ

    免费下载或者VIP会员专享资源能否直接商用?
    本站所有资源版权均属于原作者所有,这里所提供资源均只能用于参考学习用,请勿直接商用。若由于商用引起版权纠纷,一切责任均由使用者承担。更多说明请参考 VIP介绍。
    提示下载完但解压或打开不了?
    最常见的情况是下载不完整: 可对比下载完压缩包的与网盘上的容量,若小于网盘提示的容量则是这个原因。这是浏览器下载的bug,建议用百度网盘软件或迅雷下载。若排除这种情况,可在对应资源底部留言,或 联络我们.。
    找不到素材资源介绍文章里的示例图片?
    对于PPT,KEY,Mockups,APP,网页模版等类型的素材,文章内用于介绍的图片通常并不包含在对应可供下载素材包内。这些相关商业图片需另外购买,且本站不负责(也没有办法)找到出处。 同样地一些字体文件也是这种情况,但部分素材会在素材包内有一份字体下载链接清单。
    站壳网
    一个高级程序员模板开发平台

    发表评论

    • 264会员总数(位)
    • 66769资源总数(个)
    • 1本周发布(个)
    • 0 今日发布(个)
    • 1859稳定运行(天)

    提供最优质的资源集合

    立即查看 了解详情