Zeqiang Fang 方泽强

2019年12月17日 · 原文归档

大数据笔记

学术笔记

今天参加了奇安信的测试,对大数据的行业需求有了一定了解

Hbase Cell

行式数据库列式数据库
它适用于联机事务处理(OLTP)它适用于在线分析处理(OLAP
这样的数据库被设计为小数目的行和列面向列的数据库设计的巨大表

YARN

Apache Hadoop YARN (Yet Another Resource Negotiator,另一种资源协调者)是一种新的 Hadoop 资源管理器,它是一个通用资源管理系统,可为上层应用提供统一的资源管理和调度,它的引入为集群在利用率、资源统一管理和数据共享等方面带来了巨大好处。

YARN的基本思想是将JobTracker的两个主要功能(资源管理和作业调度/监控)分离,主要方法是创建一个全局的ResourceManager(RM)和若干个针对应用程序的ApplicationMaster(AM)。

MapReduce

MapReduce是一种编程模型,用于大规模数据集(大于1TB)的并行运算。

MapReduce是面向大数据并行处理的计算模型、框架和平台,它隐含了以下三层含义:

  1. MapReduce是一个基于集群的高性能并行计算平台(Cluster Infrastructure)。它允许用市场上普通的商用服务器构成一个包含数十、数百至数千个节点的分布和并行计算集群。
  2. MapReduce是一个并行计算与运行软件框架(Software Framework)。
  3. MapReduce是一个并行程序设计模型与方法(Programming Model & Methodology)。

Block VS Split

  1. 一个split不会包含零点几或者几点几个Block,一定是包含大于等于1个整数个Block
  2. 一个split不会包含两个File的Block,不会跨越File边界
  3. split和Block的关系是一对多的关系
  4. maptasks的个数最终决定于splits的长度