hbase表命令 hbase 表

转载

编程小达人之心 2023-08-30 16:52:04

文章标签 hbase表命令数据 HDFS 文件系统 文章分类 Hbase 数据库

文章目录

Hbase的基本介绍
Hbase的特点

1、海量存储
2、列式存储
3、极易扩展
4、高并发
5、稀疏

Hbase表的特点
Hbase的适用场景
Hbase和Hadoop之间的关系

HDFS
HBASE

RDBMS(关系型数据库)与HBase的对比

RDBMS
HBASE

HBase 的组成

1. Client
2.Zookeeper
3.HMaster
4.RegionServer
5. 组件：

Hbase的基本介绍

简介:

hbase是bigtable的开源java版本。是建立在hdfs之上，提供高可靠性、高性能、列存储、可伸缩、实时读写nosql的数据库系统。它介于nosql和RDBMS之间，仅能通过主键(row key)和主键的range来检索数据，仅支持单行事务(可通过hive支持来实现多表join等复杂操作)。

支持的数据类型: byte[]

扩展性: 横向扩展

Hbase的特点

1、海量存储

Hbase适合存储PB级别的海量数据，在几十到百毫秒内返回数据。

2、列式存储

这里的列式存储其实说的是列族存储列族理论上可以很多，但实际上建议不要超过6个

3、极易扩展

处理能力（RegionServer）的扩展，一个是基于存储的扩展（HDFS）hbase在最初设计的时候就考虑了扩展性。

4、高并发

这里说的高并发，主要是在并发的情况下，Hbase的单个IO延迟下降并不多

5、稀疏

在列数据为空的情况下，是不会占用存储空间的。

Hbase表的特点

大: 一个表可以有上十亿行，上百万列
面向列: 面向列(族)的存储和权限控制，列(族)独立检索。
稀疏: 对于为空(null)的列，并不占用存储空间，因此，表可以设计的非常稀疏。

传统的表与Hbase表的对比:

hbase表命令 hbase 表_文件系统

Hbase的适用场景

1.海量数据:指的是数据量的背景	 例如: 全国的身份证号 
2.精确查询:业务场景   例如: 查询某一个人的身份证.
3.快速返回:是业务对时效性的要求   例如: 上网时刷生身份证号,要求快速读取.

Hbase和Hadoop之间的关系

HDFS

为分布式存储提供文件系统
针对存储大尺寸的文件进行优化，不适用对HDFS上的文件进行随机读写
直接使用文件
数据模型不灵活
使用文件系统和处理框架
优化一次写入，多次读取的方式

HBASE

提供表状的面向列的数据存储
针对表状数据的随机读写进行优化
使用key-value操作数据
提供灵活的数据模型
使用表状存储，支持MapReduce，依赖HDFS
优化了多次读，以及多次写

RDBMS(关系型数据库)与HBase的对比

RDBMS

结构：

1.数据库以表的形式存在
2.支持FAT、NTFS、EXT、文件系统
3.使用Commit log存储日志
4.参考系统是坐标系统
5.使用主键（PK）
6.支持分区
7.使用行、列、单元格

功能：

1.支持向上扩展
2.使用SQL查询
3.面向行，即每一行都是一个连续单元
4.数据总量依赖于服务器配置
5.具有ACID支持
6.适合结构化数据
7.传统关系型数据库一般都是中心化的
8.支持事务
9.支持Join

HBASE

结构：

1.数据库以region的形式存在
2.支持HDFS文件系统
3.使用WAL（Write-Ahead Logs）存储日志
4.参考系统是Zookeeper
5.使用行键（row key）
6.支持分片
7.使用行、列、列族和单元格

功能：

1.支持向外扩展
2.使用API和MapReduce来访问HBase表数据
3.面向列，即每一列都是一个连续的单元
4.数据总量不依赖具体某台机器，而取决于机器数量
5.HBase不支持ACID（Atomicity、Consistency、Isolation、Durability原子性、一致性、隔离性、耐久性）
6.适合结构化数据和非结构化数据
7.一般都是分布式的
8.HBase不支持事务
9.不支持SQL
10.不支持Join

HBase 的组成

1. Client

访问数据的入口，包含访问hbase的API接口,维护着一些cache来加快对hbase的访问

2.Zookeeper

1.zookeeper的选举机制保证任何时候，集群中只有一个master
2.实时监控Region Server的状态，将Region server的上线和下线信息实时通知给Master
3.存储Hbase的schema,
4.存贮所有Region的寻址入口

3.HMaster

功能：

监控RegionServer
处理RegionServer故障转移
处理元数据的变更
处理region的分配或移除
在空闲时间进行数据的负载均衡
通过Zookeeper发布自己的位置给客户端

说明：Hmaster短时间下线，hbase集群依然可用，长时间不行。

4.RegionServer

功能：

负责存储HBase的实际数据
处理分配给它的Region
刷新缓存到HDFS
维护HLog
执行压缩
负责处理Region分片

5. 组件：

Write-Ahead logs

HBase的修改记录，当对HBase读写数据的时候，数据不是直接写进磁盘，它会在内存中保留一段时间（时间以及数据量阈值可以设定）。但把数据保存在内存中可能有更高的概率引起数据丢失，为了解决这个问题，数据会先写在一个叫做Write-Ahead logfile的文件中，然后再写入内存中。所以在系统出现故障的时候，数据可以通过这个日志文件重建。