[Hive]建表实例与参数解释——自定义表的存储格式(textfile、sequencefile、refile)

一、建表实例

create external table `beatles_bi_dm.driver_butie_order_info`(
    `drive_license_number`    bigint   COMMENT '1',
    `drive_num`               bigint   COMMENT '2',
    `order_num`               bigint   COMMENT '3',
    `coupon_num`              bigint   COMMENT '4',
    `passenger_num`           bigint   COMMENT '5',
    `total_coupon_amount`     bigint   COMMENT '6'
    )
COMMENT '表描述'
PARTITIONED BY (
    `event_day` string)
ROW FORMAT DELIMITED FIELDS TERMINATED BY '\t'
STORED AS orcfile
TBLPROPERTIES('creater'='me') --按键值对的格式为表增加额外的文档说明

二、表的存储格式

1、textfile

默认格式;

存储方式为行存储;

磁盘开销大 数据解析开销大;

但使用这种方式,hive不会对数据进行切分,从而无法对数据进行并行操作。

2、sequencefile

二进制文件,以<key,value>的形式序列化到文件中;
存储方式:行存储;
可分割 压缩;
一般选择block压缩;
优势是文件和Hadoop api中的mapfile是相互兼容的

3、refile

存储方式:数据按行分块 每块按照列存储;
压缩快 快速列存取;
读记录尽量涉及到的block最少;
读取需要的列只需要读取每个row group 的头部定义;
读取全量数据的操作 性能可能比sequencefile没有明显的优势,

4、orcfile

存储方式:数据按行分块 每块按照列存储;

压缩快 快速列存取;

效率比rcfile高,是rcfile的改良版本。

猜你喜欢

转载自blog.csdn.net/TOMOCAT/article/details/81673154