rpmdeb 2019-08-06 11:44 采纳率: 0%
浏览 356

hive表合并文件与预期不一致?没有分割为128M的文件

外建表 test7 数据放在  /nginx/log4 
 ~# hadoop fs -du -s -h /nginx/log4/*
58.5 M  175.4 M  /nginx/log4/000000_0.gz
58.5 M  175.4 M  /nginx/log4/000000_1.gz
58.5 M  175.4 M  /nginx/log4/000000_2.gz
58.5 M  175.4 M  /nginx/log4/000000_3.gz

想法是,把这些文件合并压缩为128M大小的文件,减少文件数量,
运算后,应该生成两个文件 128M + 106M

# hive 表执行
set hive.exec.compress.output=true;  
set mapred.output.compress=true;  
set mapred.output.compression.codec=org.apache.hadoop.io.compress.GzipCodec;  
set io.compression.codecs=org.apache.hadoop.io.compress.GzipCodec;  
set hive.merge.size.per.task=134217728;
set mapred.max.split.size=134217728;

create table test8 as select * from test7;
生成的test8 的数据目录在 /hive/test8

 ~#  hadoop fs -du -s -h /hive/test8/*
116.2 M  348.5 M  /hive/test8/000000_0.gz
58.1 M  174.2 M  /hive/test8/000001_0.gz
58.1 M  174.2 M  /hive/test8/000002_0.gz

问题来了,为什么没有按照预想的那样,合并成128M 的gz文件和 100多M的gz文件?

  • 写回答

1条回答 默认 最新

  • CSDN-Ada助手 CSDN-AI 官方账号 2022-09-21 01:56
    关注
    不知道你这个问题是否已经解决, 如果还没有解决的话:

    如果你已经解决了该问题, 非常希望你能够分享一下解决方案, 写成博客, 将相关链接放在评论区, 以帮助更多的人 ^-^
    评论

报告相同问题?

悬赏问题

  • ¥15 数学的三元一次方程求解
  • ¥20 iqoo11 如何下载安装工程模式
  • ¥15 本题的答案是不是有问题
  • ¥15 关于#r语言#的问题:(svydesign)为什么在一个大的数据集中抽取了一个小数据集
  • ¥15 C++使用Gunplot
  • ¥15 这个电路是如何实现路灯控制器的,原理是什么,怎么求解灯亮起后熄灭的时间如图?
  • ¥15 matlab数字图像处理频率域滤波
  • ¥15 在abaqus做了二维正交切削模型,给刀具添加了超声振动条件后输出切削力为什么比普通切削增大这么多
  • ¥15 ELGamal和paillier计算效率谁快?
  • ¥15 蓝桥杯单片机第十三届第一场,整点继电器吸合,5s后断开出现了问题