你好杰米 2018-06-20 09:59 采纳率: 87.5%
浏览 10252
已采纳

[HIVE]中的insert into操作为什么非常慢

例如如下语句

 insert into table1 partition(xxx=xxx) select * from table2

即使数据只有两三条,也要2分钟,这是为什么?

  • 写回答

3条回答 默认 最新

  • 书香门第 2018-06-21 01:54
    关注

    你可以这样查看hive的执行计划:

         > explain insert into t2 select value from t;
    OK
    Plan optimized by CBO.
    
    Stage-3
      Stats-Aggr Operator
        Stage-0
          Move Operator
            table:{"name:":"default.t2"}
            Stage-2
              Dependency Collection{}
                Stage-1
                  Map 1
                  File Output Operator [FS_2]
                    table:{"name:":"default.t2"}
                    Select Operator [SEL_1] (rows=3 width=1)
                      Output:["_col0"]
                      TableScan [TS_0] (rows=3 width=1)
                        default@t,t,Tbl:COMPLETE,Col:NONE,Output:["value"]
    
    

    Hive的执行要转化成若干步map-reduce的过程,而且可能要在多个节点间通信,所以即便很少的数据可能也是费了半天劲才执行出来的。就是说hive是为了处理大数据的,对于小数据的处理并不是优势。

    本回答被题主选为最佳回答 , 对您是否有帮助呢?
    评论
查看更多回答(2条)

报告相同问题?

悬赏问题

  • ¥15 运筹学中在线排序的时间在线排序的在线LPT算法
  • ¥30 求一段fortran代码用IVF编译运行的结果
  • ¥15 深度学习根据CNN网络模型,搭建BP模型并训练MNIST数据集
  • ¥15 lammps拉伸应力应变曲线分析
  • ¥15 C++ 头文件/宏冲突问题解决
  • ¥15 用comsol模拟大气湍流通过底部加热(温度不同)的腔体
  • ¥50 安卓adb backup备份子用户应用数据失败
  • ¥20 有人能用聚类分析帮我分析一下文本内容嘛
  • ¥15 请问Lammps做复合材料拉伸模拟,应力应变曲线问题
  • ¥30 python代码,帮调试,帮帮忙吧