DV2 2016-06-04 08:25
浏览 1585
已结题

Spark RDD和HDFS数据一致性问题

这里想问个问题。

我用Spark SQL从HDFS load上来了一张表。
然后我现在有如下两种情况:

  1. 新增数据都是通过Spark SQL load进去的
    • 这时候我HDFS和RDD上面的数据是否一致
  2. 我数据是直接load到了HDFS上面(例如是个分区表,增加了一个分区)
    • 这时候我HDFS和RDD上面的数据是否一致

麻烦给出详细的原理过程或者参考链接

  • 写回答

0条回答

    报告相同问题?

    悬赏问题

    • ¥15 本题的答案是不是有问题
    • ¥15 关于#r语言#的问题:(svydesign)为什么在一个大的数据集中抽取了一个小数据集
    • ¥15 C++使用Gunplot
    • ¥15 这个电路是如何实现路灯控制器的,原理是什么,怎么求解灯亮起后熄灭的时间如图?
    • ¥15 matlab数字图像处理频率域滤波
    • ¥15 在abaqus做了二维正交切削模型,给刀具添加了超声振动条件后输出切削力为什么比普通切削增大这么多
    • ¥15 ELGamal和paillier计算效率谁快?
    • ¥15 蓝桥杯单片机第十三届第一场,整点继电器吸合,5s后断开出现了问题
    • ¥15 file converter 转换格式失败 报错 Error marking filters as finished,如何解决?
    • ¥15 Arcgis相交分析无法绘制一个或多个图形