zhenghailong888 2018-01-16 08:25 采纳率: 50%
浏览 1519
已采纳

大量单条数据使用spark效率高吗?

比如 我有 1亿条 汉字句子,需要生成哈希码,但是这些句子不能组成list,只能单条一条一条的生成哈希码,这样使用spark,会提升效率吗?这种应用场景,应该怎么使用spark?

  • 写回答

1条回答 默认 最新

  • 潇潇雨已歇 2018-01-16 09:25
    关注

    确认几个事情:
    1)数据在哪 spark能不能分布式访问 比如HDFS 就OK
    2)你的spark集群有多大 如果只有一两个节点 其实和跑多个线程并行计算没多大区别
    3)不理解只能单条生成的含义 spark DataFrame 本来就是面向Row的 生成哈希吗 map 一下就完了 可以写回HDFS

    本回答被题主选为最佳回答 , 对您是否有帮助呢?
    评论

报告相同问题?

问题事件

  • 已采纳回答 1月12日