xiaolin_wxl 2018-09-11 10:53 采纳率: 100%
浏览 1824
已采纳

关于spark离线程序读写本地文件的问题

我目前在学着写spark离线程序,用Java写的
目前我要做的是:在java代码里读取服务器上的/root/config.properties配置文件,
然后我处理完之后会生成一个文件file.txt,我希望将这个file.txt也放到该服务器的特定目录下。
目前我读取配置文件的做法是:先将config.properties上传到hdfs,
然后java代码中写prop.load("hdfs:///root/config.properties");
这样是可以达到效果的,但事实上我不可能每次都手动将配置文件放一下hdfs。
生成的文件在哪目前我还没测试。。。
请大佬指点下这个需要怎么做。包括java代码里和sh脚本里。谢谢。
大佬给代码的时候请详细点,因为不会,能顺带加点注释就最好了。
我测试能用的话保证立马采纳。
环境是jdk1.8和spark2.2,linux系统

  • 写回答

4条回答 默认 最新

  • sf_www 2018-09-12 07:34
    关注

    读取数据文件的接口不是有SparkContext的textFile么,读取本地文件只是需要指明file://即可(但是要保证所有节点本地上都有该文件,路径一致),
    所以一般不会去读取本地的数据文件,而是读取hdfs文件。对于你说的是不是想要加载自己的配置文件,一种是直接打包到jar中去,一种是加载
    本地配置文件的话,可以使用SparkContext的addFile接口,然后获取时使用SparkFiles.get()接口即可获取到

    本回答被题主选为最佳回答 , 对您是否有帮助呢?
    评论
查看更多回答(3条)

报告相同问题?

悬赏问题

  • ¥15 乘性高斯噪声在深度学习网络中的应用
  • ¥15 运筹学排序问题中的在线排序
  • ¥15 关于docker部署flink集成hadoop的yarn,请教个问题 flink启动yarn-session.sh连不上hadoop,这个整了好几天一直不行,求帮忙看一下怎么解决
  • ¥30 求一段fortran代码用IVF编译运行的结果
  • ¥15 深度学习根据CNN网络模型,搭建BP模型并训练MNIST数据集
  • ¥15 C++ 头文件/宏冲突问题解决
  • ¥15 用comsol模拟大气湍流通过底部加热(温度不同)的腔体
  • ¥50 安卓adb backup备份子用户应用数据失败
  • ¥20 有人能用聚类分析帮我分析一下文本内容嘛
  • ¥30 python代码,帮调试,帮帮忙吧