Eumenides-Z 2018-11-19 09:05 采纳率: 100%
浏览 2119
已采纳

如何将spark读入的txtRDD文本转为Vector格式

在spark上使用textFile读入HDFS中的txt文件,该文件部分如下:

    49420 1383788 0.000020 358064278.750527 0 0.000000
    48896 1369116 0.000020 357927226.401787 0 0.000000
    49412 1383564 0.000020 357979014.993087 0 0.000000
    49284 1379980 0.000020 357811734.328588 0 0.000000
    48666 1362676 0.000021 357741524.933751 0 0.000000
    49726 1392356 0.000020 357853612.975128 0 0.000000
    49546 1387316 0.000020 358326789.510850 0 0.000000
    48781 1365896 0.000020 357718866.216985 0 0.000000
    36848 1031772 0.000027 357027433.127875 0 0.000000
    49537 1387064 0.000020 358307459.890310 0 0.000000
    49146 1376116 0.000020 358291449.233641 0 0.000000
    49952 1398684 0.000020 357755490.896889 0 0.000000

为六列整型或浮点型数值,将每一行作为一个样本进行分类机器学习的特征向量。
该文件准备打同一标签,但还未打标签。
textFile读入之后只是返回一个字符串RDD,请问如何将其转换为Mllib支持处理的Vector或分类算法直接支持的LabeledPoint格式呢?最好用python吧。

  • 写回答

1条回答

  • devmiao 2018-11-19 12:48
    关注
    本回答被题主选为最佳回答 , 对您是否有帮助呢?
    评论

报告相同问题?

悬赏问题

  • ¥15 seatunnel-web使用SQL组件时候后台报错,无法找到表格
  • ¥15 fpga自动售货机数码管(相关搜索:数字时钟)
  • ¥15 用前端向数据库插入数据,通过debug发现数据能走到后端,但是放行之后就会提示错误
  • ¥30 3天&7天&&15天&销量如何统计同一行
  • ¥30 帮我写一段可以读取LD2450数据并计算距离的Arduino代码
  • ¥15 飞机曲面部件如机翼,壁板等具体的孔位模型
  • ¥15 vs2019中数据导出问题
  • ¥20 云服务Linux系统TCP-MSS值修改?
  • ¥20 关于#单片机#的问题:项目:使用模拟iic与ov2640通讯环境:F407问题:读取的ID号总是0xff,自己调了调发现在读从机数据时,SDA线上并未有信号变化(语言-c语言)
  • ¥20 怎么在stm32门禁成品上增加查询记录功能