Eumenides-Z 2018-11-20 08:02 采纳率: 100%
浏览 1305
已结题

Spark中如何将多个LabeledPoint合并成一个LabeledPoint,用以训练分类模型

使用pyspark.mllib,对几个用textFile读取的RDD(a,b,c,d)打标签

    A = a.map(lambda features:LabeledPoint(0.0,features))
    B = b.map(lambda features:LabeledPoint(1.0,features))
    C = c.map(lambda features: LabeledPoint(2.0,features))
    D = d.map(lambda features:LabeledPoint(3.0,features))

现在如何将A,B,C,D四个整合成为一个训练数据集,或保存为LibSVMFile再读取,用来作为机器学习分类模型的训练数据集呢?
网上很多都是临时创建的LabeledPoint(label,Vectors.dense(features)),这样确实可以用一个变量表示。
但对于多个这样的要怎么合成一个变量表示呢,用union会出错。

     traindata = A.union(B)
    traindata = data.union(C)
    traindata = data.union(D)

或者

    traindata = A.union([B,C,D])

都会出错,包括《Spark快速大数据分析》书上源码试过,用union都不行。

     Traceback (most recent call last):
        File "/home/hadoop/Desktop/app.py", line 36, in <module>
            data = normalFea.union([icmpFea,synFea,udpFea])
        File "/opt/spark-2.3.2-bin-hadoop2.7/python/lib/pyspark.zip/pyspark/rdd.py", line 557, in union
    AttributeError: 'list' object has no attribute '_jrdd_deserializer'

这个报错是针对第二种的,第一种也会报错。求大神解答。。

  • 写回答

2条回答 默认 最新

  • devmiao 2018-11-20 14:59
    关注
    评论

报告相同问题?

悬赏问题

  • ¥15 数学的三元一次方程求解
  • ¥20 iqoo11 如何下载安装工程模式
  • ¥15 本题的答案是不是有问题
  • ¥15 关于#r语言#的问题:(svydesign)为什么在一个大的数据集中抽取了一个小数据集
  • ¥15 C++使用Gunplot
  • ¥15 这个电路是如何实现路灯控制器的,原理是什么,怎么求解灯亮起后熄灭的时间如图?
  • ¥15 matlab数字图像处理频率域滤波
  • ¥15 在abaqus做了二维正交切削模型,给刀具添加了超声振动条件后输出切削力为什么比普通切削增大这么多
  • ¥15 ELGamal和paillier计算效率谁快?
  • ¥15 蓝桥杯单片机第十三届第一场,整点继电器吸合,5s后断开出现了问题