rx1782 2021-06-01 18:22 采纳率: 100%
浏览 455
已结题

爬虫去掉多余的空格和标点符号,只想要文本信息怎么处理?

一楼带院子的  面积大 毛坯房 融合家园 下跃式的 看房方便
['4', '室', '2', '厅', '2', '卫']
['\n                            208㎡\n                        ', '南北', '\n                            低层(共11层)\n                        ', '\n                            2019年建造\n                        ']
['\n                            208㎡\n                        ']
['南北']

title = div.xpath('.//div[@class="property-content-title"]/h3/text()')[0]
print(title)

housetype = div.xpath('.//div[@class="property-content-info"]/p/span/text()')
print(housetype)

area = div.xpath('.//p[@class="property-content-info-text"]/text()')
print(area)


['\n                            低层(共11层)\n                        ']
['融合家园']
['95']
['4568元/㎡']
 

 

想去掉[]、''、多余的空格。就像第一排的只带文本信息

  • 写回答

5条回答 默认 最新

  • 关注

     代码如下:{如果对你有帮助,可以给我个采纳吗,谢谢!! 点击我这个回答右上方的【采纳】按钮}。

    li1 =  ['4', '室', '2', '厅', '2', '卫']
    li2 = ['\n                            208㎡\n                        ', '南北', '\n                            低层(共11层)\n                        ', '\n                            2019年建造\n                        ']
    s1 = "".join(map(lambda x: x.strip(),li1))
    print(s1)
    s2 = " ".join(map(lambda x: x.strip(),li2))
    print(s2)
    

    本回答被题主选为最佳回答 , 对您是否有帮助呢?
    评论
    1人已打赏
查看更多回答(4条)

报告相同问题?

问题事件

  • 系统已结题 8月18日
  • 已采纳回答 8月10日

悬赏问题

  • ¥20 有关区间dp的问题求解
  • ¥15 多电路系统共用电源的串扰问题
  • ¥15 slam rangenet++配置
  • ¥15 有没有研究水声通信方面的帮我改俩matlab代码
  • ¥15 对于相关问题的求解与代码
  • ¥15 ubuntu子系统密码忘记
  • ¥15 信号傅里叶变换在matlab上遇到的小问题请求帮助
  • ¥15 保护模式-系统加载-段寄存器
  • ¥15 电脑桌面设定一个区域禁止鼠标操作
  • ¥15 求NPF226060磁芯的详细资料