rx1782 2021-06-01 18:22 采纳率: 100%
浏览 456
已结题

爬虫去掉多余的空格和标点符号,只想要文本信息怎么处理?

一楼带院子的  面积大 毛坯房 融合家园 下跃式的 看房方便
['4', '室', '2', '厅', '2', '卫']
['\n                            208㎡\n                        ', '南北', '\n                            低层(共11层)\n                        ', '\n                            2019年建造\n                        ']
['\n                            208㎡\n                        ']
['南北']

title = div.xpath('.//div[@class="property-content-title"]/h3/text()')[0]
print(title)

housetype = div.xpath('.//div[@class="property-content-info"]/p/span/text()')
print(housetype)

area = div.xpath('.//p[@class="property-content-info-text"]/text()')
print(area)


['\n                            低层(共11层)\n                        ']
['融合家园']
['95']
['4568元/㎡']
 

 

想去掉[]、''、多余的空格。就像第一排的只带文本信息

  • 写回答

5条回答 默认 最新

  • 关注

     代码如下:{如果对你有帮助,可以给我个采纳吗,谢谢!! 点击我这个回答右上方的【采纳】按钮}。

    li1 =  ['4', '室', '2', '厅', '2', '卫']
    li2 = ['\n                            208㎡\n                        ', '南北', '\n                            低层(共11层)\n                        ', '\n                            2019年建造\n                        ']
    s1 = "".join(map(lambda x: x.strip(),li1))
    print(s1)
    s2 = " ".join(map(lambda x: x.strip(),li2))
    print(s2)
    

    本回答被题主选为最佳回答 , 对您是否有帮助呢?
    评论
    1人已打赏
查看更多回答(4条)

报告相同问题?

问题事件

  • 系统已结题 8月18日
  • 已采纳回答 8月10日

悬赏问题

  • ¥15 虚幻5 UE美术毛发渲染
  • ¥15 CVRP 图论 物流运输优化
  • ¥15 Tableau online 嵌入ppt失败
  • ¥100 支付宝网页转账系统不识别账号
  • ¥15 基于单片机的靶位控制系统
  • ¥15 真我手机蓝牙传输进度消息被关闭了,怎么打开?(关键词-消息通知)
  • ¥15 装 pytorch 的时候出了好多问题,遇到这种情况怎么处理?
  • ¥20 IOS游览器某宝手机网页版自动立即购买JavaScript脚本
  • ¥15 手机接入宽带网线,如何释放宽带全部速度
  • ¥30 关于#r语言#的问题:如何对R语言中mfgarch包中构建的garch-midas模型进行样本内长期波动率预测和样本外长期波动率预测