StanSongg 2021-12-07 08:48 采纳率: 85.7%
浏览 27
已结题

python正则表达式怎么提取下面所示的内容?

img

如图所示,这个div中间夹着的这段英文句子怎么提取出来?要剔除所有的换货和缩进。

谢谢各位

  • 写回答

1条回答 默认 最新

  • 菜猫小六 2021-12-07 10:24
    关注

    原网页完全可以使用xlml之类的把字符串的源码转换为Element对象,然后用xpath之类的去解析,大概的代码应该是:

    _ = etree.HTML(text)
    data_list = _.xpath("//div[@class='primary-head']")
    for data in data_list:
      text = data.xpath("./text()")[0].replace('\r','').replace('\n','').strip()  # 这边replace,strip是去掉换行空格之类的
    

    单单用正则,代码为:

    text = re.findall("style=\"\">([\s\S]*)<\/div>",sss)[0].replace('\r','').replace('\n','').strip()
    print text
    
    本回答被题主选为最佳回答 , 对您是否有帮助呢?
    评论

报告相同问题?

问题事件

  • 系统已结题 12月15日
  • 已采纳回答 12月7日
  • 修改了问题 12月7日
  • 创建了问题 12月7日

悬赏问题

  • ¥15 安卓13,动态广播无法接受
  • ¥50 docker运行容器端口如何映射(不重启服务、不重建容器)
  • ¥50 基于TwinCAT3实现力传感器的实时读取
  • ¥20 python求解八元一次不定方程,无数解中随机输出几组即可(相关搜索:用python)
  • ¥50 libreoffice导出PPTX到PDF中的错误换行问题
  • ¥15 python实现网页视频下载
  • ¥15 如何通过深度图获得物体的完整、正确点云?
  • ¥15 有没有操作系统适用白丁的经典的书籍,如何解决?(标签-学习)
  • ¥15 Catia V5 R20 64位 安装过程中选择orbix配置创建套接字失败
  • ¥100 C51单片机设计交通灯时出现的问题