Lazulitecn 2021-03-23 00:02 采纳率: 84.8%
浏览 230
已结题

Python re.findall怎么模糊多个词语然后匹配后获取到句子中的内容

 

需提取内容:

文章内容 = '''
            <td class="abcde:0:WW_11" style=";"><center>占位这是关键词A占位</center><td class="yyyyy:7:hh_45" style="white;"><center></center><td class="qwert:7:no_22" style=";"><nametext>需要提取的内容1</nametext>
          '''

          '''
            <td class="abcde:5:WW_11" style=";"><center>占位这是关键词A占位</center><td class="yyyyy:56:hh_87" style="white;"><center></center><td class="qwert:76:no_22" style=";"><nametext>需要提取的内容2</nametext>
          '''


          '''
            <td class="abcde:2:WW_11" style=";"><center></center><td class="yyyyy:6:hh_76" style="white;"><center></center><td class="qwert:7:no_22" style=";"><nametext>不需要内容1</nametext>
          '''
          '''
            <td class="abcde:3:WW_11" style=";"><center></center><center><span>其他内容关键词A其他内容</span></center><td class="yyyyy:6:hh_85" style="white;"><center></center><td class="qwert:9:no_22" style=";"><nametext>不需要内容2</nametext>
          '''


尝试多个 .*? 匹配出一堆不需要的   换成.* 匹配出来的又不对
''' :WW_11 .*? <center> .*? 关键词A .*? no_22 .*? <nametext> (.*?) </nametext> '''

 

 
  • 写回答

4条回答 默认 最新

  • 天际的海浪 2021-03-23 02:53
    关注

     

    import re
    
    text = '''
                <td class="abcde:0:WW_11" style=";"><center>占位这是关键词A占位</center><td class="yyyyy:7:hh_45" style="white;"><center></center><td class="qwert:7:no_22" style=";"><nametext>需要提取的内容1</nametext>
    
                <td class="abcde:5:WW_11" style=";"><center>占位这是关键词A占位</center><td class="yyyyy:56:hh_87" style="white;"><center></center><td class="qwert:76:no_22" style=";"><nametext>需要提取的内容2</nametext>
    
                <td class="abcde:2:WW_11" style=";"><center></center><td class="yyyyy:6:hh_76" style="white;"><center></center><td class="qwert:7:no_22" style=";"><nametext>不需要内容1</nametext>
    
                <td class="abcde:3:WW_11" style=";"><center></center><center><span>其他内容关键词A其他内容</span></center><td class="yyyyy:6:hh_85" style="white;"><center></center><td class="qwert:9:no_22" style=";"><nametext>不需要内容2</nametext>
              '''
    
    res = re.findall(r''':WW_11[^<>]*><center>(?:(?!</center>).)*?关键词A.*?no_22.*?<nametext>(.*?)</nametext>''',text)
    
    print(res)
    

    输出:['需要提取的内容1', '需要提取的内容2']

    本回答被题主选为最佳回答 , 对您是否有帮助呢?
    评论
查看更多回答(3条)

报告相同问题?

问题事件

  • 已结题 (查看结题原因) 8月6日

悬赏问题

  • ¥15 安卓adb backup备份应用数据失败
  • ¥15 eclipse运行项目时遇到的问题
  • ¥15 关于#c##的问题:最近需要用CAT工具Trados进行一些开发
  • ¥15 南大pa1 小游戏没有界面,并且报了如下错误,尝试过换显卡驱动,但是好像不行
  • ¥15 没有证书,nginx怎么反向代理到只能接受https的公网网站
  • ¥50 成都蓉城足球俱乐部小程序抢票
  • ¥15 yolov7训练自己的数据集
  • ¥15 esp8266与51单片机连接问题(标签-单片机|关键词-串口)(相关搜索:51单片机|单片机|测试代码)
  • ¥15 电力市场出清matlab yalmip kkt 双层优化问题
  • ¥30 ros小车路径规划实现不了,如何解决?(操作系统-ubuntu)