Lazulitecn 2021-03-23 00:02 采纳率: 84.8%
浏览 231
已结题

Python re.findall怎么模糊多个词语然后匹配后获取到句子中的内容

 

需提取内容:

文章内容 = '''
            <td class="abcde:0:WW_11" style=";"><center>占位这是关键词A占位</center><td class="yyyyy:7:hh_45" style="white;"><center></center><td class="qwert:7:no_22" style=";"><nametext>需要提取的内容1</nametext>
          '''

          '''
            <td class="abcde:5:WW_11" style=";"><center>占位这是关键词A占位</center><td class="yyyyy:56:hh_87" style="white;"><center></center><td class="qwert:76:no_22" style=";"><nametext>需要提取的内容2</nametext>
          '''


          '''
            <td class="abcde:2:WW_11" style=";"><center></center><td class="yyyyy:6:hh_76" style="white;"><center></center><td class="qwert:7:no_22" style=";"><nametext>不需要内容1</nametext>
          '''
          '''
            <td class="abcde:3:WW_11" style=";"><center></center><center><span>其他内容关键词A其他内容</span></center><td class="yyyyy:6:hh_85" style="white;"><center></center><td class="qwert:9:no_22" style=";"><nametext>不需要内容2</nametext>
          '''


尝试多个 .*? 匹配出一堆不需要的   换成.* 匹配出来的又不对
''' :WW_11 .*? <center> .*? 关键词A .*? no_22 .*? <nametext> (.*?) </nametext> '''

 

 
  • 写回答

4条回答 默认 最新

  • 天际的海浪 2021-03-23 02:53
    关注

     

    import re
    
    text = '''
                <td class="abcde:0:WW_11" style=";"><center>占位这是关键词A占位</center><td class="yyyyy:7:hh_45" style="white;"><center></center><td class="qwert:7:no_22" style=";"><nametext>需要提取的内容1</nametext>
    
                <td class="abcde:5:WW_11" style=";"><center>占位这是关键词A占位</center><td class="yyyyy:56:hh_87" style="white;"><center></center><td class="qwert:76:no_22" style=";"><nametext>需要提取的内容2</nametext>
    
                <td class="abcde:2:WW_11" style=";"><center></center><td class="yyyyy:6:hh_76" style="white;"><center></center><td class="qwert:7:no_22" style=";"><nametext>不需要内容1</nametext>
    
                <td class="abcde:3:WW_11" style=";"><center></center><center><span>其他内容关键词A其他内容</span></center><td class="yyyyy:6:hh_85" style="white;"><center></center><td class="qwert:9:no_22" style=";"><nametext>不需要内容2</nametext>
              '''
    
    res = re.findall(r''':WW_11[^<>]*><center>(?:(?!</center>).)*?关键词A.*?no_22.*?<nametext>(.*?)</nametext>''',text)
    
    print(res)
    

    输出:['需要提取的内容1', '需要提取的内容2']

    本回答被题主选为最佳回答 , 对您是否有帮助呢?
    评论
查看更多回答(3条)

报告相同问题?

问题事件

  • 已结题 (查看结题原因) 8月6日

悬赏问题

  • ¥100 有偿,谁有移远的EC200S固件和最新的Qflsh工具。
  • ¥15 找一个QT页面+目标识别(行人检测)的开源项目
  • ¥15 有没有整苹果智能分拣线上图像数据
  • ¥20 有没有人会这个东西的
  • ¥15 cfx考虑调整“enforce system memory limit”参数的设置
  • ¥30 航迹分离,航迹增强,误差分析
  • ¥15 Chrome Manifest扩展引用Ajax-hook库拦截请求失败
  • ¥15 用Ros中的Topic通讯方式控制小乌龟的速度,走矩形;编写订阅器代码
  • ¥15 LLM accuracy检测
  • ¥15 pycharm添加远程解释器报错