千禧小白 2020-09-29 22:54 采纳率: 25%
浏览 440
已采纳

python爬虫正则表达式re.findall只能获取众多链接中的一个

想要抓取所发表情里面的所有热门表情的名字和图片链接,但是只能抓取到第一个,如果删掉<div.+?indexbiaoqing.+? 则会返回其他模块表情包(能返回很多链接,但不是我想要的,仔细对照改了改还是不对),希望大佬指点

上代码

from urllib import request
import requests
import re
import time
import os
def main():
    page_url = 'https://www.fabiaoqing.com/'
    headers = {
        'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/85.0.4183.121 Safari/537.36',
        'Cookie': 'PHPSESSID=595p4sic6t2omtl4fod2crj6kt; BAIDU_SSP_lcr=https://www.baidu.com/link?url=oDQDHox9F2MtoMApyh8BoSFQVz_d798fE1MSPPIeCiBbk0_0UksqN0_zvFvDfXoV&wd=&eqid=f372be560001f38e000000025f7315a9; __gads=ID=9b8c836a8fe9b3a1:T=1601385527:S=ALNI_Mavb6ihzHHKTZjw8P1TNcjakvzHrA; UM_distinctid=174da03f66d3fd-000604be2b9b57-333376b-100200-174da03f66e2e3; CNZZDATA1260546685=1101262114-1601380731-https%253A%252F%252Fwww.baidu.com%252F%7C1601380731'}
    resp = requests.get(page_url, headers=headers)
    text = resp.text
    image_urls = re.findall(r' <div.+?indexbiaoqing.+?<div.+?bqppdiv.+?<a.+?data-original="(.+?)".+?>', text, re.VERBOSE | re.DOTALL)[0]  # re.DOTALL表示小圆点也可以表示换行
    print(image_urls)
    names = re.findall(r'<div.+?indexbiaoqing.+?<div.+?bqppdiv.+?<a.+?title="(.+?)">', text, re.VERBOSE | re.DOTALL)  # re.DOTALL表示小圆点也可以表示换行
    print(names)

上关键出错代码
图片说明

上结果
图片说明
上页面代码
图片说明

  • 写回答

2条回答 默认 最新

  • 7*24 工作者 2020-09-30 09:44
    关注

    试一下下面这种

    regex = re.compile('<img class="ui image lazy" data-original="(http://w.*?)".*?alt="(.*?)" style.*?/>')
    for i in re.findall(regex,text):
        print(i)
    

    图片说明

    本回答被题主选为最佳回答 , 对您是否有帮助呢?
    评论
查看更多回答(1条)

报告相同问题?

悬赏问题

  • ¥15 如何让企业微信机器人实现消息汇总整合
  • ¥50 关于#ui#的问题:做yolov8的ui界面出现的问题
  • ¥15 如何用Python爬取各高校教师公开的教育和工作经历
  • ¥15 TLE9879QXA40 电机驱动
  • ¥20 对于工程问题的非线性数学模型进行线性化
  • ¥15 Mirare PLUS 进行密钥认证?(详解)
  • ¥15 物体双站RCS和其组成阵列后的双站RCS关系验证
  • ¥20 想用ollama做一个自己的AI数据库
  • ¥15 关于qualoth编辑及缝合服装领子的问题解决方案探寻
  • ¥15 请问怎么才能复现这样的图呀