YOLO484 2022-10-18 21:52 采纳率: 100%
浏览 212
已结题

python爬虫爬取图片,图片打不开

import re
import requests
import os

if not os.path.exists('./qiutuLibs'):
    os.mkdir('./qiutuLibs')
headers = {
    'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/95.0.4638.69 Safari/537.36'
}
url = 'https://photo.xitek.com/style/2'
page_text = requests.get(url = url,headers=headers).text
e ='<a class="card-img-top" .*?<img src="(.*?)" .*?'
img_src = re.findall(e,page_text,re.S)


for src in img_src:
    src = 'https:' + src
    image_date = requests.get(url=src, headers=headers).content
    image_name = src.split('/')[-1]
    imgPath = './qiutuLibs/'+image_name
    with open(imgPath,'wb')as fp:
        fp.write(image_date)
        print(image_name,"下载成功")



上面的代码,我进行了多次的尝试,可以成功爬取,但爬取下来的图片打不开会显示

img

望求答疑

  • 写回答

1条回答 默认 最新

  • EdsionWang 2022-10-19 10:43
    关注

    图片是从cdn上过来的,做了防盗链。在headers中添加Refer,指向该网站就行了。

    import re
    import requests
    import os
     
    if not os.path.exists('./qiutuLibs'):
        os.mkdir('./qiutuLibs')
    headers = {
        'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/95.0.4638.69 Safari/537.36'
    }
    headers['Referer']= "https://photo.xitek.com/"
    url = 'https://photo.xitek.com/style/2'
    page_text = requests.get(url = url,headers=headers).text
    e ='<a class="card-img-top" .*?<img src="(.*?)" .*?'
    img_src = re.findall(e,page_text,re.S)
     
     
    for src in img_src:
        src = 'https:' + src
        image_date = requests.get(url=src, headers=headers).content
        image_name = src.split('/')[-1]
        imgPath = './qiutuLibs/'+image_name
        with open(imgPath,'wb')as fp:
            fp.write(image_date)
            print(image_name,"下载成功")
     
    
    本回答被题主选为最佳回答 , 对您是否有帮助呢?
    评论

报告相同问题?

问题事件

  • 系统已结题 10月27日
  • 已采纳回答 10月19日
  • 创建了问题 10月18日

悬赏问题

  • ¥15 latex投稿显示click download
  • ¥15 请问读取环境变量文件失败是什么原因?
  • ¥15 在若依框架下实现人脸识别
  • ¥15 网络科学导论,网络控制
  • ¥100 安卓tv程序连接SQLSERVER2008问题
  • ¥15 利用Sentinel-2和Landsat8做一个水库的长时序NDVI的对比,为什么Snetinel-2计算的结果最小值特别小,而Lansat8就很平均
  • ¥15 metadata提取的PDF元数据,如何转换为一个Excel
  • ¥15 关于arduino编程toCharArray()函数的使用
  • ¥100 vc++混合CEF采用CLR方式编译报错
  • ¥15 coze 的插件输入飞书多维表格 app_token 后一直显示错误,如何解决?