爬虫多线程没有作用，爬取的数据比原来少

在python3.9环境下，使用threading多线程爬取百度图片，线程启动后，爬取的图片更少

import requests
import os
import re
import time
import threading
from queue import Queue

进行UA伪装，当前爬取信息伪装成浏览器

lock = threading.Lock()
header = {
"user-agent": "Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/104.0.5112.81 Safari/537.36 Edg/104.0.1293.47"
}
def image():
time_start = time.time()

keyword = input()
save_dir = keyword
page_num = 4
# 请求的 url
url = 'https://image.baidu.com/search/acjson?'#这是个ajkx请求
#生存列表，存储图片链接
image_url_list = []
for pn in range(0, 30 * page_num, 30):
    # 请求参数
    param = {'tn': 'resultjson_com',
             'logid': '7603311155072595725',
             'ipn': 'rj',
             'ct': 201326592,
             'is': '',
             'fp': 'result',
             'queryWord': keyword,
             'cl': 2,
             'lm': -1,
             'ie': 'utf-8',
             'oe': 'utf-8',
             'adpicid': '',
             'st': -1,
             'z': '',
             'ic': '',
             'hd': '',
             'latest': '',
             'copyright': '',
             'word': keyword,
             's': '',
             'se': '',
             'tab': '',
             'width': '',
             'height': '',
             'face': 0,
             'istype': 2,
             'qc': '',
             'nc': '1',
             'fr': '',
             'expermode': '',
             'force': '',
             'cg': '',
             'pn': pn,    # 显示：30-60-90
             'rn': '30',  # 每页显示 30 条
             'gsm': '1e',
             '1618827096642': ''
             }

    response = requests.get(url=url, headers=header, params=param)
    #显示200表示请求成功，但没处理
    if response.status_code == 200:
        pass
    html = response.text.encode('utf-8').decode('utf-8')

    # 正则方式提取图片链接

    image_url_= re.findall('"thumbURL":"(.*?)",', html, re.S)
    #遍历获取到的图片链接，存储在一个列表中，用来构成队列
    for Url in image_url_:
        image_url_list.append(Url)
print(image_url_list)

        #建立不同关键词存储的文件夹
if not os.path.exists(save_dir):
    os.makedirs(save_dir)
# #实例化Queue，用来存储图片链接为队列
url_queue = Queue(len(image_url_list))
for a in range(len(image_url_list)): #遍历列表中存储的图片链接
    #放入队列中
    dict = {}
    dict['url'] = image_url_list[a]
    dict['num'] = a
    url_queue.put(dict)
def get_images(threadNmae, url_queue):
    while True:
        if not url_queue.empty():
            image_url = url_queue.get()['url']
            image_data = requests.get(url=image_url, headers=header).content
        else :
            break
        with open(os.path.join(save_dir, '{}.jpg'.format(url_queue.get()['num'])), 'wb') as fp:
            fp.write(image_data)
class myThread(threading.Thread):
    def __init__(self, name, delay):
        threading.Thread.__init__(self)
        self.name = name
        self.delay = delay

    def run(self):
        print("Starting " + self.name)
        get_images(self.name, self.delay)
        print("Exiting " + self.name)
thread1 = myThread("Thread-" +'1',delay=url_queue)
thread1.start()
thread2 = myThread("Thread-" + '2', delay=url_queue)
thread2.start()

image()

运行结果及报错内容

运行时，多线程没有结束。

爬取的图片编号应该从0到120，但是中间随机缺少了，再没使用多线程之前能够爬取所有图片。

我的解答思路和尝试过的方法

尝试过让爬虫休眠在运行，没有效果

我想要达到的结果

爬取的图片能够全部都下载下来

写回答
好问题 0 提建议
追加酬金
关注问题
分享
邀请回答
编辑收藏删除结题
收藏举报

3条回答默认最新

关注

码龄粉丝数原力等级 --

被采纳

被点赞

采纳率
像风铃那样 2022-08-22 08:41
关注
是这样的，我认为，创建一个爬虫线程也需要时间，而两个线程并不能提高多大效率。或许题主可以试试线程池。

解决 1
无用
评论打赏
分享
举报

评论

按下Enter换行，Ctrl+Enter发表内容

报告相同问题？

关注问题

爬虫代码没有改变每次爬取的数据不同？ python 爬虫
2021-09-19 15:55

回答 1 已采纳你应该发一发有什么错误，最佳250音乐，这本来就是可能变得，同时网络不好的时候，睡眠2秒是不够的，加上异常处理部分
如何将爬虫爬取的数据进行排版 python 数据挖掘爬虫
2022-02-28 22:22

回答 1 已采纳看你想怎么处理了，可以放到一行，可以放到word里，可以用Excel，你选一个，我教你另外你的代码需要看一下，要不不好改
python 爬虫，如何爬取相关数据 python 有问必答爬虫
2021-11-11 11:15

回答 1 已采纳先确定需要爬取的网站，然后分析网站的数据来源，是后端生成数据还是ajax生成数据，确定数据来源方式就根据HTTP请求编写代码，这个涉及一些请求参数的加密、转换等等处理，然后清洗数据和数据入库
python爬虫-python多线程爬虫爬取电影天堂资源.zip
2024-02-25 21:45

在爬取电影天堂资源的实例中，我们需要理解Python爬虫的基本原理，掌握多线程编程技巧，分析和处理目标网站的结构，以及应对可能出现的反爬策略。通过这些步骤，我们可以构建出一个高效且稳定的多线程爬虫，实现电影...
请问Python爬虫如何把爬取数据存入csv文件中 python 开发语言有问必答爬虫
2021-11-21 21:19

回答 1 已采纳你用open打开csv文件，然后以字符串格式写入就行了，每个数据之间用英文逗号隔开即可
python爬虫翻页爬取的数据是第一页的重复数据 python 爬虫问答团队
2021-12-18 19:23

回答 1 已采纳爬下一页就好了
爬虫爬取数据出现编码问题 python 爬虫
2021-08-10 11:17

回答 1 已采纳自行解决了只需要把这个编码换成utf-8就可以了
Python爬虫 -多线程爬虫爬取电影天堂资源.zip
2024-02-03 11:44

总的来说，这个Python多线程爬虫项目涵盖了网络请求、HTML解析、多线程编程、数据存储以及应对反爬策略等多个技术点，是学习Python爬虫实战的一个典型例子。通过这个项目，开发者可以提升自己的Web数据抓取能力，并...
Python爬虫技术用代理池爬取数据正常爬取到，单单用一个代理爬取则全是广告 python 爬虫
2023-02-23 23:01

回答 1 已采纳两次的引擎不一样？一个百度，一个必应。我以前也做过类似的项目，百度反爬总是更猛，广告巨多
Python爬虫想要定时爬取数据 python 服务器负载均衡
2021-09-08 18:21

回答 2 已采纳你可以做一下异常处理，将拒绝访问的数据记录下来，然后第二次只爬取被拒绝访问的数据。另外，做爬虫最后还是要做一些应对反爬的措施，比如每次访问之间sleep几秒钟（最好用随机数）。如果，想要做定时的话，可
多线程java爬虫爬取小说网站
2024-03-22 11:00

在IT行业中，Java爬虫是一种常见的技术，用于自动抓取网页信息，特别是在处理大量数据时，采用多线程可以显著提升爬取效率。本项目是一个使用Java编写的多线程爬虫，专为爬取小说网站设计。在这个项目中，我们将深入...
python爬虫怎么改成多线程 python 爬虫
2022-04-29 12:58

回答 6 已采纳楼上的这些线程改造方式放在这里行不通吧。楼主代码中IO操作在循环的地方，这里线程不是应该将循环改成多线程吗。。。##改了一个循环，试一下 ```python import parsel impor
python多线程爬虫爬取电影天堂资源
2024-03-15 12:43

Python多线程爬虫爬取电影天堂资源是一个实用且具有挑战的项目。以下是对该项目的详细说明: 1. 项目概述: 该项目旨在使用Python编写一个多线程爬虫程序,从电影天堂网站上爬取电影资源信息,包括电影名称、年份、类型...
简易C++爬虫框架，基于多线程、多任务，快速实现网络数据爬取
2023-02-27 14:54

本项目提供了一个简易的C++爬虫框架，它利用了多线程和多任务技术来加速网络数据的抓取，对于学习和实践网络爬虫开发来说，是一个很好的起点。首先，我们要理解爬虫的基本概念。网络爬虫（Web Crawler）是自动地...
没有解决我的问题, 去提问

问题事件

关注

码龄粉丝数原力等级 --

被采纳

被点赞

采纳率
创建了问题 8月21日

悬赏问题

¥15 关于stm32hal库驱动ft6336触摸屏遇到的问题
¥15 需要手写数字信号处理Dsp三个简单题不用太复杂
¥15 数字信号处理考试111
¥100 关于#audobe audition#的问题，如何解决？
¥15 allegro17.2生成bom表是空白的
¥15 请问一下怎么打通CAN通讯
¥20 如何在 rocky9.4 部署 CDH6.3.2？
¥35 navicat将excel中的数据导入mysql出错
¥15 rt-thread线程切换的问题
¥15 高通uboot 打印ubi init err 22