Clelele 2023-07-26 21:24 采纳率: 30.8%
浏览 5

requests模块的proxies参数设置

img


为什么这个爬虫requests模块代理的参数无论设置什么服务器ip都不会正常获得该服务器的ip,获取的ip永远是自己的

  • 写回答

1条回答 默认 最新

  • CSDN-Ada助手 CSDN-AI 官方账号 2023-07-27 08:46
    关注
    不知道你这个问题是否已经解决, 如果还没有解决的话:
    • 这篇博客: Requests库常用方法及参数介绍中的 代理IP-proxies参数 部分也许能够解决你的问题, 你可以仔细阅读以下内容或跳转源博客中阅读:

      一些网站为了限制爬虫从而设置了很多反爬策略,其中一项就是针对 IP 地址设置的。比如,访问网站超过规定次数导致流量异常,或者某个时间段内频繁地更换浏览器访问,存在上述行为的 IP 极有可能被网站封杀掉。

      代理 IP 就是解决上述问题的,它突破了 IP 地址的访问限制,隐藏了本地网络的真实 IP,而使用第三方 IP 代替自己去访问网站。

      1) 代理IP池

      通过构建代理 IP 池可以让你编写的爬虫程序更加稳定,从 IP 池中随机选择一个 IP 去访问网站,而不使用固定的真实 IP。总之将爬虫程序伪装的越像人,它就越不容易被网站封杀。当然代理 IP 也不是完全不能被察觉,通过端口探测技等术识仍然可以辨别。其实爬虫与反爬虫永远相互斗争的,就看谁的技术更加厉害。

      2) proxies参数
      Requests 提供了一个代理 IP 参数proxies,该参数的语法结构如下:

      proxies = {
            '协议类型(http/https)':'协议类型://IP地址:端口号'
          }
      

      下面构建了两个协议版本的代理 IP,示例如下:

      proxies = {
         'http':'http://IP:端口号',
         'https':'https://IP:端口号'
      }
      

      3) 代理IP使用

      下面通过简单演示如何使用proxies参数,示例如下:

      import requests
      ​
      url = 'http://httpbin.org/get'
      headers = {
          'User-Agent':'Mozilla/5.0'
      }
      # 网上找的免费代理ip
      proxies = {
          'http':'http://191.231.62.142:8000',
          'https':'https://191.231.62.142:8000'
      }
      html = requests.get(url,proxies=proxies,headers=headers,timeout=5).text
      print(html)
      

      输出结果:

      {
        "args": {},
        "headers": {
          "Accept": "*/*",
          "Accept-Encoding": "gzip, deflate",
          "Cache-Control": "max-age=259200",
          "Host": "httpbin.org",
          "User-Agent": "Mozilla/5.0",
          "X-Amzn-Trace-Id": "Root=1-605073b0-4f54db1b2d2cfc0c074a1193"
        },
      
        # 注意此处显示两个IP,第一个是你自己的真实IP,另外一个是对外展示的IP
        "origin": "121.17.25.194, 191.235.72.144", 
        "url": "http://httpbin.org/get"
      }
      

      由于上述示例使用的是免费代理 IP,因此其质量、稳定性较差,可能会随时失效。如果想构建一个稳定的代理 IP 池,就需要花费成本。

      4) 付费代理IP

      网上有许多提供代理 IP 服务的网 站,比如快代理、代理精灵、齐云代理等。这些网站也提供了相关文档说明,以及 API 接口,爬虫程序通过访问 API 接口,就可以构建自己的代理 IP 池。

      付费代理 IP 按照资源类型可划分为:开发代理、私密代理、隧道代理、独享代理,其中最常使用的是开放代理与私密代理。

      开放代理:开放代理是从公网收集的代理服务器,具有 IP 数量大,使用成本低的特点,全年超过 80% 的时间都能有 3000 个以上的代理 IP 可供提取使用。

      私密代理:私密代理是基于云主机构建的高品质代理服务器,为您提供高速、可信赖的网络代理服务。私密代理每天可用 IP 数量超过 20 万个,可用率在 95 %以上,1 次可提取 IP 数量超过 700 个,可以为爬虫业务提供强大的助力。

      付费代理的收费标准根据 IP 使用的时间长短,以及 IP 的质量高低,从几元到几百元不等。89 免费代理(http://www.89ip.cn/)是一个专门提供免费代理 IP 的网站,不过想找到一个质量较高的免费代理好比大海捞针。


    如果你已经解决了该问题, 非常希望你能够分享一下解决方案, 写成博客, 将相关链接放在评论区, 以帮助更多的人 ^-^
    评论

报告相同问题?

问题事件

  • 创建了问题 7月26日

悬赏问题

  • ¥15 微信会员卡接入微信支付商户号收款
  • ¥15 如何获取烟草零售终端数据
  • ¥15 数学建模招标中位数问题
  • ¥15 phython路径名过长报错 不知道什么问题
  • ¥15 深度学习中模型转换该怎么实现
  • ¥15 HLs设计手写数字识别程序编译通不过
  • ¥15 Stata外部命令安装问题求帮助!
  • ¥15 从键盘随机输入A-H中的一串字符串,用七段数码管方法进行绘制。提交代码及运行截图。
  • ¥15 TYPCE母转母,插入认方向
  • ¥15 如何用python向钉钉机器人发送可以放大的图片?