java爬取企查查网站的时候多次遇到window.location.href
  • 爬取的过程之中连续多次返回以下结果,困扰了许多天,百度了许多,都为找到合理的解决方案,感谢大神解惑
<html>
 <head>
  <script>window.location.href='https://www.qichacha.com/index_verify?type=companysearch&back=/search?key=%E7%A6%8F%E5%BB%BA%E9%9B%8D%E6%A0%BC%E5%BB%BA%E8%AE%BE%E5%B7%A5%E7%A8%8B%E6%9C%89%E9%99%90%E5%85%AC%E5%8F%B8';</script>
 </head>
 <body></body>
</html>
  • 爬虫使用的是HttpURLConnection 和蘑菇代理,访问的页面

     URL url = new URL(targetUrl);
            Authenticator.setDefault(new ProxyAuthenticator(proxyUser, proxyPass));
    
            // 创建代理服务器地址对象
            InetSocketAddress addr = new InetSocketAddress(proxyServer, proxyPort);
            // 创建HTTP类型代理对象
            Proxy proxy = new Proxy(Proxy.Type.HTTP, addr);
    
            // 设置通过代理访问目标页面
            HttpURLConnection connection = (HttpURLConnection) url.openConnection(proxy);
    

2个回答

这个定位地址是企查查,可能你爬取的网站做了反扒机制吧。

qq_43386754
{[("青椒盖饭")]} 嗯嗯,是呀,怎样才能避开他呢?
一年多之前 回复

我遇到的问题和你一摸一样,在使用代理ip后基本能解决这个问题。

qq_42008336
qq_42008336 重定向到验证页面?我这边也是这种情况,请问解决了吗?
5 个月之前 回复
u011423145
joker1993 回复Lock_Jun: 对的是这个流程,简单的项目自己抓免费代理可以。但是要自己验证好代理ip的有效性,有效的代理才能使用
10 个月之前 回复
Lock_Jun
Lock_Jun 回复joker1993: 我最近再学习webmagic 但是这个代理ip搞不懂 貌似那个就是直接写ip和端口 使用代理是先去代理ip网站趴数据 然后自己把ip数据设置成代理麽
10 个月之前 回复
u011423145
joker1993 我用的是芝麻代理,然后在这个过程中分别很多代理,都i经常遇到这个问题,可能就是因为代理IP的质量不好,我建议你可以多开几个线程,然后遇到windows.location.href这种情况时候,把请求重新再多发送几遍,然后要保证你的cookie一直是可以登陆的
一年多之前 回复
u011423145
joker1993 代理ip就是我们常说的proxy,在webmagic里面就是要实现ProxyProvider那个模块
一年多之前 回复
qq_43386754
{[("青椒盖饭")]} 代理IP?不是很懂,能详细点吗?谢谢
一年多之前 回复
Csdn user default icon
上传中...
上传图片
插入图片
抄袭、复制答案,以达到刷声望分或其他目的的行为,在CSDN问答是严格禁止的,一经发现立刻封号。是时候展现真正的技术了!
立即提问