{[("青椒盖饭")]} 2019-05-13 17:30 采纳率: 0%
浏览 1254

java爬取企查查网站的时候多次遇到window.location.href

  • 爬取的过程之中连续多次返回以下结果,困扰了许多天,百度了许多,都为找到合理的解决方案,感谢大神解惑
<html>
 <head>
  <script>window.location.href='https://www.qichacha.com/index_verify?type=companysearch&back=/search?key=%E7%A6%8F%E5%BB%BA%E9%9B%8D%E6%A0%BC%E5%BB%BA%E8%AE%BE%E5%B7%A5%E7%A8%8B%E6%9C%89%E9%99%90%E5%85%AC%E5%8F%B8';</script>
 </head>
 <body></body>
</html>
  • 爬虫使用的是HttpURLConnection 和蘑菇代理,访问的页面

     URL url = new URL(targetUrl);
            Authenticator.setDefault(new ProxyAuthenticator(proxyUser, proxyPass));
    
            // 创建代理服务器地址对象
            InetSocketAddress addr = new InetSocketAddress(proxyServer, proxyPort);
            // 创建HTTP类型代理对象
            Proxy proxy = new Proxy(Proxy.Type.HTTP, addr);
    
            // 设置通过代理访问目标页面
            HttpURLConnection connection = (HttpURLConnection) url.openConnection(proxy);
    
  • 写回答

2条回答 默认 最新

  • 毕小宝 博客专家认证 2019-05-14 09:09
    关注

    这个定位地址是企查查,可能你爬取的网站做了反扒机制吧。

    评论

报告相同问题?

悬赏问题

  • ¥15 oracle集群安装出bug
  • ¥15 关于#python#的问题:自动化测试
  • ¥20 问题请教!vue项目关于Nginx配置nonce安全策略的问题
  • ¥15 教务系统账号被盗号如何追溯设备
  • ¥20 delta降尺度方法,未来数据怎么降尺度
  • ¥15 c# 使用NPOI快速将datatable数据导入excel中指定sheet,要求快速高效
  • ¥15 再不同版本的系统上,TCP传输速度不一致
  • ¥15 高德地图点聚合中Marker的位置无法实时更新
  • ¥15 DIFY API Endpoint 问题。
  • ¥20 sub地址DHCP问题