Java_爬虫，如何抓取Js动态生成数据的页面？

很多网站是用js或Jquery 生成数据的，到后台获取到数据以后，用 document.write()或者("#id").html="" 的方式写到页面中，这个时候用浏览器查看源码是看不到数据的。

HttpClient是不行的，看网上说HtmlUnit，说可以获取后台js加载完后的完整页面，但是我按照文章上说的写了，都不好使。

String url = "http://xinjinqiao.tprtc.com/admin/main/flrpro.do";
try {
    WebClient webClient = new WebClient(BrowserVersion.FIREFOX_10);
    //设置webClient的相关参数
    webClient.getOptions().setJavaScriptEnabled(true);
    webClient.getOptions().setCssEnabled(false);
    webClient.setAjaxController(new NicelyResynchronizingAjaxController());
    //webClient.getOptions().setTimeout(50000);
    webClient.getOptions().setThrowExceptionOnScriptError(false);
    //模拟浏览器打开一个目标网址
    HtmlPage rootPage = webClient.getPage(url);
    System.out.println("为了获取js执行的数据 线程开始沉睡等待");
    Thread.sleep(3000);//主要是这个线程的等待 因为js加载也是需要时间的
    System.out.println("线程结束沉睡");
    String html = rootPage.asText();
    System.out.println(html);
} catch (Exception e) {
}

其实这段代码不好使。

求解答，其中典型的就是这个链接的页面，怎么能在java程序中获取其中的数据？

http://xinjinqiao.tprtc.com/admin/main/flrpro.do

写回答
好问题 0 提建议
关注问题
分享
邀请回答
编辑收藏删除结题
收藏举报

5条回答默认最新

关注

码龄粉丝数原力等级 --

被采纳

被点赞

采纳率
黄菲 2014-07-28 08:21
关注
我之前也遇到过这个问题，网上说法很多，不过觉得都没有解决问题，后来相过有什么功能可以获取请求某一个url地址时所附带请求的其他链接地址，但是这个好像说是用抓包可以实现，不过我没实现

只能采用最原始的方法就是就是自己去模拟一个请求，将js中ajax的链接地址拼接出来，再次进行请求，这个时候需要注意post方式还是get方法

本回答被题主选为最佳回答 , 对您是否有帮助呢?

解决无用
评论打赏
分享
举报

评论

按下Enter换行，Ctrl+Enter发表内容

查看更多回答(4条)

报告相同问题？

关注问题

java 抓取动态页面_Java_爬虫，如何抓取Js动态生成数据的页面？
2021-02-28 15:03

weixin_39802132的博客该楼层疑似违规已被系统折叠隐藏此楼查看此楼很多网站是用js或Jquery 生成数据的，到后台获取到数据以后，用 document.write()或者("#id").html="" 的方式写到页面中，这个时候用浏览器查看源码是看不到数据的。...
java 爬虫 js_Java_爬虫，如何抓取Js动态生成数据的页面？
2021-03-22 14:57

朱子宁的博客该楼层疑似违规已被系统折叠隐藏此楼查看此楼很多网站是用js或Jquery 生成数据的，到后台获取到数据以后，用 document.write()或者("#id").html="" 的方式写到页面中，这个时候用浏览器查看源码是看不到数据的。...
爬虫网页的数据 java_Java_爬虫，如何抓取Js动态生成数据的页面？
2021-03-06 06:22

weixin_39667509的博客该楼层疑似违规已被系统折叠隐藏此楼查看此楼很多网站是用js或Jquery 生成数据的，到后台获取到数据以后，用 document.write()或者("#id").html="" 的方式写到页面中，这个时候用浏览器查看源码是看不到数据的。...
java动态生成js文件_Java_爬虫，如何抓取Js动态生成数据的页面？
2021-02-28 19:10

Dr.Blue的博客该楼层疑似违规已被系统折叠隐藏此楼查看此楼很多网站是用js或Jquery 生成数据的，到后台获取到数据以后，用 document.write()或者("#id").html="" 的方式写到页面中，这个时候用浏览器查看源码是看不到数据的。...
Java爬虫Jsoup+httpclient获取动态生成的数据
2020-10-19 21:21

在Web开发和数据抓取领域，Java爬虫技术是实现网页自动化信息提取的重要手段。本文主要讲述如何利用Java编程语言中的Jsoup库和HttpClient工具包来获取和解析动态生成的数据，特别是那些通过JavaScript动态加载的数据...
java 动态网页抓取_Java_爬虫，如何抓取Js动态生成数据的页面？
2021-03-07 00:02

穆庭秋的博客该楼层疑似违规已被系统折叠隐藏此楼查看此楼很多网站是用js或Jquery 生成数据的，到后台获取到数据以后，用 document.write()或者("#id").html="" 的方式写到页面中，这个时候用浏览器查看源码是看不到数据的。...
java爬动态页面_Java_爬虫，如何抓取Js动态生成数据的页面？
2021-03-08 21:42

Geek7even的博客该楼层疑似违规已被系统折叠隐藏此楼查看此楼很多网站是用js或Jquery 生成数据的，到后台获取到数据以后，用 document.write()或者("#id").html="" 的方式写到页面中，这个时候用浏览器查看源码是看不到数据的。...
java动态地址爬虫_Java_爬虫，如何抓取Js动态生成数据的页面？
2021-03-18 12:12

weixin_39558391的博客该楼层疑似违规已被系统折叠隐藏此楼查看此楼很多网站是用js或Jquery 生成数据的，到后台获取到数据以后，用 document.write()或者("#id").html="" 的方式写到页面中，这个时候用浏览器查看源码是看不到数据的。...
java 动态爬虫_Java_爬虫，如何抓取Js动态生成数据的页面？
2021-03-09 07:25

哎呀吗呀咪呀的博客该楼层疑似违规已被系统折叠隐藏此楼查看此楼很多网站是用js或Jquery 生成数据的，到后台获取到数据以后，用 document.write()或者("#id").html="" 的方式写到页面中，这个时候用浏览器查看源码是看不到数据的。...
java爬虫获取js值_Java_爬虫，如何抓取Js动态生成数据的页面？
2021-02-26 18:09

筑英餐创的博客 [{"id":2081,"count":67,"fname":"天津市北辰区双口镇京福公路西侧林里庄园32号楼房产","fdate":"2017-10-31","fmoney":"256.896900","fcode":"GR2017TJ1000233-3","fproducttype":"实物资产-房产","fmediadate":...
没有解决我的问题, 去提问

Java_爬虫，如何抓取Js动态生成数据的页面？

5条回答 默认 最新

5条回答默认最新