cbb111705102
cbb111705102
2016-05-12 07:05
采纳率: 0%
浏览 8.8k

用python写的爬虫,但获取的网页源码不全,是什么原因?求帮助啦,呜呜。。。。

import urllib2;

import urllib;

import time;

import re;

url= str("http://technet.microsoft.com/en-us/windows/release-info/");

req = urllib2.Request(url);

req.add_header("User-Agent","Mozilla/5.0 (Windows NT 10.0; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/47.0.2526.106 Safari/537.36");

response=urllib2.urlopen(req);

html=response.read();

print "html=",html;

  • 点赞
  • 写回答
  • 关注问题
  • 收藏
  • 邀请回答

1条回答 默认 最新

  • oyljerry
    oyljerry 2016-05-12 07:12

    你可以用chrome的network查看就知道了,这个页面是异步加载返回的,它不是直接返回请求的数据,所以你爬虫只能抓取到最开始的部分数据,后面的数据是由Javascript异步加载进来的

    你可以用python的selenium库,用webdriver加载页面来获取内容,然后再用xpath解析里面的数据

    点赞 评论

相关推荐