weixin_40447669
coopyzhu
采纳率100%
2017-09-29 14:07

python爬虫获取源码与网页不同

已采纳

使用requests和bs4库

静态爬取页面2017年数据

Soup获得部分源码如图

图片说明

对应网页源码如图

图片说明

可见,该tr中第一个<td&gt1</td>;在Soup中变成了<td>1<td> ,而末尾处也多了一个</td>

该问题发生在每一个tr中,但爬取2016年数据并没有出现该问题。

代码照抄教程,应该不存在问题

  • 点赞
  • 写回答
  • 关注问题
  • 收藏
  • 复制链接分享
  • 邀请回答

1条回答

  • caozhy 回答这么多问题就耍赖把我的积分一笔勾销了 4年前

    网页中有js脚本的话,可以在下载网页后动态修改/添加网页本身,也就是ajax

    点赞 2 评论 复制链接分享

为你推荐