coopyzhu 2017-09-29 14:07 采纳率: 100%
浏览 3676
已采纳

python爬虫获取源码与网页不同

使用requests和bs4库

静态爬取页面2017年数据

Soup获得部分源码如图

图片说明

对应网页源码如图

图片说明

可见,该tr中第一个<td&gt1</td>;在Soup中变成了<td>1<td> ,而末尾处也多了一个</td>

该问题发生在每一个tr中,但爬取2016年数据并没有出现该问题。

代码照抄教程,应该不存在问题

  • 写回答

1条回答 默认 最新

  • threenewbee 2017-09-30 00:48
    关注

    网页中有js脚本的话,可以在下载网页后动态修改/添加网页本身,也就是ajax

    本回答被题主选为最佳回答 , 对您是否有帮助呢?
    评论

报告相同问题?

悬赏问题

  • ¥15 MATLAB代码补全插值
  • ¥15 Typegoose 中如何使用 arrayFilters 筛选并更新深度嵌套的子文档数组信息
  • ¥15 前后端分离的学习疑问?
  • ¥15 stata实证代码答疑
  • ¥50 husky+jaco2实现在gazebo与rviz中联合仿真
  • ¥15 dpabi预处理报错:Error using y_ExtractROISignal (line 251)
  • ¥15 在虚拟机中配置flume,无法将slave1节点的文件采集到master节点中
  • ¥15 husky+kinova jaco2 仿真
  • ¥15 zigbee终端设备入网失败
  • ¥15 金融监管系统怎么对7+4机构进行监管的