畅情 2021-08-14 11:26 采纳率: 60%
浏览 53
已结题

想请教一些练习爬虫时候遇到的问题

练习爬虫时,爬取今日头条网页代码的时候发现网页的内容集在doc,看到一些以前的回答,他们需要的网页信息都是集中在xhr,以及这个sourcemapping里面的内容通过requests请求是的不到的,这是什么原因
img

  • 写回答

3条回答 默认 最新

  • CSDN专家-showbo 2021-08-14 11:48
    关注

    requests.get得到的是和浏览查看源代码一样的内容,js动态生成的内容requests.get无法获取,需要用Selenium来解析才行。

    要么就找到数据接口直接reqeusts.get接口获取数据,头条搜索结果内容是在页面里面的用beautifulsoup解析下就行了。有帮助或启发麻烦点个采纳【本回答右上角】,谢谢~~有其他问题可以继续交流~

    本回答被题主选为最佳回答 , 对您是否有帮助呢?
    评论
查看更多回答(2条)

报告相同问题?

问题事件

  • 系统已结题 8月22日
  • 已采纳回答 8月14日
  • 创建了问题 8月14日

悬赏问题

  • ¥15 网络科学导论,网络控制
  • ¥15 metadata提取的PDF元数据,如何转换为一个Excel
  • ¥15 关于arduino编程toCharArray()函数的使用
  • ¥100 vc++混合CEF采用CLR方式编译报错
  • ¥15 coze 的插件输入飞书多维表格 app_token 后一直显示错误,如何解决?
  • ¥15 vite+vue3+plyr播放本地public文件夹下视频无法加载
  • ¥15 c#逐行读取txt文本,但是每一行里面数据之间空格数量不同
  • ¥50 如何openEuler 22.03上安装配置drbd
  • ¥20 ING91680C BLE5.3 芯片怎么实现串口收发数据
  • ¥15 无线连接树莓派,无法执行update,如何解决?(相关搜索:软件下载)