匿名用户2022 2023-01-25 13:07 采纳率: 76.2%
浏览 59
已结题

Python 爬虫乱码

网站名称不能写出来,要不然会因为被认为侵权而发布不了问题
写了一个最基础的爬虫去访问某网站(加了请求头),状态码200,爬出来的网页源代码是一段乱码
代码(原文件已经删了):

import requests
url='https://www.douban.com'
headers={中间是什么忘了,总之包含了User-agent和Referer}
r=requests.get(url,headers=headers)
r.text.encode('utf=8')
print(r.statu_code)
print(r.text)

成功访问,r.text是一大段的乱码?
爬取某网站的原文件已经给我删了,以同样的方法访问另一个网站首页是一部分乱码,用浏览器看了一下网页源代码,发现乱码部分好像大多在引号内
把r.text写进html文件里(utf-8转gbk):

img


还有这个(utf-8):

img

加encode('gbk')无法转换
还有我把这个程序改动了去爬某个视频网站首页,

https://www.bilibili.com

用了网上介绍的几种反反爬,出来的只有一小块,是源代码真就这么点,还是它设置了其他反爬?
(网页名称只能这么写了,不然不让提交)

  • 写回答

3条回答 默认 最新

  • starlight_2007 2023-01-25 18:29
    关注

    有点怪,源代码在我的环境里运行后,没有乱码。

    img

    想了想,有可能是如下原因导致乱码:
    (1)在用户未知的情况下,环境自动按某种格式编译了内容,然后在反复、不对应的编译格式转换下出现乱码。
    (2)指定的编码格式不正确。
    可能可行的解决方案:
    (1)避免指定错误的编译格式。
    (2)使用其他的模块以避免编译错误。(如bs4等)
    我用的应该是virturevenv下的IDLE。
    请问您的环境是?

    本回答被题主选为最佳回答 , 对您是否有帮助呢?
    评论 编辑记录
查看更多回答(2条)

报告相同问题?

问题事件

  • 已结题 (查看结题原因) 1月26日
  • 已采纳回答 1月26日
  • 创建了问题 1月25日

悬赏问题

  • ¥15 网络科学导论,网络控制
  • ¥15 metadata提取的PDF元数据,如何转换为一个Excel
  • ¥15 关于arduino编程toCharArray()函数的使用
  • ¥100 vc++混合CEF采用CLR方式编译报错
  • ¥15 coze 的插件输入飞书多维表格 app_token 后一直显示错误,如何解决?
  • ¥15 vite+vue3+plyr播放本地public文件夹下视频无法加载
  • ¥15 c#逐行读取txt文本,但是每一行里面数据之间空格数量不同
  • ¥50 如何openEuler 22.03上安装配置drbd
  • ¥20 ING91680C BLE5.3 芯片怎么实现串口收发数据
  • ¥15 无线连接树莓派,无法执行update,如何解决?(相关搜索:软件下载)