soxvlin 2017-07-26 08:52 采纳率: 0%
浏览 2218

python爬取网页上的中文,输出乱码怎么办?

我用的是mac,用的python版本是3.6。想要爬取政府网站上的一些信息,然而出来的都是乱码,如图:

图片说明

下面是我的代码:

import io
import sys
from urllib.request import urlopen
sys.stdout = io.TextIOWrapper(sys.stdout.buffer,encoding='utf-8')
    #转码为utf-8格式

from bs4 import BeautifulSoup
import requests,urllib,time,string,chardet

url = 'http://www.wenzhou.gov.cn/art/2017/7/18/art_1235230_8460404.html'

headers = {
'user-agent':'Mozilla/5.0 (Macintosh; Intel Mac OS X 10_12_5) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/59.0.3071.115 Safari/537.36'
}

page=requests.get(url,headers=headers)
soup=BeautifulSoup(page.text,'lxml')
txts=soup.select('p')
for txt in txts:
    print(txt)

请各位大神指导!

  • 写回答

2条回答 默认 最新

  • mumubaobei 2017-07-26 09:05
    关注

    查看原网站的编码是什么,鼠标右键,编码,

    评论

报告相同问题?

悬赏问题

  • ¥20 delta降尺度方法,未来数据怎么降尺度
  • ¥15 c# 使用NPOI快速将datatable数据导入excel中指定sheet,要求快速高效
  • ¥15 再不同版本的系统上,TCP传输速度不一致
  • ¥15 高德地图点聚合中Marker的位置无法实时更新
  • ¥15 DIFY API Endpoint 问题。
  • ¥20 sub地址DHCP问题
  • ¥15 delta降尺度计算的一些细节,有偿
  • ¥15 Arduino红外遥控代码有问题
  • ¥15 数值计算离散正交多项式
  • ¥30 数值计算均差系数编程