俊熙君 2022-08-22 11:35 采纳率: 85.7%
浏览 62
已结题

Python爬虫,爬虫访问网站时遇到415. UnsupportedMediaType错误,运行结果为空

问题遇到的现象和发生背景

初学python爬虫,练习爬取1~200页文章,不知道是不是因为页面的url找错了,运行结果啥也没有。

问题相关代码,请勿粘贴截图

#导入必要模块
import requests
from bs4 import BeautifulSoup
import re

#创建idx 1~200页
for idx in range(200):
print("#"*30,idx+1)

#网站url
url = " https://www.cnblogs.com/AggSite/AggSitePostList"

#通过分析网站源码可知每页的url信息
data = {"CategoryType":"SiteHome",
        "ParentCategoryId":0,
        "CategoryId":808,
        "PageIndex":idx+1,
        "TotalPostCount":4000,
        "ItemListActionName":"AggSitePostList"}

#requests模块获取网页信息
r = requests.get(url,data=data)

#判断网页状态码
# if r.status_code != 200:
#     raise Exception()

#bs4模块创建对象
soup = BeautifulSoup(r.text,"html.parser")

#指定class获取指定信息
post_items = soup.find_all("article",class_="post-item")
for post_item in post_items:
    link = post_item.find("a",class_="post-item-title")
    print(link["href"],link.get_text())
运行结果及报错内容

img

我的解答思路和尝试过的方法

打印了r.text发现无法访问https://www.cnblogs.com/AggSite/AggSitePostList,访问结果时415. UnsupportedMediaType
不知道怎么找到正确的url

我想要达到的结果

爬出1-200页的文章

  • 写回答

3条回答 默认 最新

  • honestman_ 2022-08-22 11:57
    关注

    img

    本回答被题主选为最佳回答 , 对您是否有帮助呢?
    评论
查看更多回答(2条)

报告相同问题?

问题事件

  • 系统已结题 8月30日
  • 已采纳回答 8月22日
  • 修改了问题 8月22日
  • 创建了问题 8月22日

悬赏问题

  • ¥20 iqoo11 如何下载安装工程模式
  • ¥15 flask项目,怎么使用AJAX传数据库数据到echarts图表的data里,实现异步加载数据。
  • ¥15 本题的答案是不是有问题
  • ¥15 关于#r语言#的问题:(svydesign)为什么在一个大的数据集中抽取了一个小数据集
  • ¥15 C++使用Gunplot
  • ¥15 这个电路是如何实现路灯控制器的,原理是什么,怎么求解灯亮起后熄灭的时间如图?
  • ¥15 matlab数字图像处理频率域滤波
  • ¥15 在abaqus做了二维正交切削模型,给刀具添加了超声振动条件后输出切削力为什么比普通切削增大这么多
  • ¥15 ELGamal和paillier计算效率谁快?
  • ¥15 蓝桥杯单片机第十三届第一场,整点继电器吸合,5s后断开出现了问题