敲码进程0.0% 2022-07-12 20:00 采纳率: 100%
浏览 25
已结题

爬虫的数据提取失败了

爬虫数据提取失败
import requests
from bs4 import BeautifulSoup
import time  # 导入相应的库文件
headers = {
        'user-agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64)'
        ' AppleWebKit/537.36 (KHTML, like Gecko) Chrome/103.0.0.0 Safari/537.36'
}   # 加入请求头

def get_info(url):
    '''
    :param url: 参数:要请求的链接
    :return: 空
    '''
    wb_data = requests.get(url, headers=headers)  # 发送网页请求
    soup = BeautifulSoup(wb_data.text, 'lxml')   # 对网页内容进行解析 wb_data.text表示网页源代码
    ranks = soup.select('span.pc_temp_num')
    titles = soup.select('div.pc_temp_songlist > u1 > li >a')
    times = soup.select('span.pc_temp_tips_r > span')
    for rank, title, time in zip(ranks, titles, times):
       data = {
           'rank': rank.get_text().strip(),
           'singer': title.get_text().split('-')[0],
           'song': title.get_text().split('-')[1],
           'time': time.get_text().strip()
       }
       print(data)

if __name__ == '__main__':
    urls = ['https://www.kugou.com/yy/rank/home/{}-8888.html'.format(str(i)) for i in range(1,24)] #酷狗音乐
    for url in urls:
        get_info(url)
    time.sleep(1)


运行结果如下

img

是否是头部访问的地方有问题呢
  • 写回答

1条回答 默认 最新

  • piaoyiren 2022-07-12 20:05
    关注
    
    import requests
    from bs4 import BeautifulSoup
    import time  # 导入相应的库文件
    headers = {
            'user-agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64)'
            ' AppleWebKit/537.36 (KHTML, like Gecko) Chrome/103.0.0.0 Safari/537.36'
    }   # 加入请求头
     
    def get_info(url):
        '''
        :param url: 参数:要请求的链接
        :return: 空
        '''
        wb_data = requests.get(url, headers=headers)  # 发送网页请求
        soup = BeautifulSoup(wb_data.text, 'lxml')   # 对网页内容进行解析 wb_data.text表示网页源代码
        ranks = soup.select('span.pc_temp_num')
        # titles = soup.select('div.pc_temp_songlist > u1 > li >a')
        times = soup.select('span.pc_temp_tips_r > span')
        for rank, time in zip(ranks,  times):
           data = {
               'rank': rank.get_text().strip(),
               # 'singer': title.get_text().split('-')[0],
               # 'song': title.get_text().split('-')[1],
               'time': time.get_text().strip()
           }
           print(data)
     
    if __name__ == '__main__':
        urls = ['https://www.kugou.com/yy/rank/home/{}-8888.html'.format(str(i)) for i in range(1,24)] #酷狗音乐
        for url in urls:
            get_info(url)
            time.sleep(1)
     
     
    
    本回答被题主选为最佳回答 , 对您是否有帮助呢?
    评论

报告相同问题?

问题事件

  • 系统已结题 7月21日
  • 已采纳回答 7月13日
  • 创建了问题 7月12日

悬赏问题

  • ¥15 php 同步电商平台多个店铺增量订单和订单状态
  • ¥15 关于logstash转发日志时发生的部分内容丢失问题
  • ¥17 pro*C预编译“闪回查询”报错SCN不能识别
  • ¥15 微信会员卡接入微信支付商户号收款
  • ¥15 如何获取烟草零售终端数据
  • ¥15 数学建模招标中位数问题
  • ¥15 phython路径名过长报错 不知道什么问题
  • ¥15 深度学习中模型转换该怎么实现
  • ¥15 Stata外部命令安装问题求帮助!
  • ¥15 从键盘随机输入A-H中的一串字符串,用七段数码管方法进行绘制。提交代码及运行截图。