练不出腹肌不改头像 2019-10-04 09:38 采纳率: 0%
浏览 2791

爬虫为什么只能爬到一部分内容?

python爬虫爬取猫眼电影Top100,每一页有10个电影,但是爬虫只能爬取第一个,后面都爬不到不止是为什么
代码如下,大神帮忙看看,感激不尽
import requests
from requests.exceptions import RequestException
import re
def get_one_page(url):
try:
headers={'User-Agent':'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/77.0.3865.90 Safari/537.36'}
response=requests.get(url,headers=headers)
if response.status_code==200:
return response.text
return None
except RequestException:
return None

def parse_one_page(html):
pattern=re.compile('

.*?board-index-1">(\d+).*?data-src="(.*?)".*?/>.*?name">(.*?)'+
'.*?star">(.*?).*?releasetime">(.*?).*?integer">(.*?).*?fraction">(.*?).*?
',re.S)
items=re.findall(pattern,html)
print(items)

def main():
url='http://maoyan.com/board/4?'
html=get_one_page(url)
parse_one_page(html)

if name=='__main__':
main()

结果显示
C:\Users\Administrator\python37\python.exe C:/Users/Administrator/PycharmProjects/Maoyantop100/spder.py
[('1', 'https://p1.meituan.net/movie/20803f59291c47e1e116c11963ce019e68711.jpg@160w_220h_1e_1c', '霸王别姬', '\n 主演:张国荣,张丰毅,巩俐\n ', '上映时间:1993-01-01', '9.', '5')]

Process finished with exit code 0

  • 写回答

1条回答 默认 最新

  • threenewbee 2019-10-04 09:42
    关注

    可能是ajax异步加载的,建议你用f12抓包看下,加载更多的数据是请求的什么地址,什么参数,程序照着模仿

    评论

报告相同问题?

悬赏问题

  • ¥15 微信会员卡接入微信支付商户号收款
  • ¥15 如何获取烟草零售终端数据
  • ¥15 数学建模招标中位数问题
  • ¥15 phython路径名过长报错 不知道什么问题
  • ¥15 深度学习中模型转换该怎么实现
  • ¥15 HLs设计手写数字识别程序编译通不过
  • ¥15 Stata外部命令安装问题求帮助!
  • ¥15 从键盘随机输入A-H中的一串字符串,用七段数码管方法进行绘制。提交代码及运行截图。
  • ¥15 TYPCE母转母,插入认方向
  • ¥15 如何用python向钉钉机器人发送可以放大的图片?