sofudage 2023-03-27 13:35 采纳率: 50%
浏览 29
已结题

python爬虫下载PDF失败

开发了自己的小工具,依据sci-hub平台批量下载文献,大部分文章都能顺利下载。有个别文章下载异常。程序分两步:1、用DOI号进行一次request请求,得到下载链接dl_url;2、根据下载链接dl_url发送request请求,得到pdf文章的内容content,随后二进制写入文档。
程序下载的结果如图:

img

为一个空白文件,后缀改为.pdf打开,也是异常。


```python
DOI = '10.1617/s11527-007-9226-0'
mingzi = 'Textile reinforced mortar (TRM) versus FRP as strengthening material of URM walls: out-of-plane cyclic loading'
mulu = r"C:\Users\C\Desktop"

headers = {
        'user-agent': '浏览器user-agent',
        'cookie':'浏览器cookie'
    }
url = 'https://sci-hub.st/'
zong_url = url + DOI
r = requests.get(zong_url, headers=headers)
html = BeautifulSoup(r.text, 'html.parser')
weizhui = html.find('button')['onclick'][14:].replace('\'', '')
if 'sci-hub.st' in weizhui:
    dl_url = 'https:' + weizhui
else:
    dl_url = 'https://sci-hub.st' + weizhui
#这一步得到的dl_url在浏览器中输入可以正常下载,但是代码中下载异常
#这一步得到的dl_url为:https://moscow.sci-hub.st/1136/953c6f7d5defb1c69b86a69b2f0499d9/papanicolaou2007.pdf?download=true

#存入文档
myfile = requests.get(dl_url, headers=headers)
dizhi = mulu + r"\{}.pdf".format(mingzi)
with open(dizhi, 'wb') as f:
    f.write(myfile.content)

  • 写回答

3条回答 默认 最新

  • sofudage 2023-03-27 14:35
    关注

    感谢两位。我刚刚分析了一下所有下载异常的文件,名字中都有冒号:,replace替换后现在可以下载了。

    本回答被题主选为最佳回答 , 对您是否有帮助呢?
    评论
查看更多回答(2条)

报告相同问题?

问题事件

  • 系统已结题 4月4日
  • 已采纳回答 3月27日
  • 修改了问题 3月27日
  • 创建了问题 3月27日

悬赏问题

  • ¥20 docker里部署springboot项目,访问不到扬声器
  • ¥15 netty整合springboot之后自动重连失效
  • ¥15 悬赏!微信开发者工具报错,求帮改
  • ¥20 wireshark抓不到vlan
  • ¥20 关于#stm32#的问题:需要指导自动酸碱滴定仪的原理图程序代码及仿真
  • ¥20 设计一款异域新娘的视频相亲软件需要哪些技术支持
  • ¥15 stata安慰剂检验作图但是真实值不出现在图上
  • ¥15 c程序不知道为什么得不到结果
  • ¥40 复杂的限制性的商函数处理
  • ¥15 程序不包含适用于入口点的静态Main方法