weixin_55635576 2021-06-01 12:10 采纳率: 75%
浏览 106
已采纳

爬虫时,json里面有html格式内容,该如何提取

  • 写回答

3条回答 默认 最新

  • CSDN专家-HGJ 2021-06-01 12:40
    关注

    先用字典键名取含html代码的那部分值 ,用BeautifulSoup进行解析提取相关数据,用如下代码尝试:

    from bs4 import BeautifulSoup as bs
    #假如返回jason的数据变量名为data
    title=data['data']['trackInfo']['title']
    content = data['data']['trackInfo']['richIntro']
    soup=bs(content,'lxml')
    para=[x.text.strip() for x in soup.select('p')]
    result=title+'\n'+'\n'.join(para)
    print(result)

    如果解答对你有所帮助或启发的话,请点一下采纳。

    本回答被题主选为最佳回答 , 对您是否有帮助呢?
    评论
查看更多回答(2条)

报告相同问题?

悬赏问题

  • ¥15 fluent的在模拟压强时使用希望得到一些建议
  • ¥15 STM32驱动继电器
  • ¥15 Windows server update services
  • ¥15 关于#c语言#的问题:我现在在做一个墨水屏设计,2.9英寸的小屏怎么换4.2英寸大屏
  • ¥15 模糊pid与pid仿真结果几乎一样
  • ¥15 java的GUI的运用
  • ¥15 Web.config连不上数据库
  • ¥15 我想付费需要AKM公司DSP开发资料及相关开发。
  • ¥15 怎么配置广告联盟瀑布流
  • ¥15 Rstudio 保存代码闪退