请叫我江同学呀 2023-04-13 10:18 采纳率: 55.6%
浏览 17
已结题

如何使用python将pdf解析成xml或者html

pdf文件是来自ietf的rfc文档,pdf文件数据如图一。
我需要实现的功能是将pdf解析成xml或html,从而取出文章中的各种部分的信息。单从内容来看,内容有点像是xml格式,但是我无法使用xml.etree来解析。
我目前使用的是fitz,但是解析出来的html效果如图二所示,pdf文件中所有标签的属性均消失了,只剩下了文本内容。这样解析出来的内容,我很难去定位信息位置。
所以,请问一下,该如何将这种样子的pdf文件解析成xml或者html文件(最好直接沿用原先的标签名和属性)?

img

img

  • 写回答

1条回答 默认 最新

  • 「已注销」 2023-04-13 14:41
    关注

    这要看里面是什么内容了

    评论

报告相同问题?

问题事件

  • 已结题 (查看结题原因) 6月28日
  • 创建了问题 4月13日

悬赏问题

  • ¥30 模拟电路 logisim
  • ¥15 PVE8.2.7无法成功使用a5000的vGPU,什么原因
  • ¥15 is not in the mmseg::model registry。报错,模型注册表找不到自定义模块。
  • ¥15 安装quartus II18.1时弹出此error,怎么解决?
  • ¥15 keil官网下载psn序列号在哪
  • ¥15 想用adb命令做一个通话软件,播放录音
  • ¥30 Pytorch深度学习服务器跑不通问题解决?
  • ¥15 部分客户订单定位有误的问题
  • ¥15 如何在maya程序中利用python编写领子和褶裥的模型的方法
  • ¥15 Bug traq 数据包 大概什么价