艺术艺术 2021-07-15 11:30 采纳率: 0%
浏览 23

竖版PDF如何识别,有什么开源工具或者解决思路吗?

我需要从一本杂志类PDF文件中,提取所有文章(标题及内容),杂志内容如图:
img
我需要对这种类型的页面进行批量识别,尽量做到能提取出所有文章,但是传统PDF文字识别都是横向识别,无法确定竖向排版
如果我想完成此工作,有什么开源工具或者解决思路吗?
img

  • 写回答

1条回答 默认 最新

  • 砻谷踏碓 2021-07-15 11:41
    关注

    这不叫竖排,叫分栏排版,给你思路:
    1、用工具将pdf导出为一张张的图片
    2、用ps打开任一图片,然后开始录制action
    3、编辑图片,调整高度为原高度3倍,将中栏及右栏内容分别移至左下方,裁切图片宽度到合适,保存图片
    4、停止录制action
    5、ps中运行批处理指定刚才录制action,源文件夹指定你导出的存放图片的文件夹
    6、执行完成后,所有图片已变成单栏排方式
    7、将所有图片拼成一个新的pdf
    8、将pdf导入你的识别工具……

    评论

报告相同问题?

问题事件

  • 创建了问题 7月15日

悬赏问题

  • ¥20 我想使用一些网络协议或者部分协议也行,主要想实现类似于traceroute的一定步长内的路由拓扑功能
  • ¥30 深度学习,前后端连接
  • ¥15 孟德尔随机化结果不一致
  • ¥15 apm2.8飞控罗盘bad health,加速度计校准失败
  • ¥15 求解O-S方程的特征值问题给出边界层布拉休斯平行流的中性曲线
  • ¥15 谁有desed数据集呀
  • ¥20 手写数字识别运行c仿真时,程序报错错误代码sim211-100
  • ¥15 关于#hadoop#的问题
  • ¥15 (标签-Python|关键词-socket)
  • ¥15 keil里为什么main.c定义的函数在it.c调用不了