我需要从一本杂志类PDF文件中,提取所有文章(标题及内容),杂志内容如图:
我需要对这种类型的页面进行批量识别,尽量做到能提取出所有文章,但是传统PDF文字识别都是横向识别,无法确定竖向排版
如果我想完成此工作,有什么开源工具或者解决思路吗?
竖版PDF如何识别,有什么开源工具或者解决思路吗?
- 写回答
- 好问题 0 提建议
- 追加酬金
- 关注问题
- 邀请回答
-
1条回答 默认 最新
- 砻谷踏碓 2021-07-15 11:41关注
这不叫竖排,叫分栏排版,给你思路:
1、用工具将pdf导出为一张张的图片
2、用ps打开任一图片,然后开始录制action
3、编辑图片,调整高度为原高度3倍,将中栏及右栏内容分别移至左下方,裁切图片宽度到合适,保存图片
4、停止录制action
5、ps中运行批处理指定刚才录制action,源文件夹指定你导出的存放图片的文件夹
6、执行完成后,所有图片已变成单栏排方式
7、将所有图片拼成一个新的pdf
8、将pdf导入你的识别工具……解决 无用评论 打赏 举报
悬赏问题
- ¥20 我想使用一些网络协议或者部分协议也行,主要想实现类似于traceroute的一定步长内的路由拓扑功能
- ¥30 深度学习,前后端连接
- ¥15 孟德尔随机化结果不一致
- ¥15 apm2.8飞控罗盘bad health,加速度计校准失败
- ¥15 求解O-S方程的特征值问题给出边界层布拉休斯平行流的中性曲线
- ¥15 谁有desed数据集呀
- ¥20 手写数字识别运行c仿真时,程序报错错误代码sim211-100
- ¥15 关于#hadoop#的问题
- ¥15 (标签-Python|关键词-socket)
- ¥15 keil里为什么main.c定义的函数在it.c调用不了