升鵬 2021-08-13 10:44 采纳率: 50%
浏览 82
已结题

Python如何在对书的图片文字识别后自动返回页数

在文字识别过程中,我识别完成多张书的图片,希望通过查找关键字来找到对应在第几页。例如:10张图片分别对应书中1到10页。经过文字识别生成了txt文件,关键字“项目”在第九页。我想搜索关键字“项目”,然后可以返回页码“9”如何实现呢?
最好用Python3+
百度智能云文字识别
pycharm
难点是无法找到本页页数,同时难以判断它是否是页数。而且,实际应用过程中页码不会有顺序,所以得用图片上的页码,但页码难以识别出来。目前思路是:用图片识别后,用区域识别出页码,然后搜索关键字后,返回对应页码。想问具体如何实现或有更好思路吗

  • 写回答

3条回答 默认 最新

  • CSDN专家-HGJ 2021-08-13 11:07
    关注

    可以借助os模块用字符串判断方式来获取结果,参考代码:

    import os 
    
    for i,fn in enumerate(os.listdir('txts')):
        with open(os.path.join(os.getcwd(),'txts',fn),'r',encoding='utf-8') as f:
            if '项目' in f.read():
                print(i+1)
    
    本回答被题主选为最佳回答 , 对您是否有帮助呢?
    评论
查看更多回答(2条)

报告相同问题?

问题事件

  • 系统已结题 12月6日
  • 已采纳回答 11月28日
  • 修改了问题 8月13日
  • 修改了问题 8月13日
  • 展开全部

悬赏问题

  • ¥15 想编写一个期货跨期套利的程序
  • ¥15 UltraScale 系列 Bitslip 技术支持
  • ¥15 一个线程在sleep的时候set一个信号会起作用吗
  • ¥100 需求高精度PT100设计电路和算法
  • ¥15 单片机配网,继电器开关,广播
  • ¥60 Qcustomplot绘制实时动态曲线
  • ¥20 运用matlab画x-y图
  • ¥15 用idea运行项目,运行tomcat报错:断言失败
  • ¥15 Sqlserver查询链接服务器数据问题
  • ¥15 Bibtex4Word 引用中文文献