m0_57965808 2022-03-03 15:38 采纳率: 91.2%
浏览 25
已结题

一个文库的文本内容可以有几种形式?

最近在尝试爬取某个小文库,遇到一些问题,特来请教;
1 一般来说文库的文本有几种形式呢?据我目前所知的只有有word型式,PPT。请问还有其他格式么?例如PDF格式?
2 在文库源码里有没有说明本文档是什么格式的的标签呢?如果没有的话,判断该怎么爬取这个页面的时候就只能用if else 的排除法了么?或者将爬取失败的页面保存起来,最后单独处理?
3 对于那种同时含有文字和表格或者图片的文档(如下图),如果想要达到一个正常的阅读标准话该如何处理这个情况呢?

img

望各位有识之士不吝赐教,不胜感激。

  • 写回答

1条回答 默认 最新

  • 一键难忘 全栈领域优质创作者 2022-03-04 09:37
    关注

    MS Office文档: doc,docx ppt,pptx xls,xlsx vsd pot pps rtf
    WPS office系列: wps et dps PDF: pdf
    纯文本: txt EPUB: epub

    本回答被题主选为最佳回答 , 对您是否有帮助呢?
    评论

报告相同问题?

问题事件

  • 系统已结题 3月16日
  • 已采纳回答 3月8日
  • 修改了问题 3月3日
  • 创建了问题 3月3日

悬赏问题

  • ¥15 Stata链式中介效应代码修改
  • ¥15 latex投稿显示click download
  • ¥15 请问读取环境变量文件失败是什么原因?
  • ¥15 在若依框架下实现人脸识别
  • ¥15 添加组件无法加载页面,某块加载卡住
  • ¥15 网络科学导论,网络控制
  • ¥15 利用Sentinel-2和Landsat8做一个水库的长时序NDVI的对比,为什么Snetinel-2计算的结果最小值特别小,而Lansat8就很平均
  • ¥15 metadata提取的PDF元数据,如何转换为一个Excel
  • ¥15 关于arduino编程toCharArray()函数的使用
  • ¥100 vc++混合CEF采用CLR方式编译报错