ykx666 2016-09-01 08:36 采纳率: 0%
浏览 2748

利用MD5进行url去重是怎么实现的,有人做过这方面的工作吗?

我在整理爬虫方面的知识,发现有一个比较棘手的问题,有人说采用这个办法能取得相对来说更好的效果,想请教下各位大神

  • 写回答

4条回答 默认 最新

  • oyljerry 2016-09-01 09:05
    关注

    就是对URL进行MD5计算,然后保存到一个set等中,这样下一个URL来的时候,计算一下MD5,然后看是否在set中,如果在就证明已经爬过这个URL了,就不需要再次爬取

    评论

报告相同问题?

悬赏问题

  • ¥15 写uniapp时遇到的问题
  • ¥15 matlab有限元法求解梁带有若干弹簧质量系统的固有频率
  • ¥15 找一个网络防御专家,外包的
  • ¥100 能不能让两张不同的图片md5值一样,(有尝)
  • ¥15 informer代码训练自己的数据集,改参数怎么改
  • ¥15 请看一下,学校实验要求,我需要具体代码
  • ¥50 pc微信3.6.0.18不能登陆 有偿解决问题
  • ¥20 MATLAB绘制两隐函数曲面的交线
  • ¥15 求TYPCE母转母转接头24PIN线路板图
  • ¥100 国外网络搭建,有偿交流