529656407 2015-01-08 04:01 采纳率: 80%
浏览 1786
已采纳

nutch TopN 50万 depth 10 获取到6万多数据

我用nutch1.9搜索阿里巴巴的网站,使用的是bin/crawl 脚本执行的,topN设置的50万,爬行深度设置的10,url过滤只允许阿里巴巴的网站,但是实际搜出来的结果却只有6万多,又人知道大概是什么原因吗困扰了好几天了。。。。。求教

  • 写回答

2条回答 默认 最新

  • oyljerry 2015-01-08 14:51
    关注

    网站发现你爬虫,ban了你的请求

    本回答被题主选为最佳回答 , 对您是否有帮助呢?
    评论
查看更多回答(1条)

报告相同问题?