写了三遍了,心累,不知道为啥发布出去
这个是一个爬虫程序,list传入的url,有三万多个,我要做的是抓取这三万多个页面的邮箱,用正则提取邮箱,但是抓取1900多条就会报内存溢出错误,怎么回事啊,很着急啊
java 内存溢出,循环执行
- 写回答
- 好问题 0 提建议
- 追加酬金
- 关注问题
- 邀请回答
-
2条回答 默认 最新
- 叮咚呛咚呛 2017-09-22 02:17关注
老铁 请不要用字符串截取的方法 用jsoup 可以更加效率,更加简单,更加便于后期的维护
jsoup利用json格式规则抓取网页内容:http://download.csdn.net/download/jkl012789/9949865
jsoup利用json格式规则抓取网页内容带完整例子:http://download.csdn.net/download/jkl012789/9956793解决 无用评论 打赏 举报
悬赏问题
- ¥15 MATLAB动图问题
- ¥15 【提问】基于Invest的水源涵养
- ¥20 微信网友居然可以通过vx号找到我绑的手机号
- ¥15 寻一个支付宝扫码远程授权登录的软件助手app
- ¥15 解riccati方程组
- ¥15 display:none;样式在嵌套结构中的已设置了display样式的元素上不起作用?
- ¥15 使用rabbitMQ 消息队列作为url源进行多线程爬取时,总有几个url没有处理的问题。
- ¥15 Ubuntu在安装序列比对软件STAR时出现报错如何解决
- ¥50 树莓派安卓APK系统签名
- ¥65 汇编语言除法溢出问题