dabocaiqq 2020-04-23 11:51 采纳率: 63%
浏览 156
已采纳

Java语言高分悬赏:怎么提取百度新闻的标题到一个文本文件,可以使用httpclient的方法

Java语言高分悬赏:怎么提取百度新闻的标题到一个文本文件,可以使用httpclient的方法

  • 写回答

2条回答 默认 最新

  • Z_墨脱 2020-04-27 17:34
    关注

    public class News {
    public static void main(String[] args) throws ClientProtocolException, IOException {
    // 创建HttpClient实例
    CloseableHttpClient httpClient = HttpClients.createDefault();
    // 创建httpget实例
    HttpGet httpGet = new HttpGet("https://news.baidu.com/");

        RequestConfig config = RequestConfig.custom()
                .setConnectTimeout(10000)//设置连接超时时间10秒钟,单位毫秒
                .setSocketTimeout(10000) //设置读取超时时间10秒钟
                .build();
        httpGet.setConfig(config);
        // 设置请求头消息User-Agent模拟浏览器
        httpGet.setHeader("User-Agent", "Mozilla/5.0 (Windows NT 6.1; W…) Gecko/20100101 Firefox/59.0");
        // 执行get请求
        CloseableHttpResponse response = httpClient.execute(httpGet);
        // 获取返回实体
        HttpEntity entity = response.getEntity();
        // 实体的内容(编码格式为utf-8)
        String content = EntityUtils.toString(entity, "utf-8");
        // System.out.println("网页内容为: " + content);
    
        // 解析网页 得到文档对象
        Document doc = Jsoup.parse(content);    
    
        Elements hrefElements = doc.select("a[href]");// 选择所有的a元素
        for (Element e : hrefElements) {
            System.out.println("新闻标题:" + e.text());
            System.out.println("新闻地址:" + e.attr("href"));
            System.out.println("------------------------");
        }
    
    }
    

    }

    本回答被题主选为最佳回答 , 对您是否有帮助呢?
    评论
查看更多回答(1条)

报告相同问题?

悬赏问题

  • ¥20 基于spring boot、的scorm
  • ¥15 往复密封问题的两个问题
  • ¥15 DAC函数和STM32
  • ¥15 任务是接收数据并把数据写入DAC7311,这些代码能实现此功能吗
  • ¥15 分析FP -Growth代码运行内存太大而无法运行的原因
  • ¥20 qtcreat 使用msvc编译器开发软件运行时字体锯齿感严重
  • ¥15 为何显示keyerror fruit
  • ¥15 imageware粗糙度表面
  • ¥15 为什么我的uibot导入py模块出错呀。py文件放在了uibot里对应的python文件夹了,卸了重安也不行
  • ¥15 开源或低价数据中台哪个最好