dabocaiqq 2020-04-23 11:51 采纳率: 63.3%
浏览 156
已采纳

Java语言高分悬赏:怎么提取百度新闻的标题到一个文本文件,可以使用httpclient的方法

Java语言高分悬赏:怎么提取百度新闻的标题到一个文本文件,可以使用httpclient的方法

  • 写回答

2条回答 默认 最新

  • Z_墨脱 2020-04-27 17:34
    关注

    public class News {
    public static void main(String[] args) throws ClientProtocolException, IOException {
    // 创建HttpClient实例
    CloseableHttpClient httpClient = HttpClients.createDefault();
    // 创建httpget实例
    HttpGet httpGet = new HttpGet("https://news.baidu.com/");

        RequestConfig config = RequestConfig.custom()
                .setConnectTimeout(10000)//设置连接超时时间10秒钟,单位毫秒
                .setSocketTimeout(10000) //设置读取超时时间10秒钟
                .build();
        httpGet.setConfig(config);
        // 设置请求头消息User-Agent模拟浏览器
        httpGet.setHeader("User-Agent", "Mozilla/5.0 (Windows NT 6.1; W…) Gecko/20100101 Firefox/59.0");
        // 执行get请求
        CloseableHttpResponse response = httpClient.execute(httpGet);
        // 获取返回实体
        HttpEntity entity = response.getEntity();
        // 实体的内容(编码格式为utf-8)
        String content = EntityUtils.toString(entity, "utf-8");
        // System.out.println("网页内容为: " + content);
    
        // 解析网页 得到文档对象
        Document doc = Jsoup.parse(content);    
    
        Elements hrefElements = doc.select("a[href]");// 选择所有的a元素
        for (Element e : hrefElements) {
            System.out.println("新闻标题:" + e.text());
            System.out.println("新闻地址:" + e.attr("href"));
            System.out.println("------------------------");
        }
    
    }
    

    }

    本回答被题主选为最佳回答 , 对您是否有帮助呢?
    评论
查看更多回答(1条)

报告相同问题?

悬赏问题

  • ¥15 怎么把多于硬盘空间放到根目录下
  • ¥15 Matlab问题解答有两个问题
  • ¥50 Oracle Kubernetes服务器集群主节点无法访问,工作节点可以访问
  • ¥15 LCD12864中文显示
  • ¥15 在使用CH341SER.EXE时不小心把所有驱动文件删除了怎么解决
  • ¥15 gsoap生成onvif框架
  • ¥15 有关sql server business intellige安装,包括SSDT、SSMS。
  • ¥15 stm32的can接口不能收发数据
  • ¥15 目标检测算法移植到arm开发板
  • ¥15 利用JD51设计温度报警系统