Java实现网络爬虫入门Demo

本文介绍了一个使用Java实现的基本网页爬虫程序示例。该程序可以抓取指定网站上的URL链接并将其保存到本地文件中。通过正则表达式匹配网页中的URL,此示例适合初学者学习Java爬虫的基础知识。

需求:

抓取一个网页(比如www.lianhehuishang.com)中的url地址,并存到F:\spider_url.txt文件中。


程序:

[java]  view plain  copy
  1. package com.zheng;  
  2.   
  3.   
  4. import java.io.BufferedReader;  
  5. import java.io.FileWriter;  
  6. import java.io.IOException;  
  7. import java.io.InputStreamReader;  
  8. import java.io.PrintWriter;  
  9. import java.net.MalformedURLException;  
  10. import java.net.URL;  
  11. import java.net.URLConnection;  
  12. import java.util.regex.Matcher;  
  13. import java.util.regex.Pattern;  
  14.   
  15. public class WebSpider {  
  16.     public static void main(String[] args) {  
  17.         URL url = null;  
  18.         URLConnection urlconn = null;  
  19.         BufferedReader br = null;  
  20.         PrintWriter pw = null;  
  21.         String regex = "http://[\\w+\\.?/?]+\\.[A-Za-z]+";  
  22.         Pattern p = Pattern.compile(regex);  
  23.         try {  
  24.             url = new URL("http://www.lianhehuishang.com/");  
  25.             urlconn = url.openConnection();  
  26.             pw = new PrintWriter(new FileWriter("f:\\spider_url.txt"), true);  
  27.             br = new BufferedReader(new InputStreamReader(  
  28.                     urlconn.getInputStream()));  
  29.             String buf = null;  
  30.             while ((buf = br.readLine()) != null) {  
  31.                 Matcher buf_m = p.matcher(buf);  
  32.                 while (buf_m.find()) {  
  33.                     pw.println(buf_m.group());  
  34.                 }  
  35.             }  
  36.             System.out.println("获取成功!");  
  37.         } catch (MalformedURLException e) {  
  38.             e.printStackTrace();  
  39.         } catch (IOException e) {  
  40.             e.printStackTrace();  
  41.         } finally {  
  42.             try {  
  43.                 br.close();  
  44.             } catch (IOException e) {  
  45.                 e.printStackTrace();  
  46.             }  
  47.             pw.close();  
  48.         }  
  49.     }  
  50. }  

运行结果:

                                         

打开F:\spider_url.txt


评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值