php抓取网站图片的程序

此程序实现了网页源代码捕获,图片链接获取、分析、并将同样的图片链接合并功能,实现了图片抓取功能。利用php强大的网络内容处理函数将指定的网站上的所有图片抓取下来,保存在当前目录下,以下为代码:

  1. <?php 
  2. /*完成网页内容捕获功能*/ 
  3. function get_img_url($site_name){ 
  4.     $site_fd = fopen($site_name"r"); 
  5.     $site_content = ""
  6.     while (!feof($site_fd)) { 
  7.         $site_content .= fread($site_fd, 1024); 
  8.     } 
  9.    /*利用正则表达式得到图片链接*/ 
  10.     $reg_tag = '/<img.*?\"([^\"]*(jpg|bmp|jpeg|gif)).*?>/'
  11.     $ret = preg_match_all($reg_tag$site_content$match_result); 
  12.     fclose($site_fd); 
  13.     return $match_result[1]; 
  14.  
  15. /* 对图片链接进行修正 */ 
  16. function revise_site($site_list$base_site){ 
  17.     foreach($site_list as $site_item) { 
  18.         if (preg_match('/^http/'$site_item)) { 
  19.             $return_list[] = $site_item
  20.         }else
  21.             $return_list[] = $base_site."/".$site_item
  22.     } 
  23.     } 
  24.     return $return_list
  25.  
  26. /*得到图片名字,并将其保存在指定位置*/ 
  27. function get_pic_file($pic_url_array$pos){ 
  28.     $reg_tag = '/.*\/(.*?)$/'
  29.     $count = 0; 
  30.     foreach($pic_url_array as $pic_item){ 
  31.         $ret = preg_match_all($reg_tag,$pic_item,$t_pic_name); 
  32.         $pic_name = $pos.$t_pic_name[1][0]; 
  33.         $pic_url = $pic_item
  34.     print("Downloading ".$pic_url." "); 
  35.         $img_read_fd = fopen($pic_url,"r"); 
  36.         $img_write_fd = fopen($pic_name,"w"); 
  37.         $img_content = ""
  38.         while(!feof($img_read_fd)){ 
  39.             $img_content .= fread($img_read_fd,1024); 
  40.            
  41.         } 
  42.         fwrite($img_write_fd,$img_content); 
  43.         fclose($img_read_fd); 
  44.         fclose($img_write_fd); 
  45.         print("[OK] "); 
  46.     } 
  47.     return 0; 
  48.  
  49. function main(){ 
  50. /* 待抓取图片的网页地址 */ 
  51.     $site_name = "http://image.cn.yahoo.com"
  52.     $img_url = get_img_url($site_name); 
  53.     $img_url_revised = revise_site($img_url$site_name); 
  54.     $img_url_unique = array_unique($img_url_revised); //unique array 
  55.     get_pic_file($img_url_unique,"./");  
  56.  
  57. main(); 
  58. ?> 

此程序还有待完善的地方是,如果图片在网站服务器上不同目录下但文件名是相同的,此时图片有可能是不一样的,但在最后保存时,后面得到的图片会将前面已经保存的图片覆盖掉,如在http://example.com/网站上有图片链接http://example.com/pic/test1.jpg和http://example.com/pic/new/test1.jpg那么在下载时这两张图片只有一张保存,另一张就被覆盖掉,修正的方法是在每次保存前先检索当前目录下是否已有此文件名,有的话对将要保存的图片重新命名即可。 

转载请注明:代码家园 » php抓取网站图片的程序

评论列表(网友评论仅供网友表达个人看法,并不表明本站同意其观点或证实其描述)