PHP 3種方法實現採集網站數據

 

 

什麼叫採集?

就是使用PHP程序,把其餘網站中的信息抓取到咱們本身的數據庫中、網站中。php

 

PHP製做採集的技術:html

從底層的socket到高層的文件操做函數,一共有3種方法能夠實現採集。數據庫

1. 使用socket技術採集:編程

socket採集是最底層的,它只是創建了一個長鏈接,而後咱們要本身構造http協議字符串去發送請求。數組

例如要想獲取這個頁面的內容,http://tv.youku.com/?spm=a2hww.20023042.topNav.5~1~3!2~A,用socket寫以下:瀏覽器

 

[php]  view plain  copy
 
  1. <?php  
  2. //鏈接,$error錯誤編號,$errstr錯誤的字符串,30s是鏈接超時時間  
  3. $fp=fsockopen("www.youku.com",80,$errno,$errstr,30);  
  4. if(!$fp) die("鏈接失敗".$errstr);  
  5.    
  6. //構造http協議字符串,由於socket編程是最底層的,它尚未使用http協議  
  7. $http="GET /?spm=a2hww.20023042.topNav.5~1~3!2~A HTTP/1.1\r\n";   //  \r\n表示前面的是一個命令  
  8. $http.="Host:www.youku.com\r\n";  //請求的主機  
  9. $http.="Connection:close\r\n\r\n";   // 鏈接關閉,最後一行要兩個\r\n  
  10.    
  11. //發送這個字符串到服務器  
  12. fwrite($fp,$http,strlen($http));  
  13. //接收服務器返回的數據  
  14. $data='';  
  15. while (!feof($fp)) {  
  16. $data.=fread($fp,4096);  //fread讀取返回的數據,一次讀取4096字節  
  17. }  
  18. //關閉鏈接  
  19. fclose($fp);  
  20. var_dump($data);  
  21. ?>  

 

打印出的結果以下,包含了返回的頭信息及頁面的源碼:服務器

 

2. 使用curl_一套函數網絡

curl把HTTP協議都封裝成了不少函數,直接傳相應參數便可,下降了編寫HTTP協議字符串的難度。curl

前提:在php.ini中要開啓curl擴展。socket

 

[php]  view plain  copy
 
  1. //生成一個curl對象  
  2. $curl=curl_init();  
  3. //設置URL和相應的選項  
  4. curl_setopt($curl, CURLOPT_URL, "http://www.youku.com");  
  5. curl_setopt($curl, CURLOPT_RETURNTRANSFER, 1);  //將curl_exec()獲取的信息以字符串返回,而不是直接輸出。  
  6. //執行curl操做  
  7. $data=curl_exec($curl);  
  8. var_dump($data);  

打印出的結果以下,只包含頁面的源碼:

 

3. 直接使用file_get_contents(最頂層的)

前提:在php.ini中設置容許打開一個網絡的url地址。

 

 

[php]  view plain  copy
 
  1. //使用file_get_contents()  
  2. $data=file_get_contents("http://www.youku.com");  
  3. var_dump($data);  

 

3種方式的選擇

網絡之間通訊主要使用的是以上三種。其中後兩種用的較多:若是要批量採集大量的數據時使用第二種【CURL】,性能好、穩定。

偶爾發幾個請求發的頻繁不密集時使用第三種。

 

擴展:圖片的防盜鏈如何破?

好比7060網站上的圖片作了防盜鏈:在他的網站中能夠看到圖片,把圖片拿到站外就沒法訪問。

 

原理:在HTTP協議中有一個referer項,表明發這個請求的來源地址,服務器會判斷若是這個請求不是這個網站發來的就會過濾掉這個請求:

 

解決辦法:發HTTP時本身模擬referer便可:

 

擴展:有些要採集數據時時必須先登陸,能夠使用模擬的試模擬在登陸狀態下的採集:

a. 先用瀏覽登陸一下,登陸完,瀏覽器的COOKIE中就會有SESSIONID

b. 發PHP發HTTP協議時,把瀏覽器中的SESSIONID放到PHP的HTTP協議請求裏,這樣就在以登陸的狀態發請求。

總結:全部客戶端發過來的數據均可以被模擬,因此服務器上的程序必需要必要的地方過濾客戶端的數據。

 

何時用以上東西?接口開發時、採集時。

 

2、數據採集

例如我要採集這個url裏的全部美國電影的信息,

http://list.youku.com/category/show/c_96_a_%E7%BE%8E%E5%9B%BD_s_1_d_1_p_3.html

則先要知道電影所在的節點的結構,咱們使用firebug查看。

 

而後開始寫代碼:完整代碼以下

 

[php]  view plain  copy
 
  1. /** 
  2.  * 發一個GET請求獲取數據 
  3.  */  
  4. function get($url)  
  5. {  
  6.    global $curl;  
  7.    // 配置curl中的http協議->可配置的薦能夠查PHP手冊中的curl_  
  8.    curl_setopt($curl, CURLOPT_URL, $url);  
  9.    curl_setopt($curl, CURLOPT_RETURNTRANSFER, TRUE);  
  10.    curl_setopt($curl, CURLOPT_HEADER, FALSE);  
  11.    // 執行這個請求  
  12.    return curl_exec($curl);  
  13. }  
  14.    
  15. // 生成一個curl對象  
  16. $curl = curl_init();  
  17. $url='http://list.youku.com/category/show/c_96_a_%E7%BE%8E%E5%9B%BD_s_1_d_1_p_3.html';  
  18. $data=get($url);  
  19. // 匹配電影所在位置  
  20. $list_preg = '/<li class="yk-col4 mr1">.+<\/li>/Us';  
  21. // 匹配img標籤上的src和alt  
  22. $img_preg = '/<img class="quic" _src="(.*)" src="(.*)" alt="(.*)" \/>/U';  
  23. //匹配電影的url  
  24. $video_preg='/<a href="(.*)" title="(.*)" target="(.*)"><\/a>/U';  
  25. //把全部的li存到$list裏,$list是個二維數組  
  26. preg_match_all($list_preg,$data,$list);  
  27.    //var_dump($list);  
  28. foreach ($list[0] as $k => $v) {   //這裏$v就是每個li標籤  
  29. /* 獲取圖片及電影名稱 
  30.     preg_match($img_preg,$v,$img);  //把匹配到的圖片的信息存到$img裏 
  31.     var_dump($img); 
  32.     */  
  33.     /*獲取電影地址 
  34.     preg_match($video_preg,$v,$video);  //把匹配到的電影的信息存到$video裏 
  35.     var_dump($video); 
  36. */  
  37.     preg_match($img_preg,$v,$img);  
  38.     preg_match($video_preg,$v,$video);  
  39.     echo $img[0].'<a href="'.$video[1].'">'.$video[2].'</a>';  
  40. }  

 

測試:

打印$list;

 

打印$img

 

打印$video

 

 

最終效果:

 

若是須要把圖片拷貝到硬盤上,則在foreach循環里加上如下代碼:

 

[php]  view plain  copy
 
  1. $imgData = get($img[1]);  
  2.    // 把圖片文件寫到硬盤上【下載】  
  3.    // 由於操做系統是GBK的,因此要把UTF8轉成GBK  
  4.    is_dir('./youkuimg/') ? '': mkdir('./youkuimg/');  
  5. file_put_contents('./youkuimg/'.mb_convert_encoding($img[3], 'gbk', 'utf-8').'.jpg', $imgData);  

 

 

效果以下:在當前目錄下的youkuimg目錄下就會有下載好的圖片。

相關文章
相關標籤/搜索