PHP獲取Cookie模擬登陸CURL

要提取google搜索的部分數據,發現google對於軟件抓取它的數據屏蔽的厲害,之前僞造下 USER-AGENT 就能夠抓數據,可是如今卻不行了。利用抓包數據發現,Google 判斷了 cookies,當你沒有cookies的時候,直接 返回 302 跳轉,並且是連續幾十個302跳轉,根本抓不了數據。

所以,在發送搜索命令時,須要先提取 cookies 並保存,而後利用保存下來的這個cookies再次發送搜索命令便可正常抓數據了。這其實和論壇的模擬登陸一個道理,先POST登陸,獲取cookies並保存,而後利用這個cookies訪問就能夠了。php

1、定義Cookie存儲路徑

必須使用絕對路徑html

$cookie_jar = dirname(__FILE__)."/pic.cookie";

 2、獲取Cookie

將cookie存入文件瀏覽器

$url = "http://1.2.3.4/"; $ch = curl_init(); curl_setopt($ch, CURLOPT_URL, $url); curl_setopt($ch, CURLOPT_HEADER, 0); curl_setopt($ch, CURLOPT_RETURNTRANSFER, true); curl_setopt($ch, CURLOPT_COOKIEJAR, $cookie_jar); $content = curl_exec($ch); curl_close($ch);

3、模擬瀏覽器獲取驗證碼

該服務器驗證碼有漏洞,能夠本身指定

取出cookie,一塊兒提交給服務器,讓服務器覺得是瀏覽器打開登錄頁面服務器

$ch = curl_init(); curl_setopt($ch, CURLOPT_URL, 'http://1.2.3.4/getCheckpic.action?rand=6836.185874812305'); curl_setopt($ch, CURLOPT_COOKIEFILE, $cookie_jar); curl_setopt($ch, CURLOPT_HEADER, 0); curl_setopt($ch, CURLOPT_RETURNTRANSFER, 1); $ret = curl_exec($ch); curl_close($ch);

4、POST提交cookie

$post = "name=2&userType=1&passwd=asdf&loginType=1&rand=6836&imageField.x=25&imageField.y=7"; $ch = curl_init(); curl_setopt($ch, CURLOPT_URL, "http://1.2.3.4/loginstudent.action"); curl_setopt($ch, CURLOPT_HEADER, false); curl_setopt($ch, CURLOPT_RETURNTRANSFER,1); curl_setopt($ch, CURLOPT_POSTFIELDS, $post); curl_setopt($ch, CURLOPT_COOKIEFILE, $cookie_jar); $result=curl_exec($ch); curl_close($ch);

5、到指定頁面獲取數據curl

$ch = curl_init(); curl_setopt($ch, CURLOPT_URL, "http://1.2.3.4/accountcardUser.action"); curl_setopt($ch, CURLOPT_HEADER, false); curl_setopt($ch, CURLOPT_HEADER, 0); curl_setopt($ch, CURLOPT_RETURNTRANSFER,0); curl_setopt($ch, CURLOPT_COOKIEFILE, $cookie_jar); $html=curl_exec($ch); // var_dump($html);
curl_close($ch);

原文地址: http://www.php100.com/html/php/lei/2013/0912/6164.html post

相關文章
相關標籤/搜索