-
PHP定时任务通过CURL图片的抓取例子
下文为各位介绍一个PHP定时任务通过CURL图片的抓取例子,希望例子对大家帮助,基本思路就是通过一个URL连接,将所有图片的地址抓取下来,然后循环打开图片,利用文件操作函数下载下来,保存到本地,并且把图片的alt属性也抓取下来,最后将数据保存到自己数据库.
废话不多说,看程序就能明白了,其中,需要用到PHP定时任务和PHP的一个第三方插件simple_html_dom.php 的使用,参考simple_html_dom的下载和使用.
- <?php
- function getLink($url){
- <a href="/tags.php/include/" target="_blank">include</a>_once('simple_html_dom.php');
- $ch = curl_init();
- <a href="/tags.php/curl_setopt/" target="_blank">curl_setopt</a>($ch,CURLOPT_URL,$url);
- curl_setopt($ch,CURLOPT_HEADER,false);
- curl_setopt($ch,CURLOPT_RETURNTRANSFER,1);
- $output = curl_exec($ch);
- curl_close($ch);
- $html = new simple_html_dom();
- $html->load($output);
- $links = array();
- $arr = array();
- $title = array();
- <a href="/tags.php/foreach/" target="_blank">foreach</a>($html->find('a') as $element){
- if( <a href="/tags.php/preg_match/" target="_blank">preg_match</a>('#^\/content_[0-9]+_1\.html$#i',$element->href)){
- array_push($links,'http://www.phpfensi.com'.$element->href);
- array_push($title,$element->title);
- }
- }
- $links = array_values(array_unique($links));
- $title = array_values(array_unique($title));
- $arr['links'] = $links;
- $arr['title'] = $title;
- return $arr;
- }
- function loadimg($url,$dirname){
- include_once('simple_html_dom.php');
- $ch = curl_init();
- curl_setopt($ch,CURLOPT_URL,$url);
- curl_setopt($ch,CURLOPT_HEADER,false);
- curl_setopt($ch,CURLOPT_RETURNTRANSFER,1);
- $output = curl_exec($ch);
- curl_close($ch);
- $html = new simple_html_dom();
- $html->load($output);
- $arr = array();
- foreach($html->find('img[w]') as $element){
- $image = $element->src;
- }
- $data = file_get_contents($image);
- $info = getimagesize($image);//获取图片信息,大小,格式
- switch($info[2]){
- case 1:
- $str = 'gif';
- break;
- case 2:
- $str = 'jpg';
- break;
- case 3:
- $str = 'png';
- break;
- default:
- continue;
- break;
- }
- if($info[1] < 10 || $info[0] < 10) continue;//图片太小,不是有价值的图片,跳过本次循环
- $filename = time().rand(1,999999).'.'.$str;
- if(!is_dir($dirname)){
- mkdir($dirname,0777,true);
- }
- $fp = <a href="/tags.php/fopen/" target="_blank">fopen</a>($dirname.$filename,'w');
- fwrite($fp,$data);
- fclose($fp);
- return $dirname.$filename;
- }
- do{
- set_time_limit(0);
- ignore_user_abort();
- $img = getLink('http://www.phpfensi.com /qutu_1.html');
- $count = count($img['links']);
- $arr = array();
- for($i=0;$i<$count;$i++){
- $arr[]=loadimg($img['links'][$i],'images/');
- }
- $img['url'] = $arr;
- echo '<br/>';
- $img['title'];
- $res = array();
- $len = count($img['title']);
- //重新将数据组装成我们常用的二维数组,方便数据的数据库处理
- for($i=0;$i<$len;$i++){
- $res[$i]['title'] = $img['title'][$i];
- $res[$i]['url'] = $img['url'][$i];
- }
- foreach($res as $item){
- echo '<img src='.$item["url"].'>'.$item["title"].'<br />';
- }
- $interval = 24*3600;
- sleep($interval);
- }while(true);
- ?>
原文链接:http://www.phpfensi.com/php/20150413/9219.html
栏目列表
最新更新
nodejs爬虫
Python正则表达式完全指南
爬取豆瓣Top250图书数据
shp 地图文件批量添加字段
爬虫小试牛刀(爬取学校通知公告)
【python基础】函数-初识函数
【python基础】函数-返回值
HTTP请求:requests模块基础使用必知必会
Python初学者友好丨详解参数传递类型
如何有效管理爬虫流量?
SQL SERVER中递归
2个场景实例讲解GaussDB(DWS)基表统计信息估
常用的 SQL Server 关键字及其含义
动手分析SQL Server中的事务中使用的锁
openGauss内核分析:SQL by pass & 经典执行
一招教你如何高效批量导入与更新数据
天天写SQL,这些神奇的特性你知道吗?
openGauss内核分析:执行计划生成
[IM002]Navicat ODBC驱动器管理器 未发现数据
初入Sql Server 之 存储过程的简单使用
这是目前我见过最好的跨域解决方案!
减少回流与重绘
减少回流与重绘
如何使用KrpanoToolJS在浏览器切图
performance.now() 与 Date.now() 对比
一款纯 JS 实现的轻量化图片编辑器
关于开发 VS Code 插件遇到的 workbench.scm.
前端设计模式——观察者模式
前端设计模式——中介者模式
创建型-原型模式