由于需要,要写一个简单的PHP采集程序,照例是到网上找了一堆教程,然后照猫画虎,可是发现网上的教程全是似是而非,没有一个真正能用的。苦想了几天,终于弄明白了里面的道理。在这里写出来,请高手指正。

采集程序的思路很简单,无非就是先打一个页面,一般都是列表页,取得里面全部链接的地址,然后打开逐条链接,寻找我们感兴趣的东西,如果找到,就把它入库或别的处理。下面以一个很简单的例子来说说。

首先确定一个采集页,一般就是列表面了。这里目标是:http://www.php100.com/article/11/index.htm。这是一个列表页,我们的目的就是采集这个列表页上全部的文章。有列表页了,第一步先打开它,把它的内容纳入到我们的程序中来。一般用fopen或是file_get_contents这两个函数,我们这里用fopen作例子。怎么打开它呢?很简单:$source=fopen(");实际上已经把内容纳入到我们的程序中来了。注意得到的$source是一个资源,不是可处理的文本,所以再用函数fread将内容读到一个变量中,这次就是真正的可编辑的文本了。例子:

$content=fread($source,99999);后面的数字表示字节数,填个大的就行。你用file_put_contents将$content写入到一个文本文件,可以看出里面的内容其实就是网页的源码。得到了网页的源码,我们就要分析里面的文章链接地址,这里要用到正则表达式了,[推荐正则表达式教程(http://www.php100.com/article/7/all/545.1.htm)]。通过查看源代码,我们可以看到里面文章的链接地址全是这个样子<div class="in_arttitle"><a href="http://www.php100.com/article/10/all/273.1.htm">  将数据库连接代码封装在函数里,在需要读取时调用..</a>

我们就可以写正则表达式了,这里正则表达式大家要注意了,现在网上有分享的过程到这步一般是执行不了的,因为正则表达式的问题,我也是尝试了很多次 出现错误后才意识到的,这里的正则应该这样写,外面是双引号的情况下里面的双引号需要用"\"和"<\/a>"需要转义处理:$count=preg_match_all("/<div class=\"in_arttitle\"><a href=\"(.*)\">(.*)<\/a>/iUs",$content,$art_list); 外面是单引号的情况:$count=preg_match_all('/<div class="in_arttitle"><a href="(.*)">(.*)<\/a>/iUs',$content,$art_list); 这里处理后的$art_list是一个二维数组,大家可以打印出来 加深理解

其中二维数组$art_list[1]里面包含的就是某个文章的链接地址。而$art_list[2]包含的就是某一文章的标题。到了这一步就可以算成功了一半了,这里已经是二维数组下面大家可以用foreach循环出来想要的地址或标题。

例如:

foreach ( $art_list[1] as $key=>$val ){

           echo $val.'---'.$art_list[2][$key];

}

到这里大家就可以看到自己想要的数据,然后再进行您需要的处理 入库或其他。