火车头采集器采集多页内容的抓取教程

时间：2016-07-20 17:01:24

我们以内容页网址 http://kimi201406.1688.com/page/creditdetail.htm 为例，来获取它的公司介绍和联系方式页面的联系方式信息。

公司介绍在网址 http://kimi201406.1688.com/page/creditdetail.htm 里获取，而联系方式信息在网址http://kimi201406.1688.com/page/contactinfo.htm 里获取。所以我们需要借助多页功能来实现。前者叫默认页地址，后者叫做多页地址。

流程：点击①创建多页，进行②多页设置，然后在数据来源③选择多页调用，最后根据多页源代码设置提取方式。

下面重点讲解②，多页地址的两种获取方式：页面地址替换和源码中截取。

1.页面地址替换：也就是默认页和多页地址有相同的地方，通过简单的替换就可以变成多页地址。

比较默认页“http://kimi201406.1688.com/page/creditdetail.htm”和多页地址：“http: //kimi201406.1688.com/page/contactinfo.htm”之间的共同点，可以发现默认页“creditdetail.htm”替换为“contactinfo.htm”就是我们的多页地址了。

设置如下图：

注：正则表达式中 (.*) 为任意通配符。$1,$2…$数字来按照顺序对应上面(.*)表示的部分。若要对多页源码部分区域做限定，可在指定多页源码区域设置。
若留空则默认返回多页整个源代码。设置好以后，点击测试查看结果即可。

2.源码中截取：也就是多页的地址在默认页的页面源代码里面。

如图，可以看到默认页源码中存在多页地址。

所以设置如下：

测试后如正确则保存即可。最后设置数据来源和提取方式，如图：

注：如需要多级多页，则在多页地址获取方式选择需要的多页即可

这两种获取方式大家掌握了吗，今后在抓取网站时使用火车采集器V9的上述操作就可以很容易地获取到关联的多页地址了，作为一款功能全面的网站抓取精灵，火车采集器一定会充分考虑到用户的使用需求，以及如何最大化实现便利

帝国cms后台插件管理 - 防采集功能详解

一、反采集功能使用说明：&nbs

2296
帝国cms后台采集管理 - 采集功能应用实战

下面跟cms大学小编一起来详细的做一个采集实战，这里是采集新浪的体育频道。第一部分&nbs

1801
帝国cms后台采集管理 - 特殊字段正则处理详解

采集的一些特殊字段说明： 1、“下载地址正则”、“在线观看地址正则”、“图片集正则&rdquo&nbs

1874
帝国cms后台采集管理 - 采集功能常用技巧

采集常用技巧 1、过滤文章&nbs

1423
帝国cms后台采集管理 - 采集功能使用实例详解

本节通过采集简单的页面作为采集教程实例。 &nbs

3105