极速下载站 —— 提供优质软件下载服务,感受全新的极速下载体验!

最近更新 | 软件专题 | 软件分类 | 软件排行

您的位置:极速下载站资讯首页软件教程电脑软件教程 → 火车采集器关联多页采集设置

火车采集器关联多页采集设置

时间:2017-04-14 15:29:18  作者:不思议游戏  浏览量:46

火车采集器关联多页采集设置预览图

关联多页

采集的信息不在当前默认页,而在当前默认页某一个链接的所在页时,此时就要用到多页管理了,
多页管理界面如下:
我们以内容页网址 http://kimi201406.1688.com/page/creditdetail.htm 为例,
来获取获取它的公司介绍和联系方式页面的联系方式信息。

公司介绍在网址 http://kimi201406.1688.com/page/creditdetail.htm 里获取, 而联系方式信息在网址 http://kimi201406.1688.com/page/contactinfo.htm 里获取。所以我们需要借助多页功能来实现。
前者叫默认页地址,后者叫做多页地址。
流程:点击①创建多页,进行②多页设置,然后在数据来源③选择多页调用,最后根据多页源代码设置提取方式。

图:关联多页

下面重点讲解②,多页地址获取方式:

a.页面地址替换
b.源码中截取
a.页面地址替换:也就是默认页和多页地址有相同的地方,通过简单的替换就可以变成多页地址。

b.源码中截取:也就是多页的地址在默认页的页面源代码里面。

下面就上述网址来说明下这两种方式如何获取多页。

a.页面地址替换

比较默认页“http://kimi201406.1688.com/page/creditdetail.htm”和多页地址:“http://kimi201406.1688.com/page/contactinfo.htm”之间的共同点,默认页“creditdetail.htm”替换为“contactinfo.htm”就是我们的多页地址了。

设置如下图:

图:关联多页

正则表达式中 (.*) 为任意通配符。
$1,$2…$数字来按照顺序对应上面(.*)表示的部分。
若要对多页源码部分区域做限定,可在指定多页源码区域设置。
若留空则默认返回多页整个源代码。

设置好以后,点击测试查看结果。
b.源码中截取

可以看到默认页源码中有多页地址

图:关联多页

所以设置如下:

图:关联多页

保存即可。

最后设置数据来源和提取方式,如图:

图:关联多页

注:如需要多级多页,则在多页地址获取 方式:选择需要的多页即可

图:关联多页

火车采集器 9.8.0 官方版

火车采集器图片
  • 软件性质:国产软件
  • 授权方式:免费版
  • 软件语言:简体中文
  • 软件大小:23789 KB
  • 下载次数:2977 次
  • 更新时间:2019/4/8 17:01:06
  • 运行平台:WinAll...
  • 软件描述:火车采集器是使用人数比较多的互联网数据挖掘软件。能采集99%的网页,就算网页需要... [立即下载]

相关资讯

相关软件