帝国cms采集图文教程(中)(2)

时间:2012-03-12 20:26:52 

这一页里除了已经采集到的第1条分页外,还包括了第2,第3,第4,第5,第6,第7,第8,第20条分页,但是第9到第19条分页并没有列出来,这时候我们拿用第1页和第2页的代码来进行对比分析,来确定分页正则:

(1)第1页代码:

(2)第2页代码:

从这两幅图片可以看到他们有着相同的“分页区域开始代码”,“分页链接”格式,“分页区域结束代码”,那么就可以确定“分页区域正则”,“分页链接正则”。

3、取得 分页区域正则([!--smallpageallzz--]):

4、取得 分页链接正则([!--pageallzz--]):

5、为了方便教程显示,newstext我采集了标题而不是采集内容,预览结果:

注意事项:

第一、在第一页的页面HTML代码里,内容分页链接全部列出来的情况下我们使用“全部列出式”。在第一页的页面HTML代码里,内容分页链接没有全部列出来的情况下我们使用“上下页导航式”。

第二、用全部列出式时,采集规则正确但是莫名其妙的出现重复的分页,这时可以利用替换法把它过滤掉(下一讲我们再说)。

第三、用上下页导航式时,老是采到第1页,其他页连个影子都没有见过,这是因为分页区域正则([!--smallpagezz--])截取错误。

第四、用上下页导航式时,可以采集到前几页了,但是接下来这前几页全部重复循环到底,这也是因为分页区域正则([!--smallpagezz--])截取错误,截取范围过大,导致重复截取前几个分页链接。

好的,这一讲就到这里,下一讲我们主要介绍帝国cms采集过滤和替换。

本文由 国外网站大全http://www.kguowai.com/ 原创,转载请注明出处,谢谢!

标签:帝国cms,采集,教程
0
投稿

猜你喜欢

  • 速度速度 提升网站打开速度的七个好办法

    2008-12-15 12:00:00
  • Apache+PHP和Tomcat网页乱码问题

    2009-09-19 20:06:00
  • 最新的SEO优化公式

    2009-02-19 08:51:00
  • 假如哈里·波特会做SEO

    2007-10-29 12:37:00
  • 如果你做站的热情未减 渴望成功 请看这篇文章

    2007-10-12 12:18:00
  • WordPress 3.2中文版本正式发布 不再支持IE6

    2011-07-05 12:33:29
  • 唐骏:盖茨是整个人类的神话

    2008-06-26 13:43:00
  • 工作与业务经验浅谈关于收取PIN码的问题

    2009-03-30 20:20:00
  • 热门搜索词勾勒2007年度另类热点

    2008-04-18 12:04:00
  • 站长需要知道的55条搜索引擎优化绝佳技巧

    2009-03-09 10:28:00
  • 服务器有效防止Asp木马的经验分享

    2010-08-26 18:41:00
  • Godaddy:如何使用Hosting Control Center基于Web的FTP客户端 God

    2010-04-23 12:31:00
  • 回顾我的艰辛网络生涯

    2008-11-25 12:30:00
  • 如何授权web服务器提供安全数据库访问

    2009-07-23 16:36:00
  • 雅虎开放地理信息数据库 允许开发者引用数据

    2008-05-13 12:31:00
  • 图片站要想流量高 首先优化网站页面结构

    2008-12-01 18:33:00
  • 百度收录减少原因分析 百度快照更新心得

    2008-06-10 11:51:00
  • SEO如何做外链-你真的懂得如何有效的做外链么?

    2011-09-05 20:46:12
  • 微软计划推迟Visual Studio 2010发布时间

    2009-12-24 09:07:00
  • 一个应届生的应聘:直飞Google总部

    2007-10-12 18:55:00
  • asp之家 网站运营 m.aspxhome.com