Python即时网络爬虫项目启动说明详解

作者:fullerhua 时间:2022-11-29 18:09:24 

作为酷爱编程的老程序员,实在按耐不下这个冲动,Python真的是太火了,不断撩拨我的心。

Python即时网络爬虫项目启动说明详解

我是对Python存有戒备之心的,想当年我基于Drupal做的系统,使用php语言,当语言升级了,推翻了老版本很多东西,不得不花费很多时间和精力去移植和升级,至今还有一些隐藏在某处的代码埋着雷。我估计Python也避免不了这个问题(其实这种声音已经不少,比如Python 3 正在毁灭 Python)。 但是,我还是启动了这个Python即时网络爬虫项目。我用C++、Java和Javascript编写爬虫相关程序超过10年,要追求高性能,非C++莫属,同时有完善的标准体系,让你和你的系统十分自信,只要充分测试,就能按照预期的方式运行。在GooSeeker项目中,我们不断向一个方向努力——“收割数据”,而且让广大用户(不仅是专业的数据采集用户)都能体验到收割互联网数据的快感。“收割”的一个重要含义就是大批量。现在,我要启动“即时网络爬虫”,目的是要补充“收割”没有覆盖的场景,我看到的是:

  • 在系统层面:“即时”代表快速部署数据应用系统

  • 在数据流层面:“即时”代表采集数据到数据使用是即时的,单个数据对象可以独自全流程处理,不用等待一批存入数据库,然后从数据库中拿出来用

  • “即时”另一个含义就是网络爬虫是一个嵌入模块,跟整个信息处理系统集成在一起

Python即时网络爬虫项目启动说明详解

        一众程序员都在玩Python网络爬虫,我拟定了一个计划:建立一个模块化更强的软件部件,专门解决最耗费精力的内容提取问题(有人总结说大数据和数据分析整个链条上,数据准备占了80%工作量,我们不妨延展一下,网络数据抓取的工作量有80%是在为各种网站的各种数据结构编写抓取规则)。

        我把他想象成一个小机器(见上图),输入的是原始网页,输出的是提取出来的结构化的内容,这个小机器还有一个可替换部件:将输入转化成输出结构的一个指令块,我们成为“提取器”,让大家不再为调试正则表达式或者XPath而苦恼。

        这是一个开放的项目,两年前启动了一个手机上的即时网络爬虫项目,因为是给某商业集团开发的,所以不便开放,同样的思想和方法将开放到这个项目中,而且用当前最热的python来做,希望大家能共同参与。在执行过程中,我们会开放所有资料和成果、已经遇到的坑。

近期做的实验是

python使用xslt提取网页数据
Python爬虫使用Selenium+PhantomJS抓取Ajax和动态HTML内容

来源:http://blog.csdn.net/fullerhua/article/details/51381958

标签:Python,爬虫
0
投稿

猜你喜欢

  • 你还在 Select * 吗?

    2024-01-24 22:10:50
  • 使用 XML HTTP Request 对象[翻译]

    2007-11-07 21:11:00
  • 先学会为自己做设计

    2008-06-01 16:32:00
  • 利用Vue实现一个markdown编辑器实例代码

    2024-04-30 10:39:19
  • Python使用shutil模块实现文件拷贝

    2021-02-01 14:46:28
  • 让SQL Server数据库自动执行管理任务(二)

    2009-03-20 11:40:00
  • python图片合成的示例

    2023-11-17 17:09:36
  • python无限生成不重复(字母,数字,字符)组合的方法

    2021-02-15 14:08:49
  • Python深度学习pytorch神经网络图像卷积运算详解

    2021-08-04 12:19:49
  • Python中用于去除空格的三个函数的使用小结

    2022-02-07 23:43:45
  • numpy中hstack vstack stack concatenate函数示例详解

    2023-02-22 19:39:06
  • 判断python字典中key是否存在的两种方法

    2023-08-19 00:18:05
  • 设计地址栏透明icon图标方法

    2008-10-25 16:42:00
  • Python实现敏感词过滤的4种方法

    2021-10-01 06:21:08
  • Python验证的50个常见正则表达式

    2023-07-11 02:58:57
  • python爬虫获取京东手机图片的图文教程

    2023-12-24 08:29:21
  • Django查询数据库的性能优化示例代码

    2024-01-22 22:18:48
  • XML正在接管Web服务 成为SOA的基础

    2008-09-05 17:21:00
  • Python闭包执行时值的传递方式实例分析

    2021-09-22 14:43:50
  • SQL Server本地时间和UTC时间的相互转换实现代码

    2024-01-21 06:35:33
  • asp之家 网络编程 m.aspxhome.com