Python即时网络爬虫项目启动说明

2016-9-19 17:02| 发布者: gz51837844| 查看: 5898| 评论: 13|原作者: 集搜客网络爬虫|来自: 集搜客社区

摘要: 我拟定了一个计划:建立一个模块化更强的软件部件,专门解决最耗费精力的内容提取问题。这是一个开放的项目,而且用当前最热的python来做,希望大家能共同参与。 ... ...

作为酷爱编程的老程序员,实在按耐不下这个冲动,Python真的是太火了,不断撩拨我的心。

我是对Python存有戒备之心的,想当年我基于Drupal做的系统,使用php语言,当语言升级了,推翻了老版本很多东西,不得不花费很多时间和精力去移植和升级,至今还有一些隐藏在某处的代码埋着雷。我估计Python也避免不了这个问题(其实这种声音已经不少,比如Python 3 正在毁灭 Python)。

但是,我还是启动了这个Python即时网络爬虫项目。我用C++、Java和Javascript编写爬虫相关程序超过10年,要追求高性能,非C++莫属,同时有完善的标准体系,让你和你的系统十分自信,只要充分测试,就能按照预期的方式运行。在GooSeeker项目中,我们不断向一个方向努力——“收割数据”,而且让广大用户(不仅是专业的数据采集用户)都能体验到收割互联网数据的快感。“收割”的一个重要含义就是大批量。现在,我要启动“即时网络爬虫”,目的是要补充“收割”没有覆盖的场景,我看到的是:

  • 在系统层面:“即时”代表快速部署数据应用系统
  • 在数据流层面:“即时”代表采集数据到数据使用是即时的,单个数据对象可以独自全流程处理,不用等待一批存入数据库,然后从数据库中拿出来用
  • “即时”另一个含义就是网络爬虫是一个嵌入模块,跟整个信息处理系统集成在一起

一众程序员都在玩Python网络爬虫,我拟定了一个计划:建立一个模块化更强的软件部件,专门解决最耗费精力的内容提取问题(有人总结说大数据和数据分析整个链条上,数据准备占了80%工作量,我们不妨延展一下,网络数据抓取的工作量有80%是在为各种网站的各种数据结构编写抓取规则)。

我把他想象成一个小机器(见上图),输入的是原始网页,输出的是提取出来的结构化的内容,这个小机器还有一个可替换部件:将输入转化成输出结构的一个指令块,我们成为“提取器”,让大家不再为调试正则表达式或者XPath而苦恼。

这是一个开放的项目,两年前启动了一个手机上的即时网络爬虫项目,因为是给某商业集团开发的,所以不便开放,同样的思想和方法将开放到这个项目中,而且用当前最热的python来做,希望大家能共同参与。在执行过程中,我们会开放所有资料和成果、已经遇到的坑。

近期做的实验是:

若有疑问可以集搜客网络爬虫

鲜花

握手

雷人

路过

鸡蛋

相关阅读

发表评论

最新评论

评论 xandy 2016-5-6 14:40
评论 mosung 2016-6-25 20:58
楼主好魄力!
评论 806446828 2016-7-19 15:15
期待ing
评论 DK_MySoul 2016-10-22 11:54
顶楼主
评论 xtuisoft 2017-4-9 23:16
发现这个网站就像发现了金矿,楼主太威武了。
评论 maomao 2017-4-9 23:19
xtuisoft 发表于 2017-4-9 23:16
发现这个网站就像发现了金矿,楼主太威武了。

因为资源有限,这个项目没有做完,只做了基础部分,很多api还没有做
评论 luke4java 2017-8-12 16:13
楼主有说到让scrapy 的spider更通用的思路特别好,正好在我的一个项目中用到了。
评论 YuYork 2017-11-9 09:45
楼主大大,如何让我们共同参与呀?
评论 Fuller 2017-11-9 10:01
YuYork 发表于 2017-11-9 09:45
楼主大大,如何让我们共同参与呀?

这个项目暂时搁置了
评论 YuYork 2017-11-9 17:19
Fuller 发表于 2017-11-9 10:01
这个项目暂时搁置了

啊,我看到github上有源码了呀?
评论 Fuller 2017-11-9 17:40
YuYork 发表于 2017-11-9 17:19
啊,我看到github上有源码了呀?

那是一年前的,最近一年没有更多进展
评论 wangyong 2019-11-1 16:17
本帖最后由 wangyong 于 2019-11-1 17:09 编辑

使用快捷采集,不用做规则,输入网址就能采集,快捷采集入口:https://www.gooseeker.com/res/datadiy.html?category=%E7%83%AD%E9%97%A8%E7%BD%91%E7%AB%99&web=%E6%96%B0%E6%B5%AA%E5%BE%AE%E5%8D%9A&rule=%20TA%E7%82%B9%E8%B5%9E%E8%BF%87%E7%9A%84%E5%BE%AE%E5%8D%9A%E6%95%B0%E6%8D%AE
评论 Deeeeex 2023-7-17 23:41

查看全部评论(13)

GMT+8, 2024-4-20 05:51