文档章节

如何用SHELL写好网络爬虫

 月地空间
发布于 2015/05/09 12:40
字数 1477
阅读 43
收藏 0

       上周,老大压下来任务,让写一个网络爬虫,负责爬某一个行业网站的数据信息。由于本人只会 shell 编程语言,其它编程语言从未涉猎,因此就只能硬着头皮用 shell 去写了。

       转眼之前已经过去一周了,一切从无到有,经历的坎坷无数,这里我就不一一吐槽。

       这里呢,我就简单和大家分享下,我个人对,如何用 shell 去写好网络爬虫的几点拙见,希望有想法的朋友联系我一起交流交流想法,没有想法的就看看有精华就吸收走,有糟粕的果断弃之。

       1、你肯定要简单了解下网络爬虫是什么!这个定义在谷歌一搜一大堆,这里我就不拷贝了。

       2、对HTTP协议要有简单了解,比如HTTP协议1.0和1.1的区别、HTTP协议的请求过程、请求报文都包含哪些内容以及一个网页链接是由哪些部分组成的。针对请求报文的内容,是我们网络爬虫抓取的重点。如果你所要爬的网站需要登录用户名和密码,那么cookie就非常重要;如果你所要爬的网站做了防盗链,那么你就需要声明好你是从哪个连接来的,此时referer就非常的重要;如果你所要爬的网站需要传递POST信息,那么你就要对Form Data和Response比较关注才行,等等,这里仅列举几个重要的点。

       3、上面提到了HTTP协议的相关,那么如何把这些信息告知给我们所要爬的目标站点呢?通常我们都是使用游览器做操作的,可是我们现在定义为网络爬虫了,那肯定要脱离人工喽。因此这里我们就要使用到2个命令工具,一个是curl,一个是wget。我个人习惯,对页面内容请求我就使用curl了,对于某些资源下载,比如图片,音频等,我就使用wget去做操作。针对这两个命令,我们所需要重视的是,如何传递cookie,如何传递referer,如何传递POST信息以及如何设置代理信息等这些内容。这里我以curl命令为例,如果我需要传递cookie,那么我就需要用到-b(--cookie)去传递cookie,使用-s(--slient)减少curl页面过程中是不必要的输出信息,使用-e(--referer) 指定从哪个url地址来等等等等,这里不再一一�嗦。针对curl和wget的命令详解,谷歌一搜一大把,这里同样不再拷贝了。

       有以上的知识,就具备了通过命令请求所爬的站点页面信息了,后面所涉及到的就是对所爬信息的筛选、过滤了,以及如何提高爬的速度。

       1、针对数据的筛选、过滤,shell真是太在行了。这一点,我相信大家肯定都清楚。shell编程中常用的文本处理工具,比如grep、sed、awk这三个主要的,以及周边的cut、wc、uniq、sort等等。我们通过将这些工具与正则表达式做结合,可以完美实现对于感兴趣信息选取。针对以上几个工具的用法,不在本篇做叙述。

       2、针对网络爬虫这个整体脚本的构建,这个就需要你的shell编程经验越熟练越好了,因为这个主要对shell脚本整体框架的组建以及各个逻辑之间的组合关联的把握和感知。如果这个地方处理不好,脚本的效率不仅不会高,出错的排障也是不容易的。

       3、针对基于shell的网络爬虫的速度优化,这个还是蛮受上一个点的情况影响了。如果要优化速度,一方面要减少不必要的命令使用,这样能减少磁盘的IO消耗和CPU的效能计算,另一方面我们需要使用 shell 的多线程功能,来提高脚本整体的并发性。

       OK!以上就是我对基于shell的网络爬虫个人拙见。下面再补充几点优化思路!

       1、爬前要分析所爬网站的地域,比如国内还是国外。如果是国外的,就尽量选择国外的服务器(你懂得)不然速度可能让你汗颜!另外,本地绑定所爬网站的固定IP或者选择一个好的DNS服务器也是不错的选择。

       2、在使用shell的多线程功能时,切记要控制住进程数。这个数值要综合考量,一方面要以自身服务器性能为参考依据,另一方面要以所爬站点的承载能力为参考依据,两者缺一不可。一个和谐的数值是需要多次测试求出来的,切记!

       3、为了提高爬虫后期的扩展性,因此框架和变量,这两者一定要灵活,不然脚本就是个死脚本,不方便后期的扩展。          

       虽然shell确实是一个面向过程的编程语言,但是我还是期望能够站在更高的角度去灵活运用它。最后,我个人绝对针对网络爬虫这种东西,使用高级语言比如java、python去写效果应该更好。目前个人,不会高级语言,所以只能用 shell 语言去写,泪奔啊!

       在下一篇博文,我会分享我的爬虫脚本给大家,希望能对大家有所帮助!


本文出自 “Not Only Linux” 博客,请务必保留此出处http://nolinux.blog.51cto.com/4824967/1550976

© 著作权归作者所有

共有 人打赏支持
粉丝 7
博文 58
码字总数 153863
作品 0
广州
系统管理员
私信 提问
mongodb能用编辑器写,然后再统一引用吗

刚学mongodb,只会在shell里面敲,能否用编辑器的文本写好了命令,然后再通过什么地方统一运行呢?如何操作他们呢,麻烦指点一下

gogojxj
2015/05/29
240
4
【Linux学习】如何编写Shell脚本调用企业微信api来发消息给企业微信成员?

版权声明:本文为【欧阳鹏】原创文章,欢迎转载,转载请注明出处! 【http://blog.csdn.net/ouyang_peng】 https://blog.csdn.net/qq446282412/article/details/86495251 一、前言 最近通过p...

欧阳鹏
01/15
0
0
如何用Emacs编译C++代码

版权声明:转载请联系本人,感谢配合!本站地址:http://blog.csdn.net/nomasp https://blog.csdn.net/NoMasp/article/details/52138653 前言 之前做算法题都是在CodeBlocks上写的,为了尽快...

nomasp
2016/08/06
0
0
使用 shell 构建多进程的 CommandlineFu 爬虫

CommandlineFu 是一个记录脚本片段的网站,每个片段都有对应的功能说明和对应的标签。我想要做的就是尝试用 shell 写一个多进程的爬虫把这些代码片段记录在一个 org 文件中。 参数定义 这个脚...

作者: Lujun9972
03/11
0
0
设置 Linux 的 LD_LIBRARY_PATH 变量

在 Linux 下,如果你写好了自己的动态链接库,需要在其它程序里调用,则需要让这些程序能找到这些动态链接库。如果设置不对,会出现类似如下的错误: test: error while loading shared lib...

神勇小白鼠
2012/12/07
0
0

没有更多内容

加载失败,请刷新页面

加载更多

【C++】智能指针简述(四):shared_ptr

  在开始本文内容之前,我们再来总结一下,前文内容:   1.智能指针采用RAII机制,在构造对象时进行资源的初始化,析构对象时进行资源的清理及汕尾.   2.auto_ptr防止拷贝后析构释放同一块内...

shzwork
30分钟前
1
0
作为Java程序员这些技术都不会,拿什么去涨薪跳槽?

引言 当下,正面临着近几年来的最严重的互联网寒冬,听得最多的一句话便是:相见于江湖~,缩减HC、裁员不绝于耳,大家都是人心惶惶,年前如此,年后想必肯定又是一场更为惨烈的江湖厮杀。但博...

别打我会飞
53分钟前
2
0
springboot开发之定时器quartz 定时任务调度(压缩版,抽取quartz的单个任务表实现)

前言 老了, 记不住了, 好记性不如烂笔头; 没想到曾经过目不忘的我, 也有这么一天, 岁月蹉跎,学习一天不如一天 难受 Quartz可以用来做什么? Quartz是一个任务调度框架。比如你遇到这样的问题...

尾生
58分钟前
11
0
技术经理平时都干啥?

「技术主管」是开发团队中的某位程序员需要对一起创建系统的整个开发团队负责时所承担的角色。通常他既要对最终交付的软件系统负责,另外也会像一个程序员一样去开发实现系统。 一个技术主管...

春哥大魔王的博客
今天
7
0
java工作流引擎Jflow流程事件和流程节点事件设置

流程实例的引入和设置 关键词: 开源工作流引擎 Java工作流开发 .net开源工作流引擎 流程事件 工作流节点事件 应用场景: 在一些复杂的业务逻辑流程中需要在某个节点或者是流程结束后做一些业...

ccflow周朋
今天
3
0

没有更多内容

加载失败,请刷新页面

加载更多

返回顶部
顶部