python爬虫基本知识

作者:2048的渣渣 时间:2022-10-10 09:09:34 

爬虫简介

      根据百度百科定义:网络爬虫(又被称为网页蜘蛛,网络机器人,在FOAF社区中间,更经常的称为网页追逐者),是一种按照一定的规则,自动地抓取万维网信息的程序或者脚本。另外一些不常使用的名字还有蚂蚁、自动索引、模拟程序或者蠕虫。     

随着大数据的不断发展,爬虫这个技术慢慢走入人们的视野,可以说爬虫是大数据应运而生的产物,至少我解除了大数据才了解到爬虫这一技术

随着数据的海量增长,我们需要在互联网上选取所需要的数据进行自己研究的分析和实验。这就用到了爬虫这一技术,下面就跟着小编一起初遇python爬虫!

一、请求-响应

在利用python语言实现爬虫时,主要用到了urllib和urllib2两个库。首先用一段代码说明如下:


import urllib
import urllib2
url="http://www.baidu.com"
request=urllib2.Request(url)
response=urllib2.urlopen(request)
print response.read()

我们知道一个网页就是以html为骨架,js为肌肉,css为衣服所构成的。上述代码所实现的功能就是把百度网页的源码爬取到本地。

其中,url为要爬取的网页的网址;request发出请求,response是接受请求后给出的响应。最后用read()函数输出的就是百度网页的源码。

二、GET-POST

两者都是向网页传递数据,最重要的区别是GET方式是直接以链接形式访问,链接中包含了所有的参数,当然如果包含了密码的话是一种不安全的选择,不过你可以直观地看到自己提交了什么内容。

POST则不会在网址上显示所有的参数,不过如果你想直接查看提交了什么就不太方便了,大家可以酌情选择。

POST方式:


import urllib
import urllib2
values={'username':'2680559065@qq.com','Password':'XXXX'}
data=urllib.urlencode(values)
url='https://passport.csdn.net/account/login?from=http://my.csdn.net/my/mycsdn'
request=urllib2.Request(url,data)
response=urllib2.urlopen(request)
print response.read()

GET方式:


import urllib
import urllib2
values={'username':'2680559065@qq.com','Password':'XXXX'}
data=urllib.urlencode(values)
url = "http://passport.csdn.net/account/login"
geturl = url + "?"+data
request=urllib2.Request(geturl)
response=urllib2.urlopen(request)
print response.read()

三、异常处理

处理异常时,用到了try-except语句。


import urllib2
try:
  response=urllib2.urlopen("http://www.xxx.com")
except urllib2.URLError,e:
  print e.reason

总结

以上所述是小编给大家介绍的python爬虫基本知识网站的支持!

来源:http://www.cnblogs.com/zhenpengwang/p/8505860.html

标签:python,爬虫,知识
0
投稿

猜你喜欢

  • Pytorch自定义CNN网络实现猫狗分类详解过程

    2023-10-27 19:51:02
  • 用Css来制作一个漂亮的多选列表框

    2008-05-29 12:45:00
  • Python中利用ItsDangerous快捷实现数据加密

    2022-06-09 23:24:41
  • Python 根据相邻关系还原数组的两种方式(单向构造和双向构造)

    2023-09-24 17:08:06
  • php mysql procedure实现获取多个结果集的方法【基于thinkPHP】

    2023-11-19 08:27:32
  • javascript中实现override,overload和类似c#中的property

    2008-05-16 12:01:00
  • Django中login_required装饰器的深入介绍

    2023-08-22 09:18:28
  • 如何用Python绘制3D柱形图

    2022-12-19 04:22:04
  • python之文件的读写和文件目录以及文件夹的操作实现代码

    2021-05-15 02:55:57
  • Python Json数据文件操作原理解析

    2022-10-27 19:00:32
  • 详解Python如何获取列表(List)的中位数

    2022-02-01 02:35:37
  • 使用Python的networkx绘制精美网络图教程

    2022-10-31 06:52:47
  • 将 html 转成 ubb代码的小脚本

    2013-06-25 07:07:00
  • Python基础之函数嵌套知识总结

    2021-12-07 18:54:09
  • 一文搞懂Python中is和==的区别

    2023-11-15 09:42:27
  • XHTML与HTML之间的7个区别

    2009-05-20 10:13:00
  • python字符串连接方法分析

    2021-12-24 16:27:10
  • django请求返回不同的类型图片json,xml,html的实例

    2021-05-17 10:03:23
  • 最新idea2021最新激活超详细教程

    2023-08-08 01:50:17
  • mysql创建master/slave详细步骤

    2011-05-21 15:29:00
  • asp之家 网络编程 m.aspxhome.com