python爬虫基本知识

作者:2048的渣渣 时间:2022-10-10 09:09:34 

爬虫简介

      根据百度百科定义:网络爬虫(又被称为网页蜘蛛,网络机器人,在FOAF社区中间,更经常的称为网页追逐者),是一种按照一定的规则,自动地抓取万维网信息的程序或者脚本。另外一些不常使用的名字还有蚂蚁、自动索引、模拟程序或者蠕虫。     

随着大数据的不断发展,爬虫这个技术慢慢走入人们的视野,可以说爬虫是大数据应运而生的产物,至少我解除了大数据才了解到爬虫这一技术

随着数据的海量增长,我们需要在互联网上选取所需要的数据进行自己研究的分析和实验。这就用到了爬虫这一技术,下面就跟着小编一起初遇python爬虫!

一、请求-响应

在利用python语言实现爬虫时,主要用到了urllib和urllib2两个库。首先用一段代码说明如下:


import urllib
import urllib2
url="http://www.baidu.com"
request=urllib2.Request(url)
response=urllib2.urlopen(request)
print response.read()

我们知道一个网页就是以html为骨架,js为肌肉,css为衣服所构成的。上述代码所实现的功能就是把百度网页的源码爬取到本地。

其中,url为要爬取的网页的网址;request发出请求,response是接受请求后给出的响应。最后用read()函数输出的就是百度网页的源码。

二、GET-POST

两者都是向网页传递数据,最重要的区别是GET方式是直接以链接形式访问,链接中包含了所有的参数,当然如果包含了密码的话是一种不安全的选择,不过你可以直观地看到自己提交了什么内容。

POST则不会在网址上显示所有的参数,不过如果你想直接查看提交了什么就不太方便了,大家可以酌情选择。

POST方式:


import urllib
import urllib2
values={'username':'2680559065@qq.com','Password':'XXXX'}
data=urllib.urlencode(values)
url='https://passport.csdn.net/account/login?from=http://my.csdn.net/my/mycsdn'
request=urllib2.Request(url,data)
response=urllib2.urlopen(request)
print response.read()

GET方式:


import urllib
import urllib2
values={'username':'2680559065@qq.com','Password':'XXXX'}
data=urllib.urlencode(values)
url = "http://passport.csdn.net/account/login"
geturl = url + "?"+data
request=urllib2.Request(geturl)
response=urllib2.urlopen(request)
print response.read()

三、异常处理

处理异常时,用到了try-except语句。


import urllib2
try:
  response=urllib2.urlopen("http://www.xxx.com")
except urllib2.URLError,e:
  print e.reason

总结

以上所述是小编给大家介绍的python爬虫基本知识网站的支持!

来源:http://www.cnblogs.com/zhenpengwang/p/8505860.html

标签:python,爬虫,知识
0
投稿

猜你喜欢

  • Mysql中复制详细解析

    2024-01-13 20:46:25
  • vue实现移动端轻量日期组件不依赖第三方库的方法

    2024-05-29 22:29:03
  • Vue实现点击显示不同图片的效果

    2024-05-02 17:10:53
  • python中defaultdict用法实例详解

    2022-08-09 17:01:10
  • win7下MySql 5.7安装配置方法图文教程

    2024-01-20 21:04:12
  • ROS  TF坐标变换基本概念及使用案例

    2022-02-01 10:25:35
  • Python设计模式中的创建型工厂模式

    2023-05-09 17:47:02
  • vue3 使用defineAsyncComponent与component标签实现动态渲染组件思路详解

    2024-05-02 16:32:38
  • Python基于paramunittest模块实现excl参数化

    2023-12-27 00:29:02
  • python调用文件时找不到相对路径的解决方案

    2021-08-21 14:38:24
  • python实现全盘扫描搜索功能的方法

    2022-10-29 14:43:57
  • ASP生成静态网页的方法

    2008-02-18 19:20:00
  • Python容器类型公共方法总结

    2022-06-24 23:58:06
  • Python安装whl文件过程图解

    2022-06-22 02:51:26
  • 详解微信小程序开发之下拉刷新 上拉加载

    2024-05-10 13:59:52
  • 使用Python实现文字转语音并生成wav文件的例子

    2021-06-27 03:29:52
  • 使用urllib库的urlretrieve()方法下载网络文件到本地的方法

    2021-11-27 11:21:08
  • 用"表情符号"做植入广告 是否可行呢?

    2009-02-23 13:07:00
  • 解读Python中degrees()方法的使用

    2021-08-21 07:13:24
  • Vue快速实现通用表单验证的方法

    2024-04-09 10:45:06
  • asp之家 网络编程 m.aspxhome.com