Python3使用requests包抓取并保存网页源码的方法

作者:小谈博客 时间:2022-05-27 06:48:38 

本文实例讲述了Python3使用requests包抓取并保存网页源码的方法。分享给大家供大家参考,具体如下:

使用Python 3的requests模块抓取网页源码并保存到文件示例:


import requests
html = requests.get("http://www.baidu.com")
with open('test.txt','w',encoding='utf-8') as f:
f.write(html.text)

这是一个基本的文件保存操作,但这里有几个值得注意的问题:

1.安装requests包,命令行输入pip install requests即可自动安装。很多人推荐使用requests,自带的urllib.request也可以抓取网页源码

2.open方法encoding参数设为utf-8,否则保存的文件会出现乱码。

3.如果直接在cmd中输出抓取的内容,会提示各种编码错误,所以保存到文件查看。

4.with open方法是更好的写法,可以自动操作完毕后释放资源。

另一个例子:


import requests
ff = open('testt.txt','w',encoding='utf-8')
with open('test.txt',encoding="utf-8") as f:
for line in f:
ff.write(line)
ff.close()

这是演示读取一个txt文件,每次读取一行,并保存到另一个txt文件中的示例。

因为在命令行中打印每次读取一行的数据,中文会出现编码错误,所以每次读取一行并保存到另一个文件,这样来测试读取是否正常。(注意open的时候制定encoding编码方式)

转自:小谈博客 http://www.tantengvip.com/2015/05/requests-html/

希望本文所述对大家Python程序设计有所帮助。

标签:Python3,requests
0
投稿

猜你喜欢

  • asp分段插入数据库

    2010-07-02 13:13:00
  • Matplotlib条形图之分组条形图和堆叠条形图详解

    2021-08-10 15:16:24
  • Python_LDA实现方法详解

    2021-06-29 11:43:18
  • Oracle 数据表分区的策略

    2010-07-21 13:30:00
  • 已安装tensorflow-gpu,但keras无法使用GPU加速的解决

    2021-08-15 12:17:42
  • Pycharm添加虚拟解释器报错问题解决方案

    2022-05-28 04:07:53
  • 跟老齐学Python之关于类的初步认识

    2022-11-04 15:49:36
  • 利用python实现简单的循环购物车功能示例代码

    2021-05-12 14:52:58
  • MySQL中触发器入门简单实例与介绍

    2024-01-17 15:02:30
  • Python imutils 填充图片周边为黑色的实现

    2021-04-13 04:06:32
  • MySQL8设置自动创建时间和自动更新时间的实现方法

    2024-01-17 08:02:44
  • 利用python库在局域网内传输文件的方法

    2021-01-29 03:41:48
  • Python实现迪杰斯特拉算法过程解析

    2022-08-14 09:55:42
  • 深入分析JavaScript 事件循环(Event Loop)

    2024-04-18 10:51:52
  • 详谈构造函数加括号与不加括号的区别

    2024-06-15 23:06:44
  • Go语言集成开发环境之VS Code安装使用

    2023-08-29 13:06:38
  • 如何查看SQLSERVER中某个查询用了多少TempDB空间

    2024-01-16 06:40:21
  • go语言数据类型之字符串string

    2024-04-26 17:19:52
  • Pyqt助手安装PyQt5帮助文档过程图解

    2021-01-31 00:34:06
  • python制作抖音代码舞

    2021-09-05 21:51:00
  • asp之家 网络编程 m.aspxhome.com