python 多线程爬取壁纸网站的示例

作者:Martina_oh 时间:2023-11-14 21:45:30 

基本开发环境

· Python 3.6

· Pycharm

需要导入的库

python 多线程爬取壁纸网站的示例

目标网页分析

python 多线程爬取壁纸网站的示例

网站是静态网站,没有加密,可以直接爬取

python 多线程爬取壁纸网站的示例

python 多线程爬取壁纸网站的示例

python 多线程爬取壁纸网站的示例

整体思路:

1、先在列表页面获取每张壁纸的详情页地址

2、在壁纸详情页面获取壁纸真实高清url地址

3、保存地址

代码实现

模拟浏览器请请求网页,获取网页数据

 python 多线程爬取壁纸网站的示例

这里只选择爬取前10页的数据

代码如下


import threading
import parsel
import requests

def get_html(html_url):
'''
获取网页源代码
:param html_url: 网页url
:return:
'''
response = requests.get(url=html_url, headers=headers)
return response

def get_par(html_data):
'''
把 response.text 转换成 selector 对象 解析提取数据
:param html_data: response.text
:return: selector 对象
'''
selector = parsel.Selector(html_data)
return selector

def download(img_url, title):
'''
保存数据
:param img_url: 图片地址
:param title: 图片标题
:return:
'''
content = get_html(img_url).content
path = '壁纸\\' + title + '.jpg'
with open(path, mode='wb') as f:
 f.write(content)
 print('正在保存', title)

def main(url):
'''
主函数
:param url: 列表页面 url
:return:
'''
html_data = get_html(url).text
selector = get_par(html_data)
lis = selector.css('.wb_listbox div dl dd a::attr(href)').getall()
for li in lis:
 img_data = get_html(li).text
 img_selector = get_par(img_data)
 img_url = img_selector.css('.wb_showpic_main img::attr(src)').get()
 title = img_selector.css('.wb_pictitle::text').get().strip()
 download(img_url, title)
end_time = time.time() - s_time
print(end_time)

if __name__ == '__main__':
for page in range(1, 11):
 url = 'http://www.deskbizhi.com/min/list-{}.html'.format(page)
 main_thread = threading.Thread(target=main, args=(url,))
 main_thread.start()

来源:https://www.cnblogs.com/Martinaoh/p/14321201.html

标签:python,多线程,爬虫,壁纸网站
0
投稿

猜你喜欢

  • Python 操作mysql数据库查询之fetchone(), fetchmany(), fetchall()用法示例

    2023-07-09 00:11:24
  • php简单浏览目录内容的实现代码

    2023-10-25 01:32:43
  • Python如何合并多个字典或映射

    2023-11-07 17:20:51
  • Python2.x版本中cmp()方法的使用教程

    2022-08-19 01:23:40
  • MySQL transaction事务安全示例讲解

    2024-01-25 17:47:38
  • 网页设计配色基础:RGB与HSB

    2008-05-06 12:23:00
  • 如何在pycharm中快捷安装pip命令(如pygame)

    2023-02-26 14:53:25
  • Python面向对象之接口、抽象类与多态详解

    2021-10-24 10:26:48
  • Python轻量级web框架bottle使用方法解析

    2023-05-29 23:43:48
  • Python操作sqlite3快速、安全插入数据(防注入)的实例

    2022-04-22 16:38:14
  • 解决golang在import自己的包报错的问题

    2024-04-25 15:09:19
  • vue中手机号,邮箱正则验证以及60s发送验证码的实例

    2024-04-10 13:50:29
  • SQL Server中通过reverse取某个最后一次出现的符号后面的内容(字符串反转)

    2024-01-23 14:19:39
  • sqlserver中触发器+游标操作实现

    2024-01-25 02:37:11
  • Tensorflow的梯度异步更新示例

    2022-10-04 15:08:23
  • 创建数据表/创建列的一些asp函数

    2008-06-24 12:21:00
  • 12个对网页设计师非常有用的图片优化工具[译]

    2009-09-22 14:29:00
  • 浅谈pymysql查询语句中带有in时传递参数的问题

    2024-01-22 02:16:32
  • Python configparser模块配置文件过程解析

    2023-03-04 09:35:49
  • Python数据预处理之数据规范化(归一化)示例

    2021-11-18 12:08:10
  • asp之家 网络编程 m.aspxhome.com