python 多线程爬取壁纸网站的示例
作者:Martina_oh 时间:2023-11-14 21:45:30
基本开发环境
· Python 3.6
· Pycharm
需要导入的库
目标网页分析
网站是静态网站,没有加密,可以直接爬取
整体思路:
1、先在列表页面获取每张壁纸的详情页地址
2、在壁纸详情页面获取壁纸真实高清url地址
3、保存地址
代码实现
模拟浏览器请请求网页,获取网页数据
这里只选择爬取前10页的数据
代码如下
import threading
import parsel
import requests
def get_html(html_url):
'''
获取网页源代码
:param html_url: 网页url
:return:
'''
response = requests.get(url=html_url, headers=headers)
return response
def get_par(html_data):
'''
把 response.text 转换成 selector 对象 解析提取数据
:param html_data: response.text
:return: selector 对象
'''
selector = parsel.Selector(html_data)
return selector
def download(img_url, title):
'''
保存数据
:param img_url: 图片地址
:param title: 图片标题
:return:
'''
content = get_html(img_url).content
path = '壁纸\\' + title + '.jpg'
with open(path, mode='wb') as f:
f.write(content)
print('正在保存', title)
def main(url):
'''
主函数
:param url: 列表页面 url
:return:
'''
html_data = get_html(url).text
selector = get_par(html_data)
lis = selector.css('.wb_listbox div dl dd a::attr(href)').getall()
for li in lis:
img_data = get_html(li).text
img_selector = get_par(img_data)
img_url = img_selector.css('.wb_showpic_main img::attr(src)').get()
title = img_selector.css('.wb_pictitle::text').get().strip()
download(img_url, title)
end_time = time.time() - s_time
print(end_time)
if __name__ == '__main__':
for page in range(1, 11):
url = 'http://www.deskbizhi.com/min/list-{}.html'.format(page)
main_thread = threading.Thread(target=main, args=(url,))
main_thread.start()
来源:https://www.cnblogs.com/Martinaoh/p/14321201.html
标签:python,多线程,爬虫,壁纸网站
0
投稿
猜你喜欢
Python 操作mysql数据库查询之fetchone(), fetchmany(), fetchall()用法示例
2023-07-09 00:11:24
php简单浏览目录内容的实现代码
2023-10-25 01:32:43
Python如何合并多个字典或映射
2023-11-07 17:20:51
Python2.x版本中cmp()方法的使用教程
2022-08-19 01:23:40
MySQL transaction事务安全示例讲解
2024-01-25 17:47:38
网页设计配色基础:RGB与HSB
2008-05-06 12:23:00
如何在pycharm中快捷安装pip命令(如pygame)
2023-02-26 14:53:25
Python面向对象之接口、抽象类与多态详解
2021-10-24 10:26:48
Python轻量级web框架bottle使用方法解析
2023-05-29 23:43:48
Python操作sqlite3快速、安全插入数据(防注入)的实例
2022-04-22 16:38:14
解决golang在import自己的包报错的问题
2024-04-25 15:09:19
vue中手机号,邮箱正则验证以及60s发送验证码的实例
2024-04-10 13:50:29
SQL Server中通过reverse取某个最后一次出现的符号后面的内容(字符串反转)
2024-01-23 14:19:39
sqlserver中触发器+游标操作实现
2024-01-25 02:37:11
Tensorflow的梯度异步更新示例
2022-10-04 15:08:23
创建数据表/创建列的一些asp函数
2008-06-24 12:21:00
12个对网页设计师非常有用的图片优化工具[译]
2009-09-22 14:29:00
浅谈pymysql查询语句中带有in时传递参数的问题
2024-01-22 02:16:32
Python configparser模块配置文件过程解析
2023-03-04 09:35:49
Python数据预处理之数据规范化(归一化)示例
2021-11-18 12:08:10