Python爬虫之爬取二手房信息

作者:世界的隐喻 时间:2021-08-11 19:40:50 

前言

说到二手房信息,不知道你们心里最先跳出来的公司(网站)是什么,反正我心里第一个跳出来的是网站是 58 同城。哎呦,我这暴脾气,想到就赶紧去干。

但很显然,我失败了。说显然,而不是不幸,这是因为 58 同城是大公司,我这点本事爬不了数据是再正常不过的了。下面来看看 58 同城的反爬手段了。这是我爬取下来的网页源码。

Python爬虫之爬取二手房信息

我们看到爬取下来的源码有很多英文大写字母和数字是网页源码中没有的,后来我了解到 58 同城对自己的网站的源码进行了文本加密,所以就出现了我爬取到的情况。

爬取二手房信息

我打开 58 同城的 robots 协议。

Python爬虫之爬取二手房信息

好家伙,不愧是大公司,所有的 * 址都不让爬取,打扰了。我只好转头离开,去寻找可以让我这种小白爬取的二手房网站。于是我找到了c21网站,不知道是我的原因,还是别的原因,反正我是没有找到这个网站的 robots 协议。不管了,既然没找到,就默认没有吧,直接开始爬取。

我本来打算通过二手房的目录跳到一个具体信息,然后爬取二手房的一些基本信息和属性。

Python爬虫之爬取二手房信息
Python爬虫之爬取二手房信息

像我红笔圈起来的部分。但很可惜我失败了,后来我看了看红笔圈起来的部分的爬取到的源码。

Python爬虫之爬取二手房信息

好家伙,还可以这样。不过这怎么可以难倒机智的我?(其实我真不知道怎么解决它)。没关系,之前的源码里不是有类似的信息吗?我只好将就一下了。

Python爬虫之爬取二手房信息

然后是翻页。翻页问题很好解决,我们很快就发现网页都是 https://bj.c21.com.cn/ershoufang/pg2/。其中的页数和 pg 后面的数字有关。

然后就是分析这些数据源码的位置了。

Python爬虫之爬取二手房信息

首先,我们发现我们要爬取的数据全在 li 标签里,所以我们可以先获得 li 标签的列表。伪代码就像这样。


form lxml import etree
……   ……
tree = etree.HTML(源码)
li_list = tree.xpath( li 标签的路径)

这时候我们获得的就是 li 标签的 etree 的类,可以继续使用 etree 类里的函数。然后我们就可以利用 for 循环提出不同房源的 li 标签,根据自己的需要获取文本信息。

欧克,了解了这些(感觉源码前前后后就是四个字 ”我是菜鸡“ )我们就可以开始写代码了。


import requests
from lxml import etree
import re

if __name__ == "__main__":
   # UA伪装
   header = {
       "user-agent": "Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/90.0.4430.72 Safari/537.36"
       }

for pg in range(1, 3): # 翻两页
       # 指定 url
       url = "https://bj.c21.com.cn/ershoufang/pg%s/" % str(pg)

# 获取网页源码
       page = requests.get(url = url, headers = header).text

# xpath 解析
       tree = etree.HTML(page)
       li_list = tree.xpath('//ul[@id="availability"]/li')
       for li in li_list:
           title = li.xpath('div[2]/div/a/text()')[0] # 房子的名称
           # print(title[0]) # 测试
           add = li.xpath('div[2]/div/p//a/text()') # 地址
           add = add[-2: ] + add[0:1] # 地址范围由大到小
           # print(add) # 测试
           div_list = li.xpath('div[2]/div[2]/div')
           # 具体信息
           message_list = ["建筑面积", "房屋户型", "房屋朝向", "所在楼层", "装修情况", "建成时间"]
           for i in range(6):
               div = div_list[i]
               message = div.xpath('span/text()')[0]
               message = re.sub("\s", "", str(message)) # 因为发现获取的文本有很多换行符和空格,所以需要去掉
               message = re.sub("\\n", "", str(message))
               message_list[i] = message_list[i] + ":" + message
           # print(message_list) # 测试
           # 交通情况
           traffic = li.xpath('div[2]/div[4]//text()')
           # print(traffic) # 测试
           # 价格情况
           price = li.xpath('div[2]/div[3]//text()')
           price = price[0] + price[1]
           # print(price) # 测试
           with open("C:\\Users\\ASUS\\Desktop\\CSDN\\数据解析\\xpath\\二手房\\" + "二手房.txt", "a", encoding = "utf-8") as fp:
               fp.write(title + "\n")
               for message in message_list:
                   fp.write(message + "\n")
               if traffic == []:
                   fp.write("交通情况:无介绍" + "\n")
               else:
                   fp.write("交通情况:" + traffic[0] + "\n")
               fp.write("价格:" + price + "\n\n")
           print(title, "下载完成!!!")

print("over!!!")

爬取结果

最后的运行结果就像这样

Python爬虫之爬取二手房信息

来源:https://blog.csdn.net/ShiJieDeYinYu/article/details/116138179

标签:Python,爬取,二手房,信息
0
投稿

猜你喜欢

  • Pycharm中的下载安装、配置与测试方式

    2023-11-18 01:53:27
  • 基于Django框架利用Ajax实现点赞功能实例代码

    2022-01-29 02:35:38
  • Golang中的int类型和uint类型到底有多大?

    2024-04-25 15:04:44
  • js关于 byval 与 byref 的区别

    2007-10-13 10:48:00
  • golang结构体与json格式串实例代码

    2024-04-27 15:36:44
  • nodejs检测因特网是否断开的解决方案

    2024-05-13 10:04:25
  • JAVASCRIPT实现的WEB页面跳转以及页面间传值方法

    2023-08-23 04:56:09
  • python实现的汉诺塔算法示例

    2023-09-21 11:28:17
  • Mysql常用sql语句汇总

    2024-01-21 04:31:48
  • 深入理解Python对Json的解析

    2023-10-18 20:01:38
  • 使用js 设置url参数

    2024-04-28 09:50:48
  • 浅谈JavaScript函数参数的可修改性问题

    2024-05-02 17:20:29
  • Python的argparse库使用详解

    2023-06-13 11:27:36
  • python爬虫之快速对js内容进行破解

    2022-05-28 13:50:16
  • Python图像处理之图像的缩放、旋转与翻转实现方法示例

    2023-03-09 11:25:20
  • SQLite数据库管理相关命令的使用介绍

    2024-01-27 12:41:00
  • 解决Django中checkbox复选框的传值问题

    2023-09-11 17:15:22
  • 理解python中装饰器的作用

    2022-01-29 07:58:01
  • python 密码验证(滑块验证)

    2021-01-24 02:32:18
  • 基于Python实现智能停车场车牌识别计费系统

    2021-05-23 07:44:22
  • asp之家 网络编程 m.aspxhome.com