Python实现一键整理百度云盘中重复无用文件

作者:Mr数据杨 时间:2023-09-23 04:33:38 

有没有头疼过百度云盘都要塞满了,可是又没有工具能剔除大量重复无用的文件?这里教你一个简单的方法,通过整理目录的方式来处理我们云盘中无用的文件吧。

Python实现一键整理百度云盘中重复无用文件

获取云盘缓存目录

使用 Everything 找到云盘缓存 db 文件,复制到脚本的目录下。

Python实现一键整理百度云盘中重复无用文件

云盘数据整理

我们发现这个是一个 sqlite3 的文件,用 Navicat 打开先看看。

Python实现一键整理百度云盘中重复无用文件

我们所有云盘的文件以及对应的路径保存在 cache_file 中,直接导出可能会有些问题,所以我们用 pandas 来处理数据就可以了。

Python实现一键整理百度云盘中重复无用文件

云盘数据导出

我的云盘导出来了 40MB 的目录数据,看着都头疼。

Python实现一键整理百度云盘中重复无用文件

数据整理

把云盘的目录数据导出到 excel,后去该怎么处理就怎么处理吧。代码非常少,如果喜欢用 python 处理就用 pandas 处理,如果感觉有困难直接在 excel 中处理就可以了。

import sqlite3
import pandas as pd

file_dict = {}  
con = sqlite3.connect('BaiduYunCacheFileV0.db')
cursor = con.cursor()  
cursor.execute("select * from cache_file")
values = cursor.fetchall()

df = pd.DataFrame(values,columns=["id","fid","parent_path","server_filename","file_size","md5","isdir","category","server_mtime","local_mtime","reserved1","reserved2","reserved3","reserved4","reserved5","reserved6","reserved7","reserved8","reserved9"])
df.to_excel("data.xlsx")

Python实现一键整理百度云盘中重复无用文件

重复文件提取

这个由于百度云盘没有对应的API接口可以使用爬虫的方式进行网页的操作对重复数据进行删除,但是容易误操作,所以还是手动把要处理的数据整理出来然后进行操作把。

通过文件名称判断重复,有了结果后续自己处理就好了。

df["server_filename"].duplicated()

0         False
1         False
2         False
3         False
4         False
         ...  
379563    False
379564    False
379565     True
379566     True
379567    False
Name: server_filename, Length: 379568, dtype: bool

df[df["server_filename"].duplicated()]["server_filename"]
188             WE_rk_nos06.txt
252                   django.po
254                   django.po
255                   django.po
256                   django.po
                 ...          
378517                video.mp4
378518            top_level.txt
378543    Blog_articleinfo.xlsx
379565                     apps
379566              职业培训规划.mmap
Name: server_filename, Length: 152409, dtype: object

来源:https://blog.csdn.net/qq_20288327/article/details/126239991

标签:Python,整理,重复,文件
0
投稿

猜你喜欢

  • Python参数传递实现过程及原理详解

    2021-07-11 20:16:07
  • PHP实现简易计算器功能

    2024-05-11 09:25:27
  • MySQL安全大讲堂:MySQL数据库安全配置

    2009-10-18 11:24:00
  • selenium IDE自动化测试脚本的实现

    2023-06-29 18:46:11
  • pytorch中LN(LayerNorm)及Relu和其变相的输出操作

    2022-05-07 07:19:55
  • 如何在django中实现分页功能

    2021-10-21 03:29:49
  • 群组功能和用户沟通

    2009-07-19 14:07:00
  • asp修改文件和文件夹的名字的代码

    2011-04-11 11:04:00
  • PYTHON实现SIGN签名的过程解析

    2021-08-09 13:29:05
  • jsp页面中获取servlet请求中的参数的办法详解

    2023-06-19 10:52:00
  • pycharm中如何自定义设置通过“ctrl+滚轮”进行放大和缩小实现方法

    2022-03-06 05:52:27
  • Python中datetime常用时间处理方法

    2022-05-03 16:07:06
  • php设计模式 Singleton(单例模式)

    2023-11-20 14:37:50
  • JS实现仿新浪微博发布内容为空时提示功能代码

    2023-08-22 21:52:13
  • 深入了解如何基于Python读写Kafka

    2021-02-13 09:33:09
  • 详解python statistics模块及函数用法

    2021-09-18 00:08:19
  • python读取各种文件数据方法解析

    2021-08-31 09:16:54
  • Python实现子类调用父类的方法

    2023-09-28 12:00:55
  • ASP编程代码:隐藏图片的真实地址

    2008-10-19 17:14:00
  • JavaScript对象学习经验整理

    2024-04-17 10:09:50
  • asp之家 网络编程 m.aspxhome.com