Python实现一键整理百度云盘中重复无用文件
作者:Mr数据杨 时间:2023-09-23 04:33:38
有没有头疼过百度云盘都要塞满了,可是又没有工具能剔除大量重复无用的文件?这里教你一个简单的方法,通过整理目录的方式来处理我们云盘中无用的文件吧。
获取云盘缓存目录
使用 Everything 找到云盘缓存 db 文件,复制到脚本的目录下。
云盘数据整理
我们发现这个是一个 sqlite3 的文件,用 Navicat 打开先看看。
我们所有云盘的文件以及对应的路径保存在 cache_file 中,直接导出可能会有些问题,所以我们用 pandas 来处理数据就可以了。
云盘数据导出
我的云盘导出来了 40MB 的目录数据,看着都头疼。
数据整理
把云盘的目录数据导出到 excel,后去该怎么处理就怎么处理吧。代码非常少,如果喜欢用 python 处理就用 pandas 处理,如果感觉有困难直接在 excel 中处理就可以了。
import sqlite3
import pandas as pd
file_dict = {}
con = sqlite3.connect('BaiduYunCacheFileV0.db')
cursor = con.cursor()
cursor.execute("select * from cache_file")
values = cursor.fetchall()
df = pd.DataFrame(values,columns=["id","fid","parent_path","server_filename","file_size","md5","isdir","category","server_mtime","local_mtime","reserved1","reserved2","reserved3","reserved4","reserved5","reserved6","reserved7","reserved8","reserved9"])
df.to_excel("data.xlsx")
重复文件提取
这个由于百度云盘没有对应的API接口可以使用爬虫的方式进行网页的操作对重复数据进行删除,但是容易误操作,所以还是手动把要处理的数据整理出来然后进行操作把。
通过文件名称判断重复,有了结果后续自己处理就好了。
df["server_filename"].duplicated()
0 False
1 False
2 False
3 False
4 False
...
379563 False
379564 False
379565 True
379566 True
379567 False
Name: server_filename, Length: 379568, dtype: bool
df[df["server_filename"].duplicated()]["server_filename"]
188 WE_rk_nos06.txt
252 django.po
254 django.po
255 django.po
256 django.po
...
378517 video.mp4
378518 top_level.txt
378543 Blog_articleinfo.xlsx
379565 apps
379566 职业培训规划.mmap
Name: server_filename, Length: 152409, dtype: object
来源:https://blog.csdn.net/qq_20288327/article/details/126239991
标签:Python,整理,重复,文件
0
投稿
猜你喜欢
Python参数传递实现过程及原理详解
2021-07-11 20:16:07
PHP实现简易计算器功能
2024-05-11 09:25:27
MySQL安全大讲堂:MySQL数据库安全配置
2009-10-18 11:24:00
selenium IDE自动化测试脚本的实现
2023-06-29 18:46:11
pytorch中LN(LayerNorm)及Relu和其变相的输出操作
2022-05-07 07:19:55
如何在django中实现分页功能
2021-10-21 03:29:49
群组功能和用户沟通
2009-07-19 14:07:00
asp修改文件和文件夹的名字的代码
2011-04-11 11:04:00
PYTHON实现SIGN签名的过程解析
2021-08-09 13:29:05
jsp页面中获取servlet请求中的参数的办法详解
2023-06-19 10:52:00
pycharm中如何自定义设置通过“ctrl+滚轮”进行放大和缩小实现方法
2022-03-06 05:52:27
Python中datetime常用时间处理方法
2022-05-03 16:07:06
php设计模式 Singleton(单例模式)
2023-11-20 14:37:50
JS实现仿新浪微博发布内容为空时提示功能代码
2023-08-22 21:52:13
深入了解如何基于Python读写Kafka
2021-02-13 09:33:09
详解python statistics模块及函数用法
2021-09-18 00:08:19
python读取各种文件数据方法解析
2021-08-31 09:16:54
Python实现子类调用父类的方法
2023-09-28 12:00:55
ASP编程代码:隐藏图片的真实地址
2008-10-19 17:14:00
JavaScript对象学习经验整理
2024-04-17 10:09:50