遍历子目录并删除具有重复md5哈希值的文件
创始人
2024-12-04 21:01:31
0

以下是一个遍历子目录并删除具有重复md5哈希值的文件的示例代码:

import os
import hashlib

def find_duplicate_files(directory):
    # 存储已经遍历过的文件的md5哈希值
    seen_hashes = {}
    # 存储具有重复md5哈希值的文件路径
    duplicate_files = []

    # 遍历目录及其子目录
    for root, dirs, files in os.walk(directory):
        for file in files:
            path = os.path.join(root, file)
            # 计算文件的md5哈希值
            with open(path, 'rb') as f:
                file_hash = hashlib.md5(f.read()).hexdigest()

            # 检查是否已经存在具有相同md5哈希值的文件
            if file_hash in seen_hashes:
                duplicate_files.append(path)
            else:
                seen_hashes[file_hash] = path

    return duplicate_files

def remove_duplicate_files(directory):
    duplicate_files = find_duplicate_files(directory)

    for file in duplicate_files:
        os.remove(file)
        print(f"删除文件: {file}")

if __name__ == "__main__":
    directory = "/path/to/directory"  # 替换为要遍历的目录路径
    remove_duplicate_files(directory)

请注意,上述示例代码仅适用于Python编程语言。在运行代码之前,请将/path/to/directory替换为要遍历的目录路径。此代码将遍历指定目录及其所有子目录,并删除具有相同md5哈希值的文件。要删除文件,可以使用os.remove()函数,该函数接受文件路径作为参数。

相关内容

热门资讯

AWSECS:访问外部网络时出... 如果您在AWS ECS中部署了应用程序,并且该应用程序需要访问外部网络,但是无法正常访问,可能是因为...
AWSElasticBeans... 在Dockerfile中手动配置nginx反向代理。例如,在Dockerfile中添加以下代码:FR...
AWR报告解读 WORKLOAD REPOSITORY PDB report (PDB snapshots) AW...
AWS管理控制台菜单和权限 要在AWS管理控制台中创建菜单和权限,您可以使用AWS Identity and Access Ma...
北信源内网安全管理卸载 北信源内网安全管理是一款网络安全管理软件,主要用于保护内网安全。在日常使用过程中,卸载该软件是一种常...
​ToDesk 远程工具安装及... 目录 前言 ToDesk 优势 ToDesk 下载安装 ToDesk 功能展示 文件传输 设备链接 ...
Azure构建流程(Power... 这可能是由于配置错误导致的问题。请检查构建流程任务中的“发布构建制品”步骤,确保正确配置了“Arti...
群晖外网访问终极解决方法:IP... 写在前面的话 受够了群晖的quickconnet的小水管了,急需一个新的解决方法&#x...
AWSECS:哪种网络模式具有... 使用AWS ECS中的awsvpc网络模式来获得最佳性能。awsvpc网络模式允许ECS任务直接在V...
不能访问光猫的的管理页面 光猫是现代家庭宽带网络的重要组成部分,它可以提供高速稳定的网络连接。但是,有时候我们会遇到不能访问光...