AntiDupl实战:不看文件名只看画面,三分钟揪出硬盘里所有相似图片和瑕疵图片 AntiDupl实战不看文件名只看画面三分钟揪出硬盘里所有相似图片和瑕疵图片【免费下载链接】AntiDuplA program to search similar and defect pictures on the disk项目地址: https://gitcode.com/gh_mirrors/an/AntiDupl你的硬盘里到底藏了多少张长得一模一样的照片这个问题AntiDupl 能替你回答——它是一款相似图片与缺陷图片查找工具不看文件名、不看文件大小直接比对画面内容把重复图片和瑕疵图片一次性揪出来。在讲它怎么用之前先回到上周五晚上你那次以失败告终的硬盘大扫除。一次失败的大扫除踩了三个找重复的坑你盯着备份盘里那两个加起来快 40GB 的文件夹心里发虚这里头肯定全是重复可动手才发现根本清不动。回想一下你多半栽在这三个坑里文件名会撒谎。同一张照片在手机里叫 IMG_001传到网盘叫2019_备份下载回来叫最终版名字完全不同画面却一模一样。按名字找等于让证据自己改名。大小会骗人。微信传图会压缩、网页存图会裁切同源图片的文件体积天差地别按大小筛重复漏掉的比找到的多。肉眼会崩溃。上千张图里找相似而不相同的对象看到第十张开始恍惚看到第一百张已经忘了前面长什么样。这三个坑的共同点在于它们全都在用文件的身份证信息做判断而一张图是否重复本该由画面本身说了算。AntiDupl 的思路从查户口变成认脸普通去重工具的思路是查户口——比对文件名、大小、哈希指纹信息对得上才算重复。这套逻辑对付原样复制没问题可图片一旦被改名、转格式、调尺寸、重压缩指纹立刻变样工具当场失联。AntiDupl 换了套思路认脸。它读取画面的纹理、明暗与布局用结构相似性算法算出两张图的像不像而不是是不是同一串字节。于是同一张图被旋转 90 度它认得被压成小尺寸缩略图它认得被二次压缩出一身噪点它照样认得唯一认不出来的是画面真的不同的图。顺带一提JPEG、PNG、TIFF、WEBP、HEIC、AVIF、JXL 等 18 种常见格式它都能读跨格式的变装也逃不过。把找重复从一道体力活变成一道算术题这就是它的核心价值。三分钟拿到第一份扫描结果别急着研究菜单先让它跑起来路径越短越好添加扫描路径——选一个塞满图片的文件夹手机照片导出目录、素材库、下载文件夹都行点击开始——扫描自动分配到多个 CPU 核心并行处理进度条走完结果立刻上桌看结果——右侧表格按组列出重复图片左侧预览区显示你选中的那一张。启动后就是这副样子左边预览、右边表格工具栏把常用操作都摆在明面上第一次用也不会迷路。第一次扫描跑完看到Total: 33、重复组列了一长串的瞬间你就明白这工具和以前用的不一样——它认的是画面本身而不是文件的名字。哪怕一张叫 IMG_001、一张叫最终版只要画面相同都会被归进同一组。它认得出的变装重复比你以为的更隐蔽扫描结果里其实藏着不少门道。看这张扫描结果界面表格里每一行就是一张图绿勾代表与同组图片哈希完全一致是货真价实的复制品红叉代表建议删除的那份Diff 列则是画面相似度。一个典型场景壁纸文件夹里躺着 wallpaper-1598948.jpg 和 wallpaper-1598948(2).jpg画面相同只是一张被压缩过、尺寸被改过——这类变装以前按大小比对时最容易漏网在 AntiDupl 里却被干净利落地配成了一对。如果连横版和竖版其实是同一张这种更刁钻的情况也要抓可以在选项里开启旋转与镜像识别。对素材来源杂的文件夹这一项往往能多捞回不少空间。免费附赠的质检报告模糊、马赛克、损坏一次筛出找重复之外AntiDupl 还顺手给整库图片做了一次质检把三类问题选手单独拎出来拍糊的废片——对焦失败、手抖模糊的图边缘糊成一片它标记出来压缩过度的马赛克图——块状伪影明显的劣质图一眼就是不适合商用的那类文件损坏的图——比如 JPEG 缺失结束标记典型的下载中断产物打都打不开更该删。相当于扫描一遍同时拿到重复清单和缺陷清单两份报告。对需要逐张审核素材质量的电商运营和摄影师来说这一步省下的不是几分钟而是整个下午。动手删除之前先来一次当面对质找到重复只是第一步真正纠结的是删哪份、留哪份。AntiDupl 专门留了确认环节双窗格对比预览把两张相似图并排放大细节差异看得一清二楚。拿不准的组调出双图对比放大到细节处比一比再决定留谁删谁误删珍贵原图的概率大大降低。确认之后的操作也都有安全网删除默认进回收站误删可撤销需要的话还能把第一张改名成第二张的名字、移动到指定目录批量处理毫不手软。两张表解决删哪份、阈值调多少的纠结第一张表相似度阈值怎么选。使用模式阈值适合的图库误报风险严格模式90% 以上合同扫描件、文档备份验证低平衡模式70%–90%日常照片与素材整理中宽松模式50%–70%找同图不同尺寸、近似构图较高一句口诀阈值调得越低捞得越多误报也越多。先宽松粗筛、再严格复核效率最高。第二张表这一组里该留哪一份。按这个顺序判断就行留分辨率更高的那份——放大不糊留没有压缩痕迹的那份——画质更干净留文件完整无损的那份——能正常打开。收尾把整理图库从苦差变成习惯回到开头那个周五的晚上。现在你知道了重复图片不是靠肉眼翻出来的是靠认脸认出来的清理也不是一场耗时两小时的大工程而是一次三分钟的例行检查。AntiDupl 把整理图片库从周末苦差变成偶尔点一下开始按钮腾出来的不只是硬盘空间还有你翻图时的心情。今晚就挑一个塞满图片的文件夹试试——第一轮跑完你多半会回来清理下一个。想深入研究的读者可以翻翻官方文档目录 docs/data/help/英文与俄文两套完整手册或者从核心比对算法 src/AntiDupl/adImageComparer.cpp 读起想自己动手编译克隆https://gitcode.com/gh_mirrors/an/AntiDupl后按仓库 README 配置构建环境即可。【免费下载链接】AntiDuplA program to search similar and defect pictures on the disk项目地址: https://gitcode.com/gh_mirrors/an/AntiDupl创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考