推文
@fanzhang2026 · 2026-10-11 20:00
总结。 今天做了一次误格式化后的数据恢复。过程有些绕,也没有做到完全恢复,但摸索出一套“恢复文件 → 整理内容 → 建立检索”的方法。隐藏具体资料,记录一下工具和操作经验。 1、必备工具:恢复、存储、整理各司其职 这次用到的工具主要是: DMDE:查看磁盘、分区和能否找回原来的目录结构。 PhotoRec:扫描并提取文件,作为补充恢复手段。 另一块硬盘:存放磁盘镜像和恢复出来的文件。 AI+脚本:读取内容,辅助分类、批量重命名和检查。 AnyTXT+OCR:提取文档及图片中的文字,建立内容检索。 操作思路是:先确认误格式化的是哪块磁盘,避免继续往里面写入;准备镜像和恢复目标目录,再开展扫描。恢复结果放到另一块硬盘,后续整理也尽量操作副本,保留原始恢复文件。 恢复时可以先检查原目录是否还能识别,再尝试按文件特征提取。后者能找回一些内容,但文件名可能变成一串编号,原来的文件夹结构也可能丢失,这就需要后续整理。 2、恢复数据范围:先划范围,再分批检查 开始时想尽量多恢复,后来发现,扫描出来的数量越大,筛选成本也越高。里面可能混着重复文件、缩略图、碎片、损坏文件和无关素材。 这次逐渐收敛成这样的操作流程: ① 按需要的文件类型和单文件大小筛选,先处理优先级高的资料。 ② 固定一批已导出的文件清单,再进行整理,避免扫描不断新增、任务一直做不完。 ③ 检查文件是否能读取,能否解析或打开;有问题的单独放入“待检查”。 ④ 用 AI 读取可识别的内容,按主题分类,把编号文件改成容易理解的名称。 ⑤ 保留“原路径 → 新路径”的对应清单,方便追溯;无法确定的内容不要强行归类。 这里有两个教训:扫描到文件不等于恢复成功,复制校验通过也不等于内容完整。 日期同样要区分,恢复后的创建时间未必是资料原来的时间。 另外,这次去重增加了处理步骤。后续我的选择是默认先不去重,优先保留和查找需要的文件,重复内容以后再整理。 3、创建检索引擎:文件名没了,就从内容里找 恢复后最大的麻烦之一,是文件在,但不知道在哪里。于是尝试用 AnyTXT 建立本地内容索引。 具体操作顺序: ① 把需要检索的恢复目录加入索引范围。 ② 对文档提取正文,对图片和扫描件进行 OCR 文字识别。 ③ 等待索引建立,用已知关键词试搜,打开结果核对是否对应原文件。 ④ 对尚未完成索引、识别失败或没有提取到文字的文件,保留人工检查入口。 它的作用是让搜索从“找文件名”变成“找文件里的文字”。但这次做的是文字内容检索,并不等于能理解所有图片画面的语义搜索。 建索引时也踩了坑:界面退出后,后台服务可能仍在运行;直接结束子进程,可能又被服务重新拉起。判断是否停止,需要同时看后台服务、日志和索引文件的更新时间,不能只看窗口。 我还尝试把程序和索引一起放到移动硬盘上。迁移过程是:停止后台写入 → 复制程序和索引 → 校验副本 → 修改索引路径 → 实际搜索验证。 目前完成了副本复制,但程序仍读原位置的情况还没彻底解决,换电脑双击即用也尚未验证。 这次算不上完美恢复,但留下了一个实用经验:先保护原数据,按需求恢复,再把找回来的文件整理成能检索、能核对的资料库。
曝光 257 · 评论 3 · 点赞 2 · 书签 0 · 曝光/时 5.874113358841276