
HTTrack完整网站离线下载攻略三步打造可随身携带的网站镜像【免费下载链接】httrackHTTrack Website Copier, copy websites to your computer (Official repository)项目地址: https://gitcode.com/gh_mirrors/ht/httrack你有没有过这样的时刻出差飞机上想翻一份技术文档却发现断网后收藏夹里全是死链接或者心爱的教程网站突然关停而你也从没想过先把它存下来HTTrack Website Copier 正是用来解决这个问题的免费开源整站下载工具——它不仅能下载网页还会把链接结构原样重建让你断网也能像在线一样浏览完整网站。当网络消失你的收藏夹还剩下什么多数人以为保存网页就是按 CtrlS 存个 HTML。试试看你存下来的页面可能没有样式、打不开图片、点了子链接直接报错——因为你只抓走了门面没搬走整栋楼。HTTrack 看待网站的方式完全不同它把网站当作一张互相链接的网而不是一堆孤立的文件。下载时它先抓首页解析出里面的链接顺着链接一层层往下爬把 HTML、图片、CSS、JS、PDF 全部搬回家再自动把每个链接改写成指向本地文件。最终交付给你的是一个搬家后依然能跑的完整站点。只存书签等于只抄了目录镜像才是整本打包这里先分清两个概念因为整篇文章都建立在它们的区别上做法你得到的东西断网后能用吗浏览器收藏夹一串网址不能全是死链接逐个另存网页孤立的 HTML缺图缺样式子链接全断HTTrack 离线镜像完整网站副本 修复后的相对链接能效果和在线几乎一样关键在于 HTTrack 的相对链接重建能力。它在保存时会把https://site.com/a/b.html这类绝对地址改写为a/b.html这样的本地相对路径并保持原始目录层次。这就像搬家时不仅搬家具还在新家里按原样摆好——每个房间都找得到路。最快路径三分钟拿到你的第一份镜像安装非常简单两条路任选最快路径包管理器# Debian/Ubuntu 系 sudo apt-get install httrack # CentOS/RHEL 系 sudo yum install httrack从源码编译适合想要最新版本或定制功能的用户git clone https://gitcode.com/gh_mirrors/ht/httrack cd httrack ./configure --prefix$HOME/usr make -j8 make install失败时的常见表现与对策如果make报缺少编译工具先执行sudo apt-get install build-essential autoconf如果是图形界面打不开多半是缺 GTK 运行库装上即可。装好后启动httrack跟着向导只需三步填地址——输入https://www.example.com/给项目起个名字选好保存目录调选项——新手阶段保持默认即可直接点 Next点下一步开始——剩下的交给工具你看着进度条就好。一个反直觉的事实新手从命令行开始反而更轻松很多人一听到命令行就退缩但 HTTrack 恰恰相反——图形向导帮你包办了每一步反而让你看不清发生了什么而一条命令就把所有决定说清楚了。看这条最常用的镜像命令httrack https://www.example.com -O /home/me/websites/example -%v-O指定保存目录是 Output 的意思-%v让实时显示正在下载的文件名看不到进度会心慌的人必备。配合上前面向导里的那些设置命令行版语法如下你要做的事图形界面里命令行参数限制链接深度最大深度-r2限制并发连接数Connections-c10排除图片过滤器-*.jpg -*.gif尊重 robots.txtSpider 选项卡s10从不2总是命令行模式还带来一个额外好处可复制、可归档。把一条跑通的命令存进笔记以后每次镜像同类网站直接改个域名就重放不用再点十几次界面。用过滤器给下载瘦身规则语法其实就三行镜像一个几百兆的网站很常见但你可能只想要其中的文字资料。HTTrack 的过滤规则用只收和-排除两个符号就能表达配合通配符*几乎能表达所有需求。排除视频和大文件只保留网页样式httrack https://www.example.com -O /home/me/websites/example -%v -*.mp4 -*.avi -*.zip只接受某个域名下的内容防止爬出站httrack https://www.example.com -O /home/me/websites/example *.example.com/*只下载文档类内容httrack https://www.example.com -O /home/me/websites/example -%v *.html *.htm *.pdf岔路提示新手最容易犯的错是把*.html写成了唯一的规则结果页面全部变成有文字没样式。因为 CSS 和图片被过滤掉了页面看着像打回 1998 年。记住加号规则负责要什么减号规则负责不要什么两者可以同时存在。这些规则在图形界面的 Options 里同样可以配置位置在 Scan Rules 选项卡增量更新只补新砖不重砌整面墙网站是会变的今天加了个页面明天换了几张图。要是每次更新都整站重下既浪费时间又浪费带宽。HTTrack 的增量更新机制只做两件事——对比新旧文件只下载发生变化的那些。# 在原有项目目录上执行更新而不是重新下载 httrack https://www.example.com -O /home/me/websites/example -%v --update这个--update会读取之前下载时留下的缓存索引跳过未变化的文件只补齐新增和改动的部分。你可以把它理解成只补新砖不重砌整面墙。配合定时任务还能实现完全自动的定期备份# 每周日凌晨 2 点自动更新镜像crontab 写法 0 2 * * 0 httrack https://www.example.com -O /home/me/websites/example -%v --update翻车现场五个常见坑和它们的解药坑一下载了一堆却发现关键页面没抓到多半是深度设置不够。-r2只跟两层链接站内还有三级页面的就得-r3甚至用-r99表示不限制。坑二网站不让抓进度条纹丝不动很多站点靠 robots.txt 声明抓取规则。先确认是否被这条规则挡住把命令行里的s1改成s0从不遵守再试但请记住是否遵守 robots.txt 是下载伦理问题不是技术问题。坑三下载到一半中断了不用从头再来。HTTrack 天然支持断点续传重新执行同样的命令或带--update即可从断点继续。坑四镜像里出现了一大堆站外内容因为某个页面里嵌了外站的图片或脚本。用过滤器-*.otherdomain.com/*把外站域名挡在门外。坑五页面能打开但样式全乱优先检查是否误用了过滤规则排除了.css文件其次确认下载时勾选了重建相对链接选项。让镜像更聪明的三个隐藏开关上面几条命令已经能覆盖 90% 的场景最后分享三个藏在深处的功能都属于知道的人不多、但用起来真香的类型从 sitemap 播种网站如果提供了 sitemap.xmlHTTrack 可以以它为起点规划爬取比从首页顺着链接爬更完整、更高效。命令行参数是%m图形界面在 Spider 选项卡里勾选。抓取需要登录的页面在图形界面的 URL 添加窗口里可以直接填写登录用户名和密码命令行则配合 cookie 文件使用用于抓取登录后才能看的内容。日志归档每次下载会生成完整日志包含每个文件的成败状态。批量镜像后养成翻日志的习惯比事后发现缺文件要省事得多。从今天开始的行动清单装好工具——包管理器一条命令或按上文源码编译三分钟搞定完成第一次镜像——挑一个你常看的文档站用-r2加一两个过滤器跑通全流程建立更新习惯——把--update写进定时任务从此告别网站没了才后悔把命令沉淀成笔记——下次遇到同类网站复制、改域名、回车。温馨提示请务必遵守目标网站的使用条款与 robots.txt 规则HTTrack 遵循开源协议GPL请在授权范围内使用。镜像个人资料或文档用于离线研究没问题但请尊重内容版权不要将他人内容做商业再分发。动手吧下一个有备无患的人就是你。【免费下载链接】httrackHTTrack Website Copier, copy websites to your computer (Official repository)项目地址: https://gitcode.com/gh_mirrors/ht/httrack创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考