死链扫描工具,改版或迁移时应核对什么

📍 WDQWDWQD987AAAAA:216.73.216.68
📱 Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; ClaudeBot/1.0; +claudebot@anthropic.com)
🔗 /d41aba30b75f.html
📄

死链扫描工具,改版或迁移时应核对什么

改版或迁移时,死链扫描工具要核对的核心不是“有没有死链”,而是旧URL是否都按计划到达新地址,以及不该被扫描到的地址是否被正确排除。时间和人手有限时,最先做的是建立一份旧URL清单,再让工具逐条验证状态码与跳转终点,而不是先全站扫一遍。

准备:先确定要核对的URL范围

从旧站导出URL清单,来源可以包括XML站点地图、服务器访问日志、CMS后台的页面列表和已知的外链落地页。把清单按类型分组:栏目页、文章页、产品页、图片与附件、纯参数页。分组的意义在于判断哪些URL必须保留可访问,哪些可以合理返回404。

同时准备一份“排除清单”,写入robots.txt中不允许抓取的路径、后台地址、搜索结果页和带会话参数的URL。需要注意,robots.txt的抓取限制不等于可靠的索引移除,它只约束遵守规则的抓取行为,已经收录的旧地址仍可能出现在结果中,需要另行处理。

实施:用工具逐条核对状态码与跳转链

把旧URL清单导入死链扫描工具,逐条记录状态码、跳转次数和最终落地地址。核对时区分三类结果:

跳转链要重点看长度和终点。假设旧地址A跳B、B再跳C,最终才到新页面,这种多级跳转应尽量改成A直接跳C。判断依据是跳转次数越少,抓取和用户到达目标页的路径越短;但若中间层承担参数转换等必要逻辑,则保留并记录原因。

时间和人手有限时,最关键的一步是:优先核对有外部链接和已有排名的旧URL。这些地址一旦断掉,损失最直接。可以从访问日志中筛出访问量较高的旧URL,先验证它们的跳转是否正确,再处理长尾页面。

验证:跳转终点和站点地图要分别检查

跳转正确不等于迁移完成。验证阶段要做两件事:

  1. 抽查跳转终点页面是否与旧页面主题一致。旧产品页跳到新站首页,即使状态码是301,也不算有效迁移。
  2. 检查新站XML站点地图是否只包含新URL,并确认旧URL不在其中。站点地图不保证收录,它只是提交入口,不能替代跳转规则和对已收录旧地址的处理。

如果新旧URL同时可访问且内容相同,需要决定保留哪一个作为规范地址。工具本身不会替你判断,这一步要结合页面上的规范链接和跳转规则一起核对。

维护:迁移后定期复扫并处理新增断链

迁移完成后,把旧URL清单保留为一份固定的回归检查集,每隔一段时间用死链扫描工具复扫一次。新增断链可能来自内容编辑删除页面、更换附件路径或调整栏目结构。发现404时,先判断是否有等价的新页面:有则补跳转,没有则确认返回404是否合理。

另外,HTTPS不保证安全无漏洞或排名,证书配置和跳转协议要单独核对。不同搜索引擎对跳转和索引的处理存在差异,涉及具体搜索引擎时,应分别查看其官方文档中的说明,而不是套用同一结论。

下一步:从旧站导出URL清单,按访问量排序,先对前几十条高价值旧URL跑一次扫描,确认状态码和跳转终点,再决定是否扩大到全量核对。

图1 图2

nginx