改版或迁移时,死链扫描工具要核对的核心不是“有没有死链”,而是旧URL是否都按计划到达新地址,以及不该被扫描到的地址是否被正确排除。时间和人手有限时,最先做的是建立一份旧URL清单,再让工具逐条验证状态码与跳转终点,而不是先全站扫一遍。
从旧站导出URL清单,来源可以包括XML站点地图、服务器访问日志、CMS后台的页面列表和已知的外链落地页。把清单按类型分组:栏目页、文章页、产品页、图片与附件、纯参数页。分组的意义在于判断哪些URL必须保留可访问,哪些可以合理返回404。
同时准备一份“排除清单”,写入robots.txt中不允许抓取的路径、后台地址、搜索结果页和带会话参数的URL。需要注意,robots.txt的抓取限制不等于可靠的索引移除,它只约束遵守规则的抓取行为,已经收录的旧地址仍可能出现在结果中,需要另行处理。
把旧URL清单导入死链扫描工具,逐条记录状态码、跳转次数和最终落地地址。核对时区分三类结果:
跳转链要重点看长度和终点。假设旧地址A跳B、B再跳C,最终才到新页面,这种多级跳转应尽量改成A直接跳C。判断依据是跳转次数越少,抓取和用户到达目标页的路径越短;但若中间层承担参数转换等必要逻辑,则保留并记录原因。
时间和人手有限时,最关键的一步是:优先核对有外部链接和已有排名的旧URL。这些地址一旦断掉,损失最直接。可以从访问日志中筛出访问量较高的旧URL,先验证它们的跳转是否正确,再处理长尾页面。
跳转正确不等于迁移完成。验证阶段要做两件事:
如果新旧URL同时可访问且内容相同,需要决定保留哪一个作为规范地址。工具本身不会替你判断,这一步要结合页面上的规范链接和跳转规则一起核对。
迁移完成后,把旧URL清单保留为一份固定的回归检查集,每隔一段时间用死链扫描工具复扫一次。新增断链可能来自内容编辑删除页面、更换附件路径或调整栏目结构。发现404时,先判断是否有等价的新页面:有则补跳转,没有则确认返回404是否合理。
另外,HTTPS不保证安全无漏洞或排名,证书配置和跳转协议要单独核对。不同搜索引擎对跳转和索引的处理存在差异,涉及具体搜索引擎时,应分别查看其官方文档中的说明,而不是套用同一结论。
下一步:从旧站导出URL清单,按访问量排序,先对前几十条高价值旧URL跑一次扫描,确认状态码和跳转终点,再决定是否扩大到全量核对。