上线前核对抓取与索引配置,核心是确认三件事:搜索引擎能抓到页面、抓到的页面允许被索引、索引结果指向你希望用户看到的地址。时间和人手有限时,先做可验证的交付项:robots.txt、XML站点地图、页面级noindex、规范链接和HTTPS跳转,再逐项用实际响应验证,而不是只看后台开关。
从交付结果倒推,抓取与索引配置的验收物不是“装了什么插件”,而是可核对的证据。建议至少准备四项:一份robots.txt的实际访问结果、一份可打开的站点地图、一份重点页面的抓取状态记录、一份规范地址与跳转规则说明。每一项都要能指出由谁负责、在哪里检查、什么结果算通过。
判断依据很直接:如果搜索引擎抓取工具无法取回页面,或取回后发现页面被禁止索引,那么内容再完整也无法进入索引。反之,如果页面可抓取、可索引、地址唯一,基础条件就已具备。注意,可抓取可索引不等于一定收录或获得排名,这两件事不能混为一谈。
WordPress建站常见的失误是上线时沿用了开发环境的robots.txt,整站被禁止抓取。核对步骤如下:
Disallow: /这类整站禁止规则。如果存在,确认它是否只针对特定目录,而不是误伤全站。适用条件是站点结构简单、没有大量需要精细控制的目录。若站点包含会员中心、搜索结果页等不应被抓取的路径,可以针对性屏蔽,但要逐条确认不会波及正文页面。判断结果时,重点看“是否误屏蔽正文”,而不是规则条数多少。
站点地图的作用是帮助发现页面,它不保证页面被索引。核对时先确认站点地图能正常生成并访问,再抽查其中是否包含重点页面、是否混入不应公开的地址。
页面级索引状态需要单独检查。对首页、栏目页和几篇代表性内容页,查看页面HTML中的robots元信息。若出现noindex,该页面就不会进入索引。WordPress中常见的来源包括主题设置、SEO类插件设置,或某篇文章单独的“ discourag 搜索”选项被勾选。核对方法是逐页查看源代码,而不是只信任后台列表。
这里要区分“可能原因”和“已经定位的原因”。页面未出现在索引中,可能是被noindex、可能是被抓取工具暂时未处理、也可能是内容质量或重复问题。只有实际看到noindex标记,才能确认是页面级屏蔽导致的。
同一内容存在多个可访问地址时,搜索引擎需要知道哪个是首选版本。核对项包括:
假设某篇文章可以通过https://example.com/post和https://www.example.com/post两个地址打开,且都返回200,那么索引可能分散。此时应保留一个首选地址,另一个做跳转,并在页面中声明规范地址。判断通过的标准是:重点页面只有一个稳定可访问的首选地址。
先处理影响面最大的项:整站robots.txt误屏蔽、HTTPS与域名跳转、重点页面noindex。这三类问题一旦存在,后续工作基本无效。其次处理站点地图与规范链接,最后再逐页抽查索引状态。责任分配上,robots.txt和跳转规则通常由建站或运维人员负责,页面级noindex与规范链接可由内容或SEO执行人核对,但最终需要同一人做一次整体验收。
验收时不要只看配置界面,要用实际访问结果作为证据。配置界面显示“已开启”,不代表线上返回的就是期望结果。
下一步:选取首页、一个栏目页和一篇内容页,按上述顺序各查一遍robots.txt、站点地图、页面robots元信息、HTTPS跳转和规范链接,把每项的实际结果记录下来,作为上线前的核对凭证。