页面加载速度测试本身测的是资源下载与渲染耗时,它既不等于搜索引擎的访问抓取,也不等于索引收录。要区分三者,最直接的办法是分别看三份记录:服务器访问日志里的抓取请求、抓取工具返回的响应状态、以及搜索结果中该 URL 的实际展示状态。速度慢可能影响抓取频率,但不能从速度测试结果直接推断页面是否被抓取或被索引。
访问抓取是搜索引擎爬虫向你的服务器发出请求并拿到响应;索引是搜索引擎把抓取到的内容处理后存入可检索的库;页面加载速度测试是外部工具模拟浏览器加载页面并记录各阶段耗时。三者的证据不通用:
site: 或直接搜索完整标题、URL 查看结果;或用站长平台的 URL 检查工具看该地址的收录状态。常见错误是拿速度分数当收录结论。分数高不代表已索引,分数低也不代表没被抓取。另一个错误是把 robots.txt 的允许抓取当成会被索引——robots.txt 只控制抓取,不能可靠地移除已索引页面,索引移除需要 noindex 等指令配合。
假设某产品页在速度测试中得分良好,但用完整标题搜索不到。按下面顺序排查,不要跳步:
noindex,或是否被 robots.txt 的 Disallow 拦住。被拦时爬虫可能根本没取到内容。判断结果:日志有 200 请求但搜索无结果,问题在索引环节,不在抓取;日志完全没有该 URL 的请求,问题在抓取入口,需要检查内链、站点地图和 robots.txt;日志有请求但返回 5xx 或超时,问题在服务器响应,速度测试中的高分不能掩盖这一点。站点地图只帮助发现 URL,不保证收录。
把结论写成可复核的三列表格最省事:URL、抓取状态(依据日志或抓取工具)、索引状态(依据搜索结果或站长平台)。每行注明核查时间和所用工具,避免不同人用不同口径争论。交付前确认:
不同搜索引擎对 JavaScript 渲染、抓取预算和索引指令的支持并不一致,同一页面在一个引擎已索引、在另一个未索引是正常现象,必须逐个核查,不能用一个引擎的结果代替全部。历史抓取工具或旧版站长平台的入口位置和界面可能已变化,没有当前资料时,以你现在能打开的工具页面为准,不要照搬旧教程里的位置描述。
下一步:挑一个你怀疑未被收录的 URL,先导出服务器日志中该地址近七天的请求记录,再用站长平台的 URL 检查确认索引状态,把两项结果并排写进交付表格,再决定是修抓取入口还是修索引指令。