上线前核对抓取与索引配置,核心是确认三件事:搜索引擎能抓到页面、抓到的版本是你想让它收录的版本、收录后不会产生重复或错误入口。做法不是看一遍代码,而是用“可访问性测试—抓取规则检查—索引信号核对—上线后验证”四步收集证据。只要其中一步出现异常,就先定位原因再上线,不要靠提交URL或加内链掩盖问题。
抓取的前提是服务器对搜索引擎返回正常内容。上线前用浏览器的无痕窗口或curl命令请求目标URL,检查状态码和响应内容。若返回403、404或跳转到登录页,抓取工具同样拿不到页面。适用条件是页面本应公开;若页面确实需要登录,就不应期望它被索引,而应改用其他公开入口承接流量。
判断结果:状态码为200且正文与预期一致,才算通过。出现301或302时,要确认跳转终点是否是最终想收录的地址;出现5xx时属于服务器问题,先修复再谈索引。
打开站点根目录下的robots.txt,逐条核对Disallow和Allow。常见错误是把测试环境的整站屏蔽规则带到了正式环境,或为了屏蔽后台而误伤了栏目页。适用条件是站点有多个目录、多个子域;单页站点同样要检查,因为一条Disallow: /就能让全站无法被抓取。
Disallow覆盖。Sitemap地址是否指向正式域名,而不是测试域名。Disallow: /search这类本意只屏蔽站内搜索、却连带屏蔽了正常列表页的写法。判断结果:需要收录的页面不在任何Disallow范围内,且Sitemap可访问,才算通过。若不确定某条规则的影响,可以先用搜索引擎官方的robots测试工具验证单个URL,而不是凭感觉删规则。
抓取和索引是两件事:页面能被抓,不代表会被收录。上线前要确认每个页面的canonical指向自己或正确的规范版本,meta robots没有误写成noindex。适用条件是页面存在多参数、多排序或多域名入口;如果同一内容能通过?sort=、?page=等多个地址打开,就要明确哪个是规范地址。
判断结果:查看页面源代码,canonical指向的URL与当前URL一致或指向预期规范页;meta robots内容为index,follow或未设置。若发现noindex,先确认是模板默认值还是个别页面配置错误,再决定修改范围。
把上述配置串起来验证,最直接的方式是用搜索引擎官方提供的URL检查或抓取测试功能,输入一个代表性URL,查看返回的HTML、状态码和资源加载情况。适用条件是站点已部署到可公开访问的环境;本地环境无法被外部抓取工具访问,只能做代码层检查。
判断结果:样本页能返回完整正文、关键资源未被屏蔽、状态码正常,说明抓取链路基本通畅。若某一步失败,先按“可能原因”列出候选,再用单独测试逐项排除,不要直接断定是某个插件或某条规则导致。
提交Sitemap或手动提交URL只表示“已告知”,不等于“已收录”。上线后应观察站点日志中搜索引擎爬虫的访问记录,确认它抓取了新URL且返回200;再通过站内搜索或搜索引擎的收录查询确认页面是否进入索引。适用条件是站点已有一定访问量或已绑定搜索平台账号;新站没有日志时,只能以抓取测试结果为准。
判断结果:日志中出现目标URL的抓取记录、状态码为200,且收录查询能看到该页面,才算完成闭环。若长期只有抓取没有收录,需要回到canonical、内容质量和重复页面层面排查,而不是反复提交。
下一步:挑一个即将上线的代表性页面,按“无痕访问—robots核对—canonical与meta检查—抓取测试”顺序走一遍,把每步的实际返回值记录下来,再决定是否放行上线。