上线前核对抓取与索引配置,核心是确认三件事:搜索引擎能抓到页面、抓到的页面允许被索引、最终展示的规范网址符合预期。最直接的做法是用抓取工具模拟访问,再逐项检查 robots、canonical、sitemap 和状态码,而不是只看页面能否在浏览器打开。
假设你负责一个企业站改版,新站有首页、产品列表页、若干产品详情页和一个新闻栏目,旧站已经运行两年。上线前你发现产品详情页在测试环境能正常打开,于是直接切了正式域名。三天后查询收录情况,发现首页有了,产品页几乎没有。这个结果有多种可能原因,需要逐项排查,不能直接断定是某个单一因素造成的。
合理的核对顺序是:先确认服务器对搜索引擎返回的状态码,再检查 robots.txt 是否误屏蔽,然后看页面是否输出了 noindex,最后核对 canonical 和 sitemap 是否指向正式网址。每一步都要用可复现的工具验证,而不是凭印象判断。
抓取环节关注的是搜索引擎能否顺利获取页面内容。可以在服务器日志中查看搜索引擎爬虫的访问记录,也可以用搜索平台提供的抓取测试工具模拟请求。重点核对以下内容:
Disallow: / 这类写法会挡住全站。如果日志里能看到爬虫访问记录,但状态码异常,问题多半在服务端配置;如果完全没有访问记录,则要优先检查 robots 和域名解析。
抓取成功不等于会被索引。索引环节要确认页面没有主动拒绝收录,且规范网址指向正确。常见检查项包括:
<meta name="robots"> 是否包含 noindex。改版时从测试模板继承过来的 noindex 是高频错误。判断结果时要注意:canonical 是建议性信号,不是强制指令;noindex 则是明确的拒绝索引指令。两者作用不同,不能混为一谈。
上线前按以下步骤操作,每步记录结果:
/robots.txt,确认没有屏蔽正式内容目录。noindex 和 canonical,确认取值正确。这套清单适用于已有页面或项目在上线前的改进场景。如果站点规模较大,可以优先核对首页、栏目页和高价值详情页,不必一次性覆盖所有页面。
下一步建议先完成一次抓取测试和 robots 检查,把结果与本文清单逐项对照,再决定是否需要调整模板或服务器配置。