上线前核对抓取与索引配置,核心是确认三件事:爬虫能读到页面、读到的是正确版本、读完后允许被索引。常见做法有两种:一种是在测试环境用 robots.txt 整体屏蔽、上线时再放开;另一种是测试环境就允许抓取,只靠登录或 IP 限制挡住访问。下面从一个假设例子展开,说明两种方案的适用条件和检查步骤。
假设某站点在 test.example.com 上完成开发,准备上线到 www.example.com。测试期间 robots.txt 写的是 Disallow: /,同时页面里带着 <meta name="robots" content="noindex">。上线时如果只改了 robots.txt,忘了删掉 noindex,页面能被抓取但不会被索引;反过来只删了 noindex,robots.txt 还屏蔽着,爬虫根本进不来。两种遗漏都会让新站长时间不出现在搜索结果里。
这种做法适合测试内容不希望被外部看到、且上线动作可控的情况。它的优点是边界清晰,缺点是上线时依赖一份完整的“放开清单”,漏一项就出问题。
执行步骤可以按这个顺序:
Disallow: / 改为只屏蔽确实需要保留的目录,或改为允许全部。<meta name="robots">,删除 noindex,确认没有遗留 nofollow。X-Robots-Tag: noindex,这一项常被忽略,因为它不在 HTML 里。判断是否合格的标准是:robots.txt 里没有误屏蔽正式目录,页面源码和响应头里都没有阻止索引的指令,测试域名不再独立提供内容。
这种做法适合测试环境本身就在公网、但用登录态或 IP 白名单限制访问的情况。它的好处是上线时不需要“放开”动作,抓取配置从一开始就是最终状态;风险是访问控制一旦配置错误,测试内容会直接被收录。
采用这个方案时,检查重点转向访问控制本身:
noindex,但要注意这属于方案一和方案二的混合,需要单独记录。判断是否合格的标准是:未授权访问拿不到正文内容,正式域名可正常抓取且无阻止索引指令。
选择依据不是哪个更先进,而是看两件事:测试内容是否敏感、上线操作是否有清单可依。
无论选哪种,都建议在上线后做一次实际验证:用搜索引擎提供的抓取测试工具或站长平台提交单个 URL,观察返回的是否为正式页面、是否被标记为可索引。这一步能暴露配置和实际行为之间的差异。
配置核对不是上线那一刻就结束。上线后一周内建议复查:robots.txt 是否被意外覆盖、CDN 或反向代理是否缓存了旧的响应头、站点地图里列出的 URL 是否都返回 200。这些位置都可能在部署过程中被旧配置覆盖,导致上线时的正确状态被改回去。
下一步可以做的具体动作:整理一份属于自己站点的“上线前抓取与索引检查清单”,把 robots.txt、meta robots、X-Robots-Tag、域名跳转、访问控制五项列进去,每次上线逐项打勾并留存检查结果,下次上线直接复用。