上线前核对抓取与索引配置,核心是确认三件事:爬虫能顺利访问页面、页面明确允许被索引、站点能通过可被抓取的入口发现这些页面。时间和人手有限时,优先处理“会直接导致页面进不了索引”的硬问题,再处理影响抓取效率的优化项。
抓取是索引的前置条件。如果爬虫拿不到页面内容,后面的索引配置再正确也没有意义。按下面顺序检查,每一步都对应明确的判断结果。
/robots.txt,看 Disallow 是否挡住了整站或关键目录。如果写的是 Disallow: /,爬虫不会抓取任何页面,这是上线前最常见的致命错误。200 表示可正常访问;返回 404、500 或重定向到无关地址,都会让抓取失败或指向错误页面。这三项属于“已经定位的原因”比“可能原因”更值得优先确认的类型:它们有明确的返回结果,不需要猜测。任何一项不通过,先修它,再往下走。
能抓取不等于能索引。抓取之后,页面还要明确表达“可以被收录”。检查以下位置:
<meta name="robots" content="noindex">,该页即使被抓取也不会进入索引。上线前逐类模板检查,而不是只看首页。noindex,页面源码里看不到。用响应头查看工具核对,尤其注意测试环境配置被带到生产环境的情况。判断方法很直接:抓取一个页面,同时看源码和响应头,确认没有 noindex,且 canonical 指向合理。适用条件是页面本身希望被收录;如果某类页面本来就该排除在索引外,保留 noindex 是正确的,不要误删。
页面允许索引,但如果没有任何可抓取路径通向它,爬虫可能长期发现不了。人手有限时,优先保证以下入口有效:
<a> 链接到达,而不是只靠 JavaScript 点击事件触发。这里要区分网页搜索与平台推荐、付费广告:sitemap 和内部链接影响的是搜索引擎的抓取发现,不决定广告投放或站内推荐结果。核对时只针对搜索抓取这一条链路。
修改配置后不要只看一眼就结束。按同一套动作复查,才能确认问题真的解决:
/robots.txt,确认屏蔽规则已放开。200、无 noindex、canonical 正确。复查的适用条件是配置已经改动;如果只是核对未改动,复查就是确认现状并留档。判断结果是:所有关键页面同时满足“可抓取、允许索引、有入口”,才算通过上线前核对。
下一步:把上述检查项整理成一张按页面类型划分的清单,上线前只跑这一遍,优先处理 robots.txt、状态码和 noindex 这三类硬故障,再补内部链接与 sitemap。