上线前核对抓取与索引配置,核心是确认三件事:搜索引擎能抓到页面、抓到的页面允许被索引、索引入口没有互相冲突。建议按“可访问性→抓取规则→索引信号→提交与验证”的顺序逐项检查,每项都留下可复查的结果,而不是只看页面能不能打开。
要查的是博客首页、文章页、分类页能否被正常请求。怎么查:用浏览器无痕模式打开页面,再用命令行请求一次,观察返回状态码。结果说明:返回 200 表示可访问;返回 403、404、5xx 说明抓取会被阻断,需要先修服务器、权限或链接,而不是急着提交索引。
同时检查 robots.txt 是否误封了整站或文章目录。把域名加 /robots.txt 打开,看是否存在 Disallow: / 这类规则。若整站被禁止抓取,后续所有索引配置都失去意义。
要查的是同一页面上的抓取指令是否自相矛盾。怎么查:查看页面 HTML 头部的 <meta name="robots">,以及服务器返回的 X-Robots-Tag。结果说明:出现 noindex 表示该页不应进入索引;若你希望文章被收录,就不能保留它。若 robots.txt 禁止抓取、页面又写 noindex,搜索引擎可能无法读到 noindex,反而留下不确定状态,应优先让页面可抓取,再用 noindex 控制索引。
还要看 canonical 标签指向哪里。若每篇文章都 canonical 到首页,等于告诉搜索引擎文章页不是独立版本,文章很难单独获得索引。检查方法是查看每篇文章源代码中的 <link rel="canonical">,确认它指向该文章自身 URL,而不是统一指向首页或带参数的地址。
方案一:先放开抓取,再按页面类型决定索引。适用条件是博客刚上线、文章需要被搜索发现。做法是 robots.txt 允许抓取,文章页不加 noindex,canonical 指向自身。判断结果是文章有机会进入索引,但需要持续观察抓取状态。
方案二:先屏蔽低价值页面,只放行文章页。适用条件是博客存在大量标签页、归档页、站内搜索结果页,容易稀释抓取预算。做法是用 robots.txt 或 noindex 处理这些页面,文章页保持可抓取可索引。判断结果是抓取更集中,但若误封文章目录,收录会明显受阻。
两种方案没有绝对优劣:内容少、结构简单的博客适合方案一;页面数量多、参数页多的博客适合方案二。选择依据是“你希望哪些页面出现在搜索结果里”,而不是哪个方案听起来更严格。
要查的是站点地图是否可访问、是否包含正确 URL。怎么查:打开 /sitemap.xml,确认返回 200,且其中列出的文章链接与线上地址一致,没有大量 404 或重定向。结果说明:站点地图是发现入口,不是收录保证;它能帮助抓取,但不能替代页面本身的可索引状态。
提交后不要只看“已提交”提示。用站点查询指令或搜索控制台查看实际抓取与索引结果,区分“已发现”“已抓取”“已索引”三种状态。若长期停留在已发现,优先检查内链是否可达、服务器是否稳定、页面是否被 noindex 或 canonical 指向别处。
robots.txt,确认没有误封文章目录。meta robots 与 X-Robots-Tag,确认没有意外 noindex。下一步:选一篇已发布文章,按上述清单逐项记录结果;若发现 noindex 或 canonical 冲突,先修正再重新提交,不要同时改动多项配置,以免无法判断是哪一项影响了抓取与索引。