核对抓取与索引配置,核心是分别回答两件事:搜索引擎能不能顺利抓到页面,以及抓到的页面是否被允许进入索引。上线前应把 robots.txt、meta robots、canonical、sitemap、内链入口和服务器响应逐项对照,而不是只看首页能否打开。下面用一个假设项目说明步骤和常见错误。
假设某企业站由外包团队全包建设,测试环境一切正常,正式域名上线三天后,在搜索引擎里搜品牌名找不到首页。此时不要急着改代码,先按现象收集证据。
<meta name="robots"> 没有写成 noindex 或 none。/robots.txt,确认没有用 Disallow: / 拦住整站。这个例子里,常见错误是测试阶段为了防止被收录加了 noindex,上线时忘记删除;或者 robots.txt 沿用了测试环境的整站屏蔽规则。这两种原因都会造成“页面能打开但进不了索引”,但表现不同:noindex 是页面级指令,robots.txt 是站点级抓取规则。只有逐项核对,才能区分是抓取被拦还是索引被拒。
抓取关注的是搜索引擎能否访问并读取页面。上线前至少检查以下内容:
<a> 链接到达。依赖 JavaScript 渲染的站点,要确认关键内容在初始 HTML 或渲染后可见。判断结果时,可以把“抓取失败”和“抓取成功但未索引”分开记录。若服务器日志或抓取工具显示请求被 403 拒绝,优先查防火墙和 robots.txt;若请求正常返回 200,但页面仍不出现,再查索引指令和内容质量。
索引关注的是页面是否被允许收录,以及哪个地址作为代表。上线前重点检查:
noindex。若某个页面确实不想被收录,应明确记录并确认符合业务预期。适用条件是:这些检查在上线前做一次,上线后一周内再复查一次。判断结果是,如果 robots.txt 允许抓取、页面返回 200、没有 noindex、canonical 自指、sitemap 地址正确,那么索引配置基本就绪。若其中一项不满足,应先修复该项,再观察后续抓取和索引变化。
把核对动作写成清单,可以避免全包交付后责任不清。建议至少包含以下条目:
执行时,每项都记录“检查地址、实际结果、是否通过”。如果某项不通过,先修复再进入下一项,不要一次性改完所有配置,否则很难判断是哪个改动起了作用。
如果上线后仍搜不到,先不要反复提交或修改标题。下一步是收集三类证据:服务器返回状态、页面级索引指令、站点级抓取规则。把这三类证据对照检查清单,定位是抓取问题还是索引问题。确认原因后,只修复对应项,并保留修改前后的记录,便于后续复查。