上线前核对抓取与索引配置,核心是确认三件事:搜索引擎能抓到页面、抓到的页面允许被索引、索引到的地址是唯一且正确的版本。核对时不要只看页面能否打开,而要用抓取工具、robots 文件、HTTP 状态码和规范化标签逐项留下证据,再判断问题出在服务器、模板还是内容层。
要查的是:站点根目录下的 robots.txt 有没有误封整站或关键目录。怎么查:在浏览器直接打开 /robots.txt,逐行看 User-agent 与 Disallow 的对应关系;再用搜索引擎官方提供的 robots 测试工具提交一个真实内页 URL。结果说明什么:如果测试结果显示“被 robots.txt 屏蔽”,页面根本不会进入抓取队列,后续索引配置再正确也没有意义。适用条件是站点确实存在 robots.txt;如果返回 404,说明没有该文件,不等于配置正确,仍需检查服务器是否在其他层拦截。
要查的是:目标 URL 返回的是 200、301、302、403 还是 404。怎么查:用 curl -I 或浏览器开发者工具的 Network 面板查看响应头,重点看 status 和 location。结果说明什么:200 表示可正常抓取;301 表示永久跳转,应确认最终地址是否为期望的规范地址;302 或多次跳转可能让抓取预算被消耗;403、404 则说明页面当前不可抓取。判断条件是:如果重定向链超过一跳,或最终地址与页面内 canonical 不一致,应优先修复跳转规则,而不是先改内容。
要查的是:每个可索引页面里的 rel="canonical" 指向哪里。怎么查:查看页面源代码中的 <link rel="canonical">,并与当前 URL 逐字对比;同时抽查带参数、带分页的版本。结果说明什么:如果 canonical 指向另一个地址,搜索引擎会倾向索引那个地址;如果分页页的 canonical 全部指向第一页,分页内容可能无法单独进入索引。适用条件是内容确实存在多版本;若站点只有一个 URL 版本,这项检查重点是确认 canonical 没有误写成首页或错误路径。
要查的是:sitemap 是否包含目标 URL,且该 URL 能从站内链接点击到达。怎么查:打开 sitemap 文件搜索目标地址,再用抓取工具从首页出发模拟爬取,看目标页是否出现在抓取结果中。结果说明什么:sitemap 里有但站内没有任何链接指向,页面仍可能长期不被发现;站内能到达但 sitemap 缺失,发现速度可能变慢。判断条件是:新上线页面应同时具备可点击的内部入口和 sitemap 记录,二者缺一都应补上。
要查的是:搜索引擎抓取时看到的 HTML 与用户看到的是否一致。怎么查:用官方抓取测试工具或 curl 带上常见 User-Agent 请求页面,对比返回的 HTML 中是否包含正文、标题和 canonical。结果说明什么:如果返回的是空壳、登录页或验证码,说明内容依赖客户端渲染或被访问控制拦截,抓取程序拿不到有效内容。适用条件是 JavaScript 渲染站点;此时应确认服务端是否输出关键元数据,而不是假设抓取程序一定会执行脚本。
完成以上核对后,下一步是保存每项检查的截图或响应头记录,按“抓取被阻止、抓取成功但未索引、索引了错误地址”三类归档,再针对具体那一类修改配置并重新验证。