抓取、索引和排名是搜索引擎处理网页的三个先后环节:抓取是发现并下载页面,索引是解析、理解并存入可检索的数据库,排名是用户查询时从索引中挑选并排序结果。判断问题出在哪一环,最直接的方法是看页面在搜索结果中的“可见状态”:搜完整标题或URL能出现,说明抓取和索引基本完成,问题多在排名;搜不到,则要往前查抓取或索引。
把搜索引擎想成一条流水线,每个环节都有明确的交付物。抓取交付的是“原始文件”,索引交付的是“可被查询调用的记录”,排名交付的是“针对某次查询的结果顺序”。
这三步是顺序依赖的:没抓取就谈不上索引,没索引就不会进入排名候选。所以排查时要从后往前定位,先确认页面是否已被索引,再决定是否需要检查抓取。
最实用的判断方法是做两次站内或搜索引擎查询,注意区分网页搜索与平台推荐、付费广告,后两者不反映自然索引状态。
判断结果时注意:精确查询出现,只能说明“已索引”,不能说明“排名好”;精确查询不出现,也不能立刻断定“没抓取”,还要排除查询方式、地域、个性化结果的影响。可以换一个无登录环境的浏览器再试一次。
当页面搜不到时,原因可能出在抓取,也可能出在索引,不要只归为一种。以下按环节列出可核对项:
robots.txt 禁止抓取、页面需要登录、内链太少导致爬虫难以发现、站点地图未提交或格式有误。这些是“可能原因”,不是“已经定位的原因”。要确认具体是哪一项,需要看服务器日志、页面源代码中的索引指令,以及搜索控制台类工具给出的状态说明。不同搜索引擎的规则和工具界面不同,应以你实际使用的平台文档为准。
如果项目已有页面需要改进,可以按下面的分工推进,每一步都有可验收的结果:
robots.txt 是否误拦、站点地图是否包含目标URL、内链是否指向该页。验收标准是服务器日志中出现爬虫对该URL的请求记录。适用条件:这套流程适合已有页面、需要判断瓶颈在哪个环节的场景。如果页面是全新上线,优先确认抓取和索引;如果页面已稳定被搜到,则应把精力放在排名相关的相关性与质量改进上。
假设某产品页更新后流量下降。先搜完整标题,结果中仍能找到该页,说明抓取和索引大概率正常,问题更可能在排名:可能是标题改动后与用户查询意图偏离,或竞争对手页面更新。此时应对比改版前后的标题、正文覆盖的主题,以及目标词下当前排在前面的页面在讲什么。反之,如果完整标题也搜不到,就先检查是否误加了不索引指令或服务器是否返回错误。这个例子是假设场景,用于说明判断顺序,不代表任何真实项目结果。
下一步:挑一个你关心的页面,先做“完整URL查询”和“目标词查询”这两次检查,把结果记下来,再决定是去查抓取配置、索引指令,还是调整内容与关键词匹配。