在百度搜索引擎里,抓取、索引和排名是三个先后发生但互相独立的环节:抓取是百度蜘蛛把页面内容取回;索引是把取回的内容分析、去重后存入可供检索的库;排名是用户搜索某个词时,百度从索引库中挑出页面并决定展示顺序。一个页面被抓取不等于被索引,被索引也不等于有排名。要区分它们,需要分别找到对应环节的证据,而不是只看“搜不到”这一个现象。
要查的是百度蜘蛛是否访问过目标 URL。可执行的做法是查看服务器访问日志,用 Baiduspider 作为筛选条件,观察是否出现对该 URL 的请求记录,以及返回状态码是 200、301 还是 404。
Baiduspider 加具体路径;没有日志权限时,可结合百度搜索资源平台中该站点的抓取相关数据核对。适用条件是页面已经上线且允许公开访问。如果页面被 robots.txt 屏蔽、需要登录或返回错误状态,抓取本身就未完成,此时讨论索引和排名没有意义。
要查的是该 URL 是否被百度收录进索引。可执行的做法是在百度搜索框输入完整 URL 或 site: 加域名进行观察,但要注意搜索结果中有该 URL 不等于它一定能参与所有关键词的排名。
site: 加域名观察收录规模变化。这里要区分“被抓取”和“被索引”:日志里有蜘蛛访问,只能证明抓取发生;索引还需要百度对内容完成分析和采纳。若页面是新发布,索引可能滞后,判断时应留出观察周期,而不是当天就下结论。
要查的是某个具体查询词下,目标 URL 是否出现以及出现在什么位置。可执行的做法是选定一个与页面主题高度相关的词,在百度中搜索,逐页查看目标 URL 是否出现。不要用品牌词或过泛的词作为唯一判断依据。
排名会随查询词、时间、地域和个性化因素波动,单次观察不能当作稳定结论。判断时应关注同一条件下的变化趋势,而不是某一次的绝对位置。
Baiduspider 是否抓取目标 URL,看状态码是否为 200。是,进入下一步;否,先解决抓取。假设一个页面日志中有百度蜘蛛访问,完整 URL 也能搜到,但搜索“某具体产品词”时排在第 5 页之后。这说明抓取和索引都已通过,当前瓶颈在排名,而不是收录。反之,如果日志长期没有蜘蛛记录,即使页面内容再好,也先要解决抓取,否则后续环节无从谈起。
下一步,选一个你正在优化的页面,按上面清单依次记录抓取、索引、排名三项证据,定位真正卡住的环节,再决定改什么。