区分抓取、索引和排名,关键是看页面处在哪一环节:抓取是搜索引擎发现并读取页面,索引是把可用的页面内容存入可检索的数据库,排名是用户搜索时从索引中挑出结果并排序。一个页面可能被抓取却不被索引,也可能已索引却没有好排名,三者不能混为一谈。
要查的是页面是否被搜索引擎请求过、返回了什么状态。可以在服务器日志中筛选搜索引擎的爬虫标识,或使用搜索引擎站长工具里的抓取统计与网址检查功能。结果说明两件事:有抓取记录,说明发现和读取环节通了;没有记录,说明问题在入口、链接、屏蔽规则或服务器响应,而不是排名。
检查时重点看状态码:200 表示正常返回,301 或 302 表示跳转,403、404、5xx 会直接影响后续处理。若日志里频繁出现 5xx,先修服务器稳定性,再谈索引和排名。
要查的是页面是否进入索引、以哪个网址进入、索引的是不是目标内容。最直接的检查是用站点限定搜索,例如在搜索框输入 site:example.com/目标路径,看目标网址是否出现;也可以使用站长工具的网址检查,查看“已编入索引”或“已发现,尚未编入索引”等状态。
<link rel="canonical"> 是否指向自己或正确版本。robots.txt 是否误屏蔽了目标目录,页面是否带有 noindex。结果说明:如果显示“已发现,尚未编入索引”,通常是质量、重复、抓取预算或站点结构问题;如果显示“已编入索引”但搜不到,可能是查询词与页面主题不匹配,或结果被其他页面替代。
要查的是在目标查询下,页面是否出现在结果中、排在第几、展示的是哪个网址。可以用无痕窗口搜索目标词,记录前几页是否出现;也可以使用站长工具中的查询数据,看页面是否获得过该词的展示和点击。结果说明:有展示但排名低,问题多在相关性和竞争度;完全没有展示,可能是查询词太偏、页面未被索引,或搜索意图不匹配。
判断时把“排名”拆成三个可核对项:查询词是否与页面主题一致,页面标题和正文是否覆盖该意图,同一查询下是否有更合适的站内页面。若三者都满足仍无排名,再考虑外链、站点权重和竞争环境,而不是回头怀疑抓取。
site::看是否已索引。已索引,进入下一步;未索引,查 noindex、canonical 和内容重复。假设一个页面被搜索引擎抓取,但搜索 site: 查不到,同时日志显示返回 200,这时优先怀疑 noindex 或 canonical 指向了别的网址,而不是排名算法。反过来,页面能被 site: 查到,却搜目标词没有展示,问题更可能在内容相关性和查询意图。
下一步:挑一个已有页面,按“抓取—索引—排名”顺序各查一次,把结果写成三行记录。哪一行先断,就先修哪一行,不要跨环节猜原因。