灰度阶段收录正常、全量发布后反而出现一批页面不收录,常见原因不是灰度本身有问题,而是灰度样本没有覆盖到全量才出现的例外条件。要定位它,应先把灰度与全量的差异列成可验证的清单,再针对差异最大的那一项做单点复测,而不是直接重新提交全部页面。
灰度通常按目录、模板或URL参数挑选一小批页面。这种选法会让样本在结构上高度同质:同一模板、同一层目录、同一批内链入口。全量发布后才会出现的例外,往往正好落在样本之外。
这些例外的共同点是:它们在灰度里要么不存在,要么数量太少,不足以让问题显现。因此灰度通过只能说明“被抽到的那部分没问题”,不能说明“全量没问题”。
以下为假设情境,仅用于说明比较方法,不代表任何真实站点数据。
假设某站点有约一万个商品页,灰度时只挑了首页可直达的五百个页面,批量查收录显示大部分正常。全量发布两周后,运营发现带多条件筛选参数的页面收录比例明显偏低。此时容易做出的错误动作是:把所有筛选页重新提交一遍站点地图,然后等待。
更有效的动作是先做一次差异对照:从收录正常和收录偏低的页面里各取一批,逐项比对它们在全量后才出现的属性,例如参数组合数量、被内链指向的次数、正文是否依赖异步请求、是否与已有页面内容高度相似。如果比对后发现收录偏低的页面几乎都带三组以上参数,而正常页面最多一组,那么差异项就锁定在参数组合上,而不是“提交不够”。
这个动作的结果会直接决定下一步:如果差异项是参数组合,接下来应检查这些参数是否生成了大量近似内容,以及站内是否有指向它们的稳定入口;如果差异项是内链深度,则应优先调整列表页和分页的链接路径,而不是继续扩大提交范围。把差异项当作假设去验证,比把“收录少”当作单一故障去修复更能收敛。
如果还要再做一次灰度,样本不应只按“容易取到”来挑,而应按“结构差异最大”来挑。可操作的做法是:
这样做的代价是灰度规模变大、观察周期变长,但换来的是例外条件被提前覆盖。如果业务上无法扩大样本,至少应在全量发布后按分支复查,而不是等整体收录比例下降才回头找原因。
批量查收录给出的只是一个时点的状态集合。灰度阶段正常,可能只是因为样本页面恰好都不依赖那些例外条件;全量阶段异常,也可能只是抓取节奏、内容相似度或内链分布变化后的滞后表现。把这两者当成因果关系,容易导致反复提交、反复改模板却找不到根因。
判断时应区分三种可能:一是例外条件确实只在全量出现;二是灰度样本太小,问题本来就在但没被抽到;三是全量后新增内容改变了整站的抓取分配。三者的处理方向不同,前两者靠扩大样本和分支复测,第三者靠检查内链与内容结构。只有先分清属于哪一种,后续动作才不会互相抵消。
一个实用的收尾动作是:为每个结构分支保留一条可复查的记录,注明该分支在灰度与全量下的收录状态差异。当再次出现“灰度通过、全量异常”时,先翻这份记录,往往能直接指向那个被漏掉的例外条件,而不必从零重查。