网站规模扩大后,最不适合继续手工做的不是“写内容”本身,而是那些重复、可规则化、且出错后会影响整批页面判断的环节:批量发布前的字段映射、URL与标题的唯一性校验、内链锚点分配、失效页面替换、以及发布后的抓取与索引状态分批核对。判断依据很简单:这项工作是否每增加一百个页面就线性增加人工时间,并且人工操作的结果是否难以复核。如果两个条件都成立,就应转为规则驱动;如果页面数量少、每页差异大、或错误代价极高,手工仍然更合适。
规模扩大并不自动等于全部自动化。可以用一个假设例子来区分:假设站点从三百个页面扩展到三千个页面,其中产品参数页结构一致,而行业解读页每篇都需要编辑判断。前者适合用火车头采集器使用中的字段映射、去重和批量发布规则来处理;后者即使数量增加,也不适合把选题、观点和案例替换交给采集规则,因为规则无法判断一段论述是否仍然成立。
选择依据可以落在三个问题上:第一,这项工作是否有稳定输入和稳定输出;第二,错误是否能被批量发现并回滚;第三,人工时间是否随页面数同步增长。三个都偏向“是”,就适合规则化。只要有一项明显偏向“否”,例如输出需要逐页判断、错误无法批量定位,就应保留手工或半手工流程。
第一类是发布前的字段映射。页面少时,编辑可以逐条核对标题、栏目、标签和正文段落;页面多时,手工核对会产生大量遗漏,而且遗漏往往在发布后才暴露。实际动作是把字段映射写成固定规则,先在小批量样本上发布,再检查样本页面的标题、正文首段和栏目归属是否一致。这个动作的结果会直接影响下一步:如果样本一致,才扩大批次;如果样本出现错位,应先修规则,而不是继续加量。
第二类是URL与标题的唯一性校验。手工时代可能靠编辑记忆避免重复,规模扩大后记忆不再可靠。可以用规则生成候选URL和标题,再对已有页面做重复检查。这里要注意,重复检查通过并不等于搜索引擎一定收录,它只说明站内没有明显冲突;抓取、索引和排名仍是不同环节,不能把“没有重复”当成“一定有效”。
第三类是内链锚点分配。少量页面时,手工挑选锚文本可以兼顾语境;页面规模扩大后,手工分配会出现同一锚文本过度集中,或重要页面长期没有入口。替代动作是设定锚点分配规则,例如按栏目和主题分组,再定期抽查入口分布。抽查结果决定下一步是调整规则还是增加手工干预。
第四类是失效页面替换。页面数量增加后,链接失效和内容迁移会同时增多。手工查找适合处理少数高价值页面,批量替换则适合规则处理。但批量替换后必须抽查替换目标是否与原文语境一致,否则会把用户引到不相关的页面。
网站规模扩大后,逐条查看抓取和索引状态会迅速失去可操作性。更合适的做法是按批次抽样:把同一批发布的页面分组,记录每组的抓取状态、索引状态和主要入口来源,再比较组间差异。这里要避免一个常见误判:抓取量下降或某个统计归零,不能单独证明规则处理正确,也可能是发布节奏变化、站点结构调整、外部链接变化或统计口径变化造成的。需要结合同批页面的样本表现和服务器日志等其他证据,才能判断问题出在规则、内容还是抓取环节。
如果抽样显示某批页面长期未被抓取,下一步不一定是继续加采集量,而应先检查这批页面是否有独立入口、是否与其他页面高度重复、是否在发布时被错误设置为不可抓取。这个动作的结果会决定是修发布规则还是修站点结构,而不是简单归因于“采集不够”。
有三类例外值得保留手工或半手工。第一,涉及事实核验和观点判断的内容,规则可以搬运,但不能替编辑确认事实是否仍然成立。第二,涉及品牌、机构或联系方式的页面,规则不能替代对现行信息的核对,因为这类信息可能已经变化。第三,错误代价极高且难以回滚的页面,例如服务条款、价格说明和关键业务入口,即使数量不多,也应保留人工复核。
因此,扩大规模后的合理分工不是“全部自动化”,而是把可规则化、可抽样复核、可回滚的环节交给规则,把需要判断、需要核验、错误代价高的环节留给人工。每次扩大批次前,先用小样本验证规则;样本通过后再放量,放量后按组抽查。这样,火车头采集器使用才不会变成把手工错误放大成批量错误。