当页面数量从几十涨到几百上千,真正不适合继续手工做的,不是“所有事”,而是那些重复、可枚举、结果必须保持一致的工作:批量修改标题与描述、批量补内链、批量检查索引状态、批量更新结构化数据。判断标准很简单——同一动作要重复几十次以上、每次只换一个字段、出错后很难逐页发现,就该转成模板加脚本或规则批处理。手工更适合判断类工作,比如内容取舍、页面合并决策、优先级排序。
假设你手上有一份导出的页面清单,包含网址、标题、描述、最后修改时间、是否被索引。不要急着写脚本,先做一次分类:把清单按“需要改同一字段”分组。例如所有分类页的标题都要补上“第几页”,所有产品页的描述都要去掉重复的促销语。这时你会发现,真正需要人工判断的只是少数异常页,大多数页面遵循同一套规则。
这一步的产出是一份规则表,而不是直接改页面。规则表至少写清三列:匹配条件、要改的字段、改后应满足的格式。比如“网址包含 /category/ 且标题不含‘第’字”对应“在标题末尾追加‘第N页’”。动作是把规则表交给能批量执行的环节,结果是你可以先在一小部分页面上验证,再决定是否全量应用。如果验证时发现规则误伤了某类页面,下一步就是收窄匹配条件,而不是逐页回退。
手工逐页改标题,短期看不出问题,规模上来后会出现三种典型症状:同一类页面格式不统一、改过的页面忘记记录、回滚时找不到原始版本。这些症状不能单独证明“必须自动化”,但它们共同指向一个事实——人工无法稳定维持同一规则在几百个页面上的执行。
可行的做法是先用模板生成候选标题与描述,再抽样人工审核。假设你有 300 个产品页,模板规则是“品牌词 + 品类词 + 型号”,生成后随机抽 30 个检查是否出现重复、超长、语义不通。如果抽样里超过一小部分不合格,说明模板规则本身需要调整,此时不应继续扩大生成范围。这个动作的结果直接影响下一步:规则稳定后再批量写入,写入后保留一份旧值备份,便于对比和回退。
内链里有两类工作。一类是“每篇文章自动链接到所属分类”,规则明确、可枚举,适合批处理;另一类是“这篇旧文该不该指向那篇新文”,依赖语义判断,手工反而更稳。把这两类混在一起,是规模扩大后最常见的浪费。
结构化数据同理。如果所有文章页都需要同一套字段,且字段来源固定在几个位置,就可以用统一模板输出;如果字段需要逐页人工确认,比如活动时间、价格区间,就不适合硬套模板,否则错误会成批出现。判断依据是字段来源是否稳定,而不是字段数量多少。
规模变大后,逐页查询是否被索引会消耗大量时间。更实际的做法是按目录或模板分组,观察每组被索引的比例变化。注意,抓取量或索引量某次归零,不能单独证明你的处理正确或错误,它也可能是统计口径变化、抓取预算临时波动、或页面本身被合并。需要结合页面是否仍可访问、是否返回正常状态、是否有其他入口指向它来判断。
一个可执行动作是:先选一个目录做小范围调整,记录调整前后的分组索引比例,再决定是否推广到其他目录。如果调整后比例没有明显变化,下一步不是加大调整力度,而是先排查这些页面是否本来就该被合并或删除。这一步把“批量检查”从人工逐页查询,转成了按组对比,节省的时间可以留给真正需要判断的页面。
规模扩大后的取舍不是“手工还是自动化”,而是“哪一部分必须由人判断”。标题与描述的模板、内链的固定规则、结构化数据的统一字段、索引状态的按组对比,都属于重复且可枚举的工作,继续手工做会拖慢整体节奏,还容易在回滚时失去控制。内容取舍、页面合并、优先级排序这些依赖上下文的工作,仍然需要人来做。先做一份规则表,再用小范围验证决定是否全量执行,是比直接写脚本更稳的起点。