先把“已被发现”定义清楚:以服务端日志里出现抓取请求,或以站点地图报告中该 URL 被读取为准,而不是以你提交过、或搜索结果里能搜到为准。然后把未发现的页面按可解释变量切成两组:一组是本次要主动处理的候选组,另一组是暂时不动的对照组,两组只允许一个变量不同,其余属性尽量接近。这样做的目的不是立刻提升收录,而是让你在下一轮动作后能判断差异究竟来自你的改动,还是来自页面本身的类型差异。
批量页面只被部分发现,最常见的原因是这批 URL 并非同质。切割依据要选那个最可能影响抓取行为的属性,而不是选最方便导出的字段。三种切法适用条件不同:
如果三种属性同时存在且互相纠缠,不要强行做多因素交叉,先固定其中两个,只让一个变化。样本量不足时,宁可缩小范围,也不要为了凑数量把不同模板混进同一组。
划分对照组之后,你要为候选组选一个动作。动作不同,对照组的设置方式也不同。
如果未发现页面与已发现页面内容质量接近,差别只在内链入口或所在目录深度,那么优先保留原 URL,只补内链或调整入口位置。此时对照组保持内链不变,候选组增加从高抓取频率页面指向它的链接。下一轮观察日志时,比较两组新增抓取请求的数量变化,而不是比较搜索表现。
如果未发现页面大量集中在同一模板、正文结构雷同,那么问题可能不在抓取路径,而在页面本身缺乏区分度。此时候选组做内容合并或差异化改写,对照组保持原样。需要提醒的是,改写后短期抓取量下降并不能单独证明改写失败,也可能是抓取预算重新分配、站点地图更新延迟或日志采样窗口太短造成的。
对确认无独立价值的页面,退出方式要分清:robots.txt 的抓取限制不等于可靠的索引移除,它只阻止抓取,不保证已索引页面消失;要真正移除,需要配合页面级 noindex 或返回合适的状态码。若只是想让页面不再占用抓取预算,先确认它确实没有外部链接和转化价值,再决定是合并还是下线。
假设某站点有一批商品页,共 400 条,日志显示其中约 120 条被频繁抓取,其余 280 条几乎没有请求。运营发现被频繁抓取的页面大多来自一级分类入口,未被抓取的页面大多只出现在三级分类里。此时可以这样划分:
如果候选组新增抓取明显多于对照组,说明入口深度是主要变量,下一步可以把同样处理扩展到其余未发现页面;如果两组差异很小,说明入口不是主因,应转向检查模板渲染、参数重复或内容相似度,而不是继续加内链。
要让对照结果可用,至少满足三点:两组页面在模板、内容类型、发布时间上足够接近;观察窗口覆盖一次完整的抓取周期;动作只改一个变量。做不到这三点,差异就无法归因。
还要避免几种误判:站点地图提交数量增加不保证收录,它只影响发现路径;被抓取量上升不等于会被索引,索引还需要内容质量与重复度判断;某次日志中请求数为零,也可能是日志轮转、采样缺失或抓取集中在其他目录,不能单独作为处理正确的证据。HTTPS 只解决传输层问题,不保证页面安全无漏洞,也不保证排名。不同搜索引擎对同一批页面的处理节奏不同,若站点同时面向多个引擎,应分别核查各自的支持情况和日志,而不是把一家的结果套用到另一家。
把对照组保留下来,下一轮改动时你才有比较基准;如果每轮都把全部页面一起改,任何变化都无法解释,也就无法判断该继续保留、改写还是退出。