先给结论:当一批页面只有一部分被发现,对照组不要按“已发现/未发现”来分,而要先按“是否具备独立可抓取路径”分。缺少完整日志和权限时,仍可做的最小动作是:从站点地图、内链、外链三类入口各取一批页面,记录它们是否被引用、引用来自哪里,再把“有独立入口”和“只有站点地图入口”分成两组。这样做的结果决定下一步:如果差异集中在入口类型,就先去修入口;如果两组表现接近,就不能把未发现归因于入口,需要转向抓取预算、渲染或屏蔽规则的排查。
条件一:你能拿到部分抓取记录或至少能观察入口来源。此时按“入口组合”分组,而不是按页面类型分组。可以把页面分成:同时有内链和站点地图、只有站点地图、只有内链、两者都没有。每组至少放几个页面,不要只挑一个。分组后比较各组的发现比例,若“两者都没有”这组明显更低,说明入口缺失是合理解释之一;若“只有站点地图”也不低,说明站点地图仍可能起作用,但站点地图不保证收录,不能据此断定站点地图有效。
条件二:你没有任何抓取记录,也看不到服务端日志。此时不要硬造“已发现/未发现”对照,因为发现与否本身可能来自不完整的外部观察。可退一步,按“页面是否被至少一个站内链接指向”分两组,并记录该链接是否在导航、列表页或正文中。这个最小动作的产出是入口清单,而不是收录结论。若两组在后续抽查中都没有明显差异,就不能推出“内链无效”,只能说明当前证据不足以支持该判断。
可区分的原因至少有三类。第一类,入口问题:页面只存在于站点地图,站内没有任何链接指向它,外部也没有引用。第二类,抓取限制问题:页面被 robots.txt 挡住,或返回了不合适的抓取状态。第三类,渲染或内容问题:页面能抓取,但主要内容依赖脚本生成,初始响应里看不到。三类信号不同:入口问题看链接图,抓取限制看响应和规则,渲染问题看初始 HTML 与渲染后内容差异。若你只看到“一部分被发现”,先别把所有未发现都归到同一类。
还有一个容易被忽略的解释:抓取量或发现量下降,不等于处理正确。它可能是站点整体抓取频率变化、外部链接波动、服务器响应变慢,或观察窗口太短。把这些可能性列出来,才能避免把相关当因果。
这个动作的关键是:先分组,再动手;动手后只比较同一组的前后变化。否则你无法知道是入口修补起了作用,还是别的原因同时发生了。
例外一:站点地图不保证收录。即使你把页面全部放进站点地图,也不能据此认为它们一定会被发现。例外二:robots.txt 的抓取限制不等于可靠的索引移除。它只影响抓取,不保证页面从索引中消失。例外三:HTTPS 不保证安全无漏洞或排名,不要把它当作分组变量。例外四:不同搜索引擎支持情况须分别核查,同一组页面在不同引擎下的发现比例可能不同,不能混在一起下结论。
不能推出的结论包括:某组发现比例低就一定是内链问题;站点地图提交后没变化就说明站点地图无效;抓取量归零就说明页面被正确移除。这些现象都有其他合理解释,需要继续用分组和动作去排除。
假设有 40 个页面,其中 25 个有站内链接,15 个只有站点地图入口。你无法拿到完整日志,只能抽查。抽查发现:有站内链接的组里,多数页面在初始 HTML 中能看到标题和正文;只有站点地图的组里,多数页面初始 HTML 只有框架,正文靠脚本加载。此时不能直接说“站点地图没用”,因为两组还同时存在渲染差异。下一步应把“只有站点地图”的组再按“初始 HTML 是否含正文”分成两小组,分别补内链或修渲染,再比较结果。这个例子说明:分组要尽量让一个组内只保留一个主要变量,否则动作结果无法归因。