先给结论:有效地址集合不是“所有能返回200的URL”,而是一组你愿意为之维护内容、内链和抓取预算的规范地址。当筛选、排序、分页、追踪参数能自由组合时,正确做法是只把能独立满足搜索意图的参数组合纳入集合,其余组合要么归并到规范地址,要么主动拒绝抓取。判断依据不是参数数量,而是每个组合是否对应唯一且稳定的页面内容。
先区分两种条件,选择完全不同。
条件一:参数改变的是内容主体。比如商品列表按品牌、价格区间、库存状态筛选后,结果集明显不同,且用户搜索“某品牌 某价位”时确实需要这个组合。此时该组合可以进入有效地址集合,但要有独立标题、描述和可抓取的内链入口。
条件二:参数只改变展示方式或来源。排序方式、每页条数、会话ID、来源追踪、颜色主题这类参数,不产生新的内容主体。它们不应各自成为有效地址,而应统一归并到一个规范地址,或通过robots.txt限制抓取。
选择依据可以落成一句话:如果两个地址的正文主体可以互相替换而不损失信息,它们就不该同时进入有效地址集合。排序参数是典型例子,按价格排和按销量排,商品集合相同,只是顺序不同,归并即可。
很多人凭“参数太多”直接下结论,但参数多不等于地址集合失控。需要用两类证据分开判断。
这里有一个常见反直觉现象:你限制了某些参数抓取,抓取量下降,但收录量没有同步下降。这不能单独证明限制正确。合理解释至少有三个:那些地址本来就没被收录;收录的是另一个规范版本;或者搜索引擎早已通过内链信号完成了归并。要区分它们,需要对比限制前后同一组地址的收录状态,而不是只看总抓取量。
另一个证据是内链。如果站内链接指向带排序参数的地址,而规范标签又指向无参数版本,信号会互相矛盾。此时先修内链,再谈参数集合,否则任何规则都会被内链反复推翻。
定义有效地址集合的动作顺序很重要,颠倒会制造新的冲突。
一个实际动作及其结果:把排序参数从内链中移除,改为指向无参数规范地址。结果通常是抓取请求向规范地址集中,参数地址的抓取比例下降。下一步要做的是观察规范地址的收录是否稳定,而不是立刻宣布问题解决。如果规范地址本身内容单薄,抓取集中过来也不会转化为有效收录。
假设一个列表页有三个参数:category、sort、page。组合可以无限增长。
category改变结果集,属于内容型。不同分类可以各有规范地址,前提是每个分类有独立可索引的内容。sort不改变结果集,只改变顺序。归并到无sort的规范地址,内链不再输出排序链接。page是分页。第一页是规范地址,后续页是否进入有效集合取决于内容是否可独立满足意图。如果后续页只是同一列表的延续,通常不单独作为有效地址,而是通过分页内链让抓取自然到达。这个例子的假设是:分类页有独立文案和稳定结果集。如果分类页只是空模板,那它也不该进入有效地址集合,即使参数是内容型。参数类型只是第一层判断,内容质量才是最终门槛。
有效地址集合不是一次定死的。出现以下情况时要重新评估。
最后要核实一点:不同搜索引擎对参数处理和规范信号的支持情况并不一致,规则上线后要分别核查,不能用一个引擎的表现推断另一个。HTTPS不改变这个判断,它只解决传输层问题,不解决地址集合是否有效。定义有效地址集合的本质,是明确你愿意维护哪些页面,并让抓取和内链都指向同一组答案。