先检查一个被忽略的条件:报告里的“页数”统计的是抓取到的 URL,而不是去重后的对象数量。带参数的链接、同一产品的分页、http 与 https 的重复入口,都会让一个对象对应多条记录。所以去重不是删行,而是先定义“什么算同一个对象”,再按这个定义合并。
打开报告,挑出你怀疑重复的那几条记录,不要先删,先列出它们共有的字段。常见的对象身份由这几项组合决定:
把其中任意一组写成去重规则,例如“主域名 + 路径去除查询参数”。这一步的产出是一句可执行的判断条件,而不是感觉上的“看起来像重复”。如果规则写不出来,说明你还没找到真正的对象标识,后面的合并都会反复。
规则写好后,回到报告做一次反向验证:把符合规则的记录分组,看每组里是否真的只有一个业务对象。假设你导出 1200 行 URL,按“路径去除查询参数”分组后得到 900 组,那么有 300 行属于同组重复。这个数字只是验证规则的中间量,不代表抓取异常,也不代表去重后的最终结果。
如果分组后仍有明显不该合并的记录,比如两个不同产品共用同一路径前缀,就要把规则收紧,加入产品编号字段。反过来,如果分组后还有大量“一个对象多条记录”没被覆盖,说明规则漏了条件,常见遗漏是大小写差异和结尾斜杠。处理方式是统一转小写、统一去掉末尾斜杠,再重新分组。
去重完成,数量下降时不要直接归因于“之前统计错了”。数量变化至少有三种合理解释,需要分开确认:
要区分这三种情况,可以抽样十组,逐组对照原始链接和业务系统里的对象。如果十组里超过一半的合并是正确合并,规则可以继续用;如果错误合并集中在某一类路径,就针对该类路径单独放宽规则。这个抽样动作会直接决定下一步是扩大去重范围还是回退规则。
去重后的对象清单才是可以继续用的输入。下一步通常是把清单按落地页或产品线分组,再分配给对应的人处理。如果去重前就分配任务,同一个人可能收到同一对象的多个链接,重复劳动会掩盖真正需要处理的新对象。
一个可操作的检查点:去重后清单里每个对象只保留一条主链接,其余链接作为备注字段保留。这样既不会丢证据,也不会让执行人员重复打开同一页面。保留备注的另一个作用是,当以后报告再次出现数量不一致时,可以快速确认是规则问题还是数据源本身变化。
去重规则不是一次设定就长期有效。当推广软件更换数据源、站点改版或新增渠道时,原本能合并的链接可能变成不同对象,原本不同的对象也可能被合并成一条。每次报告数量出现明显波动时,先按本文的字段组合重新验证一次规则,再决定是否调整。具体到某个工具是否提供去重字段、字段名称和导出选项,需要以你当前使用的版本为准,不要直接套用其他工具的界面描述。