先把“页数”和“对象数”当成两种计数口径:报告页数通常等于分页次数,对象数等于去重后的唯一实体数。两者不一致,多半是分页切割、重复导入、跨渠道同一对象被拆成多行造成的。处理顺序是:固定一个唯一标识、按标识去重、再决定哪些旧记录退出、哪些部分保留。
拿你手里的那份导出文件,先看三列:页码或行号、对象名称、唯一标识(如ID、邮箱、域名、素材编号)。如果同一标识出现在多页,说明是分页重复;如果标识不同但名称相同,说明是命名不统一;如果标识为空,说明这一列不能作为去重依据。
常见的三种原因可以这样区分:
如果去重后对象数仍然大于你预期的实际数量,先不要删记录,改为抽样核对:随机抽十条,逐条确认它对应的是真实对象还是测试数据、历史遗留或已经退出的合作关系。
去重只是把重复行合并,不负责决定旧内容、旧系统或旧合作关系是否该退出。合并之后,按下面的条件分三类:
这里的关键动作是给每条记录补一个“最后活跃时间”字段。没有这个字段,退出和保留就只能靠印象判断;补上之后,你可以按时间阈值先处理最久未活跃的一批,再逐批往下看。
假设你导出了一份报告,共120页,每页10行,合计1200行。按唯一标识去重后剩800个对象。你预期实际对象约600个,差的200个里,有150个是同一对象在三个渠道各出现一次,另外50个标识为空。
处理动作:先合并150个跨渠道重复,得到650个对象;再把50个空标识记录单独列出,逐条补标识或确认是否为测试数据。补完后如果仍有30条无法归类,就把它们放进待确认表,而不是直接删除。结果是主表对象数从800降到620,退出和待确认的部分各有归档,后续复查只需针对待确认的30条。
这个例子里的数字只用于说明比较方法,不代表任何工具的实际数据规模。
如果去重后对象数与实际数量仍然对不上,问题可能不在重复,而在保留标准太宽。这时候不要继续机械去重,改为检查每个保留对象是否满足至少一个条件:最近有数据更新、最近有互动记录、最近有合作或内容仍在线上。
不满足任何一条的对象,可以先移出主表,放入观察区。观察区不参与日常报告,但保留原始字段,方便以后追溯。这样做的结果是:主表只保留当前有效的对象,报告页数和对象数的差距会缩小到可解释的范围。
具体到某个数字营销软件,它的去重规则、字段名称和导出方式需要以你实际使用的版本为准,不同工具对“唯一对象”的定义可能不同。核对时优先看该工具是否支持按自定义标识去重,以及导出时是否保留来源列。如果这两点不支持,去重工作只能在导出后的表格里完成。
现在打开你手里的那份文件,先做一件事:给每一行补一个唯一标识列,能补的补,不能补的标记为空。然后按标识排序,把相同标识的行合并,来源列用分号连接。合并完成后统计唯一标识数量,这个数字就是去重后的对象数。
拿这个数字和你预期的实际对象数比较。如果差距在可解释范围内,按退出、保留、待确认三类分表;如果差距仍然很大,回到命名不一致或空标识这两类原因继续排查。整个过程中,删除永远是最后一步,且只对确认退出的记录执行。