能不能连,取决于新旧数据源在“统计对象”和“归一方式”上是否一致,而不是取决于曲线画得是否顺眼。如果旧数据源统计的是搜索量估算值,新数据源统计的是点击量或展示量,两条曲线即使首尾相接,中间那段也不具备可比性。只有当两个来源在地区、时间粒度、设备口径和去重规则上基本对齐时,历史曲线才值得拼接;否则更稳妥的做法是保留断点,把换源后的数据当作一条新基线重新观察。
实际操作中常见的情况是:抽三五个词比对,新旧两套数据走势接近,于是判断可以无缝衔接;等把几百上千个词一起拉出来,才发现整体曲线在换源节点出现台阶。这个矛盾并不说明小样本比对没意义,而是说明小样本覆盖不到口径差异被放大的那部分词。
典型放大机制有两种。一种是长尾词占比高的集合,对数据源的覆盖广度更敏感,新源如果对低频词做了合并或截断,整体均值会被拉低。另一种是品牌词、本地词集中的集合,对地区归属和匹配方式更敏感,换源后同一批词被归入不同聚合层,曲线自然错位。
换源后曲线断开,只有两类合理解释,区分它们决定了你下一步该做什么。
这两种解释可以同时成立,所以不要指望一次比对就能分清。要做的是找出能把它们分开的证据。
如果条件允许,在正式切换前让新旧两个来源并行跑一段重叠期,比如两到四周。把同一批词在两个来源下的日序列画在一起,观察差异是稳定的比例关系,还是随词、随时间变化。稳定的比例关系更支持口径漂移;差异随词类和时间漂移,则提示两个来源在覆盖或聚合上本就不同。
取换源前后各一个等长窗口,对同一批词按数值排序,比较排序相关性。如果排序基本保持,只是整体水平移动,那么历史曲线可以通过缩放或平移做有限衔接;如果排序大幅重排,说明两个来源对“哪些词更重要”的判断不同,强行连接会掩盖真实结构。
找一个不依赖这两个数据源的信号做参照,例如站内搜索日志、广告账户的展示份额变化、或内容页的自然点击趋势。如果站内信号在换源节点前后连续,而工具曲线出现台阶,台阶更可能来自口径;如果站内信号同步跳变,就不能把断点全归给数据源。
假设某站点在三月中旬把关键词数据从来源 A 换到来源 B,发现整体曲线下降约两成,但排名前十的词位次没变。按上面的证据框架:重叠期若显示两来源比值稳定在 0.8 附近,且站内搜索日志同期平稳,那么可以判断这主要是口径缩放,历史曲线可以按比例做有限衔接,但要在图上标注断点。反之,如果重叠期比值在 0.6 到 1.1 之间波动,且站内日志同期也走低,就不能衔接,应当以换源日为起点重建基线。这里的两成、0.8 都是假设数字,只用于说明比较方法,不代表任何工具的实际表现。
先固定一批对照词,覆盖头部、长尾和品牌三类,分别计算换源前后的水平变化和排序变化。水平变化小、排序变化小,才考虑衔接;只要有一类词出现结构性重排,就保留断点。这个动作的结果直接决定下一步:可以衔接时,后续分析沿用旧基线并标注口径;不能衔接时,把换源后的数据单独建基线,历史对比只做定性描述,不做数值外推。
需要提醒的是,请求量、抓取量或某个指标归零,都不能单独证明换源处理正确,它也可能是采集延迟、过滤规则收紧或权限变化造成的。具体工具在换源后的字段定义、覆盖范围和可用历史长度,属于会随版本调整的信息,需要以你实际使用的界面和说明为准,不要照搬他人截图里的结论。