先给结论:升级后评分变化,优先怀疑评分规则本身变了,而不是排名真的集体挪动。判断方法是拿同一批词、同一天的数据,在新旧两套规则下各算一遍,看差异是集中在特定类型的词上,还是均匀散布。若差异集中在少数词,多半是规则对某些特征加权变了;若几乎每个词都平移一段,那是基准线或归一化方式换了。下面用一组假设数据把这套判断走完,并说明什么条件下该沿用旧结论、什么条件下必须重做决策。
评分前后的差异,通常来自三个互不相同的地方,混在一起就会得出错误结论。
区分方法很直接:把新旧规则套在同一份冻结的原始数据上。如果分数仍然不同,规则或口径变了;如果分数一致,那差异来自新抓的数据。这一步做完,后面的解释才有立足点。
以下为假设示例,仅用于说明比较方法,不代表任何工具的实际表现。
假设某业务长期跟踪 200 个词,升级前平均分 62,升级后同一批词平均分 48。团队第一反应是“排名掉了”。但按上面的方法拆开看:把升级前的原始排名数据用新规则重算,平均分是 50;把升级后抓的数据用旧规则重算,平均分是 61。这说明分数下降主要来自规则,排名本身只挪动了一点点。
再看分布:分数下降最多的 30 个词,都是长尾、竞争度低的词;头部核心词的分数几乎没动。这种“局部塌陷”通常意味着新规则对低竞争度词的加分项被削弱,而不是这些词真的掉了。反过来,如果所有词都平移了相近的幅度,更可能是基准线或归一化区间被重新定义,此时词与词之间的相对顺序往往没变,排序结论仍可沿用。
差异形态不同,处理方式应当不同,这里给出可操作的分界。
一个实际动作:从词表里抽 20 个词,手工核对它们在两次查询中的实际结果页位置,与两套评分对照。如果手工位置与新评分一致、与旧评分不符,就接受新规则;如果手工位置与两套评分都不一致,说明评分与真实位置之间本就存在偏差,此时换规则并不能解决你真正关心的问题。
有几种常见解释看似合理,实际经不起检验。
另外,若评分中包含无法从外部复现的加权项,就不要把它当作可解释的业务指标,只当作筛选工具使用,决策依据仍回到实际结果页位置和业务数据。
规则变动不会只发生一次。建议在词表里固定保留一小批“锚点词”,覆盖头部、中部、长尾三类,每次规则或数据口径变化时先看这批词的分数走向。锚点词稳定,说明变化影响有限,可以继续用历史序列;锚点词剧烈变动,就应把变化前后的数据分段保存,不把两段拼成一条趋势线。
具体到工具层面,不同产品的评分定义、更新频率和导出字段各不相同,涉及具体品牌时需以该工具当期说明为准,不要凭旧印象推断其现行规则。真正能跨工具复用的,只有上面这套“冻结数据、分离规则与数据、按差异形态决策”的流程。走完这一步,你得到的不是一句“分数变了”,而是一个明确的判断:哪些结论可以继续用,哪些必须重算。