结论先说:迁移旧页面时,不要试图“保留PR值”,而要把原页面上的资料来源完整搬到新页面,并让每条来源都能追溯到原页面。PR值本身是历史指标,公开可见的数值多为第三方仿值,不能作为资料真实性的依据。真正需要保留的是来源本身:谁说的、在哪说的、什么时候说的、原页面怎么引用的。做法是把旧页面的来源清单先冻结,再逐条映射到新URL,最后用可核验的痕迹证明来源没有在迁移中丢失或走样。
打开旧页面,把页面上出现的所有外部指向和事实出处分成三类,处理方式完全不同。
判断依据不是PR值高低,而是这条来源能否被第三方独立复查。一个PR仿值很高的旧页面,如果来源全是无出处的转述,迁移后依然没有保留价值。
动手改URL之前,先对旧页面做一次来源快照。具体动作是:逐条记录来源的标题、发布方、原始链接、在旧页面中的引用位置(第几段、哪个表格)、引用时的表述原文。这份清单的作用是后续比对的基准,没有它就无法证明迁移后少了什么。
假设一个旧页面引用了五条来源,其中两条是机构报告,两条是新闻转述,一条是已删除的论坛帖。冻结清单后你会发现,真正需要在新页面保留的是那两条机构报告和两条新闻转述的原始出处,论坛帖只能作为历史痕迹标注。这个区分决定了下一步的迁移工作量,也决定了哪些来源值得继续维护。
把旧URL映射到新URL时,来源处理遵循三条规则,但每条都有不能照搬的边界。
个别样本成立不代表可以规模化照搬。一个页面迁移成功,可能是因为它的来源恰好都是一手报告;当你要批量迁移几十个页面时,来源类型混杂、引用位置分散,逐条映射的成本会迅速上升。这时应先按来源类型分组,对每组设定统一处理规则,再抽查边界情况,而不是对每个页面重复同一套手工流程。
迁移完成后,需要留下能证明来源完整性的痕迹。做法是:在新页面上保留来源清单,并让每条来源都能对应回旧页面的引用位置。如果旧页面本身已被删除,应在迁移记录中保存旧页面的来源快照,而不是只依赖搜索引擎的缓存或第三方存档。缓存和存档可能不完整,也可能随时间消失,它们只能作为辅助证据,不能替代你自己保存的清单。
这里要区分两种现象:新页面抓取量下降,可能是因为URL变更后的正常过渡,也可能是因为来源链接失效导致页面质量下降,单看抓取量无法判断原因。同理,旧页面的PR仿值归零,只说明第三方数据源更新了,不能证明来源处理正确或错误。要判断迁移是否成功,看的是来源清单能否逐条对应、链接能否独立访问、引用表述是否与原始出处一致。
把上面的步骤固定成一个顺序,每次迁移旧页面时按此执行:先冻结旧页面来源清单,再按来源类型分组,然后逐条映射到新页面,最后用清单反查新页面是否遗漏。反查发现遗漏时,回到分组规则检查是规则不适用,还是这条来源属于需要单独处理的边界情况。这个顺序的价值在于,它把“保留资料来源”从一个模糊目标变成了可逐条核对的动作,而PR值在这个流程里没有任何位置。