能拼,但不能直接相加。可行做法是:保留旧URL的统计序列,以改名生效日为分界点,把新URL的序列接在旧序列之后,并在接缝处标注一次“口径变更”。如果旧URL在改名后仍返回内容、仍被访问,或者改名与模板、导航、内链调整同时发生,这种拼接就会失效,此时应把改名当成一次独立事件单独观察,而不是并入原有趋势线。
拼接的本质是让两条时间序列在语义上连续。它成立需要两个条件同时满足。
两个条件都满足时,拼接后的序列可以用于观察“这个内容主题”的长期走向。两个条件缺一个,拼接仍然可以做,但只能当作记录留档,不能当作判断依据。
第三方估算流量、搜索引擎自己提供的报告、站内日志或统计脚本,三者的计数对象并不相同:一个估的是模型推算的访问规模,一个统计的是被展示或被点击的次数,站内统计则依赖脚本能否执行、是否被拦截。同一段时间里,这三类数字本来就不该相等。
所以拼接前后记录时,要对齐的是这几件事:
只要这四项在前后两段保持一致,拼接后的曲线就有可比性;其中任何一项在改名时被动过,接缝处就会出现无法解释的跳变。
假设某页面在三个月前从旧地址改到新地址,站内统计显示旧地址最后一周有若干次访问,新地址第一周的数字明显偏低,之后逐周回升。这时有三种解释,不能只挑一种:
区分方法很直接:先看新地址的统计代码是否与旧地址一致,再看旧地址在改名后是否仍有访问记录。如果旧地址访问量在改名后立刻归零、新地址同期也没有对应增量,更可能是统计口径断了,而不是流量真的消失。反过来,如果旧地址仍有稳定访问、新地址同步增长,说明存在两条并行入口,此时两段数字必须分开看,不能合并成一条趋势线。
对单个页面做拼接,人工核对四项口径是可行的。但当改名涉及成百上千个页面时,逐个拼接会迅速失控,原因有三点。
一是归属规则难以统一。批量改名往往由脚本或模板驱动,旧地址的失效时间、新地址的上线时间存在先后差,跨天甚至跨周,接缝位置不再是一条清晰的竖线。
二是部分页面的旧地址会被保留为可访问状态,用于承接外部链接。这些页面的两段序列天然重叠,任何相加都会高估。
三是当改名与站点结构重组同时发生时,页面之间的内链关系被重写,单页序列的波动里混入了其他页面的分流效应,已经不是这一个页面自身的变化。
因此,规模化场景下更稳妥的做法是:只对少量有代表性的页面做精细拼接,其余页面改用“改名前后各取一个等长窗口做对比”的方式,明确标注这是区间对比而非连续序列。两者结论不一致时,以精细拼接的样本为准,并说明它不能直接推广到全站。
无论样本多少,第一步都应固定一份改名清单:记录每个页面的旧地址、新地址、改名生效时间、旧地址当前状态,以及改名同期是否还有其他改动。这份清单决定了后续任何拼接是否可信。
做完这一步后,如果发现旧地址仍有访问、或统计代码前后不一致,就不要急着画趋势线,先处理这两个问题,再重新取数。只有当旧地址状态明确、统计口径前后一致、且改名是同期唯一结构性变化时,拼接出的序列才可以用来回答“这次改名到底有没有影响这个页面的表现”。