直接回答:把考核对象从“pr值这个数字”改成“当初用这个数字想约束的行为”,再用今天仍可复查的证据去衡量该行为。旧评分本身仍可作为历史参考,但不能再作为绩效结论的唯一依据,否则考核会奖励一个早已无法稳定获取、也无法解释来源的数值。
假设某内容团队三年前把pr值写进编辑考核:达到某个区间就算达标,低于该区间要复盘。最初只有几十个页面时,这个规则看起来有效,因为负责人能逐页看内容质量,评分只是辅助信号。后来页面规模扩大到几千个,团队发现同样的评分区间里,既有认真维护的页面,也有长期没人更新、只是外链结构碰巧占优的页面。个别样本成立,规模化后出现例外,这就是需要重新定义观察对象的信号。
这里的关键不是评分本身对错,而是它衡量的东西和团队真正想要的东西发生了偏移。旧评分反映的是链接关系的一种历史近似,而考核想约束的通常是内容是否被维护、是否被引用、是否带来有效访问。两者在样本少时可以靠人工判断补上,规模化后补不上,例外就会变成常态。
重新定义时,可以先问一句:当年定这个评分,是想阻止哪种行为?常见答案是“防止只堆页面不维护”。那么新的观察对象就应该是维护行为本身,而不是维护行为的某个代理数字。
这些证据的共同点是可复查:换一个人按同样口径看,能得出接近的结论。旧评分做不到这一点,因为它的计算过程不透明,且可能已经停止更新。
具体动作可以这样设计。把现有页面按旧评分分成高、中、低三层,每层随机抽取相同数量的页面,用上面四项证据逐页打分,然后比较两层结论是否一致。假设抽了三十个页面,发现高分层里有相当比例的页面长期未更新,而低分层里反而有持续维护的页面,这就说明旧评分与目标行为已经脱节。这个结果会直接影响下一步:如果脱节明显,考核就应改用行为证据;如果大部分一致,可以把旧评分降级为参考项,而不是直接删除。
需要提醒的是,抓取量下降、评分不再更新这类现象,不能单独证明旧评分失效。它也可能来自统计口径变化、样本量太小或抓取策略调整。判断前至少要排除这些替代解释,否则容易把一次波动当成长期趋势。
旧评分并非一无是处。在页面数量少、团队对每个页面都熟悉的情况下,它仍能作为一个粗略的历史标记,帮助识别早期积累的链接结构差异。但以下边界不能越过:
如果团队确实需要保留一个数字型指标,更稳妥的做法是把它定义为“历史参考分”,只用于回溯,不参与当期评级。当期评级交给可复查的行为证据,并明确抽查比例和复核人。这样既保留了旧概念的解释价值,又避免了用无法核实的数字决定人的绩效。
回到那个假设情境:当团队把考核对象从评分改成维护行为后,规模化带来的例外不再被掩盖,因为每个结论都能追溯到具体记录和具体判断。旧评分可以留在档案里,但它不再是决定谁达标的那把尺子。