先看评分变化的范围:如果只有分数变动而排序、建议动作和实际流量结构基本没变,多半是评分口径调整;如果分数变动同时伴随建议动作反转、任务失败率上升或索引与流量结构变化,才需要按业务影响重新决策。解释差异的关键不是比较两个分数,而是比较同一批对象在升级前后被如何分组、扣分和给出下一步动作。
工具升级后规则评分变化,通常来自两种不同原因。第一种是评分口径变化:权重、阈值、扣分项或采样范围被调整,导致同一批对象得到不同分数,但对象的实际状态没有改变。第二种是业务变化:抓取覆盖、页面状态、外链结构或内容供给在这段时间确实发生了改变,评分只是把这个改变反映出来。
区分方法是对同一批对象做前后对照,而不是看整体平均分。假设升级前有100个对象,评分分布是70分以上60个、50到70分30个、50分以下10个;升级后变成70分以上40个、50到70分45个、50分以下15个。如果这100个对象的实际状态在这段时间没有可验证的变化,那么分数整体下移更可能是口径变化。如果下移集中在某一类对象上,比如只有新提交的页面或只有某一种内容类型,则更可能是规则对该类对象的判定方式变了。
还需要排除第三种解释:抓取或采集本身出了问题。请求量下降、样本量减少、部分对象未被重新评估,都会让评分看起来变了,但这不代表规则变化,也不代表对象变差。看到分数变化时,先确认参与评分的对象数量和对象集合是否与升级前一致,再谈规则。
如果确认对象状态没变、只是评分口径变了,不要立刻按新分数大批量改动作。此时旧决策仍然成立,因为业务依据没有变。需要做的是把新分数映射回旧分组,确认哪些对象只是分数下降、实际仍处于可接受状态。
具体动作是建立一张对照表:对象标识、升级前分数、升级后分数、升级前后建议动作、实际业务指标。对分数下降但建议动作未变的对象,暂不处理;对分数下降且建议动作从“保持”变成“修改”的对象,先抽一小批验证,看按新建议执行后业务指标是否改善。如果验证结果没有改善,说明新阈值可能过于敏感,应保留旧动作,只把新分数作为参考。
这个动作的结果会直接决定下一步:如果抽样验证显示新建议有效,再扩大到同类对象;如果无效,就不应把新分数当作执行依据,而是把它当作观察指标,等待更多批次数据再判断。
如果评分变化同时伴随可验证的业务变化,比如某类页面的抓取频次下降、某类内容的转化路径变长,那么新分数反映的是真实状态,应按新分组重排优先级。此时旧决策不再适用,因为前提已经变了。
实施动作分三步。第一步,按新分数把对象重新分成高、中、低三组,并记录每组对应的业务指标。第二步,对低分组中分数下降幅度最大的一批对象,先处理影响面最大的共性问题,比如统一的内容缺口或统一的技术状态,而不是逐个对象改。第三步,处理完一批后重新评估,看分数和业务指标是否同步改善。如果分数改善但业务指标没动,说明评分与业务目标之间的对应关系需要重新校准;如果业务指标改善但分数没动,说明该评分对这类对象不敏感,不应作为唯一依据。
例外情况是:当评分变化来自采样范围调整,比如升级后只评估了部分对象,那么新旧分数不可直接比较。此时应先补齐对象集合,再做分组,否则会把采样差异误判为规则差异。
要向团队或客户解释前后差异,至少需要四类证据:升级前后的对象集合是否一致、评分规则或阈值是否公开变化、同一批对象的分数变化分布、以及分数变化与业务指标变化是否同步。缺少其中任何一项,解释都只能停留在猜测。
这四类证据中,对象集合一致是最容易被忽略的一项。很多所谓规则变化,实际是升级后评估范围变了。先确认这一点,再谈规则和业务,能避免把采样差异当成规则差异来处理。
处理顺序可以固定为:先确认对象集合是否一致,再判断是口径变化还是业务变化,最后决定保留旧决策还是重排优先级。只有口径变化且建议动作未变时,保留旧决策;口径变化且建议动作反转时,先抽样验证;业务变化且指标同步变化时,按新分组重排优先级。这个顺序的适用条件是:你能够拿到升级前后的对象级数据,而不是只有汇总分数。如果只有汇总分数,无法区分口径变化和业务变化,此时应优先补齐对象级数据,而不是急于调整执行动作。
评分只是工具给出的一个信号,它不能单独证明处理正确,也不能单独证明对象变差。把评分变化放回对象集合、规则说明和业务指标三个参照系里对照,才能给出经得起追问的解释,并据此决定是继续沿用旧动作,还是按新分组重新安排下一步。