结论先给:如果缺失集中在某一设备,而该设备在你的业务里承担不同任务,那么直接把剩余数据当成全体,结论通常会偏向“另一类设备的行为”。判断偏差是否成立,不取决于缺失比例有多大,而取决于三件事:该设备是否与查询意图相关、缺失是否与词本身相关、你能否用独立证据交叉验证。旧内容、旧系统或旧合作关系退出时,这个判断尤其重要,因为你要决定“保留哪部分价值”,而不是简单砍掉一个渠道。
移动端搜索词报告缺失,常见解释有三种,不能只归因于一种:
区分方法不是看总量,而是看结构。取同一批词,分别按设备看它们在展现、点击、站内搜索词三个来源里是否同时出现。如果某设备在展现层有词、在站内层没有,那更可能是记录或路径问题;如果三个来源都稀薄,才更接近行为性缺失。假设一个旧产品页准备下线,移动端搜索词报告几乎没有该页相关词,但站内搜索和客服记录里移动端仍在问同一批问题——这时缺失是记录问题,不是需求消失,直接下线会误判。
偏差是否影响结论,要看缺失是否“随机”。随机缺失只会让样本变小,不会系统性改变结论;非随机缺失才会让结论偏向某一侧。判断非随机,可以看一个信号:缺失是否集中在特定词族。例如品牌词、型号词、故障词在移动端几乎全无,而通用词还在,这通常说明移动端用户走的是另一条入口,不是没有需求。
反过来,如果缺失均匀分布在所有词族上,只是量少,那么基于剩余数据做的相对比较(比如哪类词更值得保留)仍可能成立,但绝对量结论不成立。这一步决定了你下一步是“补数据”还是“换判断维度”。
有一种情况会推翻“缺失即偏差”:该设备上的访问本来就不产生可分析的搜索词。比如设备只用于扫码、站内跳转或应用内打开,用户从不经过搜索框。此时缺失不代表记录问题,也不代表需求被低估,而是这个设备在你的分析对象里本就不承担搜索任务。把它当作“被遗漏的样本”去补,只会引入噪声。
识别这个反例的动作:查该设备上是否存在独立的入口路径。如果绝大多数会话从非搜索入口进入,那么搜索词分析对该设备本就不适用,结论应限定在“搜索入口覆盖的设备范围”内,而不是宣称覆盖全部用户。
当旧内容、旧系统或旧合作关系需要退出时,设备缺失会直接影响“保留清单”。可执行的动作是:把待退出对象按词族分组,对每组标注三个状态——该设备有无搜索词、站内有无对应需求、其他设备是否仍在产生相关词。只满足“其他设备有词”而本站内无需求、缺失设备也无入口的组,可以优先退出;缺失设备仍有站内需求的组,应先补记录再判断,而不是直接砍。
这个动作的结果会改变下一步:如果补记录后该设备词量回升,说明之前是口径问题,保留决策要重做;如果补记录后仍无词,但站内需求持续,说明需求走了非搜索路径,应把保留依据从搜索词换成站内行为,而不是继续用搜索词报告下结论。
最终输出不要写“某设备需求低”,而要写清前提:在搜索入口覆盖的设备范围内、在现有记录口径下、该设备搜索词稀薄,因此搜索词不能作为该设备的保留依据。这样即使后续记录补齐,结论也不会被当成永久事实。对旧对象的退出决策,保留条件应与证据来源绑定,而不是与设备标签绑定。缺失数据本身不是结论,它只是提示你换一个证据来源继续验证。