在网站关键词分析里,把同一用户的多次咨询当成多个用户,是最常见的口径错误。结论是:只有当你能把咨询记录稳定地归并到同一个可识别主体时,才算人数;否则你手里只有次数。这个结论有一个失效条件——如果同一个人在多设备、多浏览器、未登录状态下反复咨询,而你又没有任何跨端标识,那么无论怎么去重,得到的仍然只是次数,不是人数。此时继续在人数口径上做判断,会系统性高估触达规模。
次数是原始事件数,每产生一条咨询记录就加一;人数是去重后的主体数,同一主体无论咨询几次都只算一个。两者的差距大小,取决于重复咨询的比例。如果某关键词带来的咨询里,重复比例很高,那么次数看起来可观,人数可能很小。
要区分二者,先看记录里有没有一个稳定的主体标识:登录账号、已确认的手机号、已确认的邮箱,或你自己发放并绑定的身份编号。有这些标识,才具备归并的基础。只有会话 ID、IP、设备指纹这类弱标识时,归并结果只能当作近似值,并且要明确标注它是近似值。
假设某关键词带来的咨询记录中,同一个账号出现了三次,你把它归并成一个人,人数口径下降。但如果这三次其实来自同一账号被多人共用,或者同一人在清理浏览器后重新以访客身份咨询,那么归并结果就同时存在漏合和错合两种误差。
更隐蔽的情况是:访客标识在用户清缓存、换设备、开启无痕模式后都会变化。此时你会把同一个人算成多个人,人数被高估;反过来,如果同一台设备被多人轮流使用,你又会把多个人算成一个人,人数被低估。这两种误差方向相反,可能互相抵消,也可能叠加,所以不能凭“看起来差不多”就认定口径可靠。
不要只依赖单一标识。可以按下面的顺序搭一条证据链,每一步都留下可回查的记录:
如果强标识覆盖率很低,那么你的人数结论主要来自近似归并,可信度有限;如果覆盖率较高,人数口径才站得住。这个覆盖率本身就是判断下一步该不该继续用人数指标的依据。
假设某关键词在一个统计周期内产生 30 条咨询记录(次数口径)。其中 18 条带有已确认的手机号,归并后对应 12 个人;剩下 12 条只有会话标识,按会话归并后对应 10 个人,且无法确认这 10 人是否与前面 12 人重叠。此时你能确定的人数下限是 12,上限是 22,真实值落在区间内。这个区间比一个精确但来源不明的数字更有用,因为它明确告诉你证据不足在哪里。
如果覆盖率偏低,优先动作不是继续调分析口径,而是补上主体标识的采集路径,例如在咨询流程中引导用户留下可确认的联系方式,或在登录后把咨询记录与账号绑定。做完这一步后重新统计覆盖率,只有当覆盖率明显提升、近似归并占比下降时,人数口径才值得作为后续判断的基础。在此之前,把次数当作次数用,不要把它包装成人数。