先把“人”和“次”拆成两个不同的计数对象:人数是去重后的咨询者,次数是咨询事件的总量。用户行为分析里真正要决定的是,你打算把“同一个人反复来问”算成一次持续关系,还是算成多次独立互动。两者都成立,但适用的判断目的不同,选错会让后续的留存、跟进和渠道归因全部偏斜。
区分人数与次数的前提,是你能不能在多次咨询之间把同一个人认出来。常见线索有三类:账号或登录态、设备与浏览器标识、以及联系方式。前两类偏行为识别,第三类偏业务识别。
可以先做一个最小动作:从咨询记录里抽取最近一段时间的数据,按你手上可用的线索做一次人工去重,统计“事件数”和“去重后人数”的差值。如果差值很小,说明多次咨询不普遍,按次数统计的偏差可接受;如果差值很大,就必须先确定口径,否则后面任何按人数算的转化都会失真。这个动作的结果直接决定下一步:差值大时优先补身份字段,差值小时可以先沿用事件计数。
次数口径把每一次咨询都当作一个独立事件,适合衡量咨询入口的承载压力和响应工作量。客服排班、消息队列长度、自动回复触发量这类问题,关心的是“发生了多少次”,而不是“有多少人”。
它的代价是会把高频用户放大。假设某位用户因为一个问题反复追问五次,在次数口径里就贡献了五个样本;如果这五个样本被当成五个人的需求,你可能会误判某个问题很普遍,从而错误地调整内容或产品方向。次数口径成立的条件是:你的分析对象是事件本身,而不是人的构成。一旦你要回答“有多少人遇到这个问题”,次数口径就不再适用。
人数口径先做去重,再统计每个人是否咨询、咨询了几轮、是否最终转化。它适合判断需求覆盖面、用户分层和留存关系。比如你想知道新注册用户里有多大比例主动咨询过,人数口径才对应这个问题。
它的代价是依赖身份识别的准确度。去重规则过松,会把同一个人拆成多人,人数被高估;规则过严,会把不同人合并成一人,人数被低估。两种错误不会互相抵消,需要分别检查。一个可操作的做法是:对同一批记录用两套去重规则各跑一次,比较人数结果的差异。差异大,说明身份线索不足以支撑人数口径,此时应退回次数口径,或者只对能确认身份的子集做人数分析,而不是强行给全量数据一个去重结果。
面对“同一用户多次咨询”的记录,处理方式可以对应到保留原始事件、改写成会话、或者退出该口径。
选择哪种,取决于你要回答的问题属于哪一类。要评估人力投入,保留事件;要评估需求人群,改写为会话;两者都无法可靠支撑时,退出人数口径并说明限制。
假设某咨询入口一周内记录到 100 次咨询事件,其中 20 个账号各咨询了 2 次,其余 60 次来自 60 个只咨询一次的账号。按次数统计是 100,按人数统计是 80。如果有人用“100”去推算“有 100 个用户有需求”,就高估了 25%。这个数字只是用来说明两种口径的差距如何计算,不代表任何真实平台的结果。
把假设换成你的数据时,关键不是算出差值,而是看差值是否稳定。如果连续几周差值都接近,说明多次咨询是常态,人数口径必须固定下来;如果差值忽大忽小,可能是某次活动或某个渠道带来了行为不同的用户,需要先分层再决定用哪个口径。第三方估算、搜索报告与站内统计对“咨询”的定义和采集时点本就不同,任何单一指标都不能独立证明用户构成,只能作为一条证据链中的一环。先确定口径,再解释数字,顺序反了,后面的结论都会跟着偏。