业务问题与数据口径
练习”数据 → 指标 → 漏斗 → 分层 → 建议”的完整产品分析链路。原始数据为阿里天池 UserBehavior(2017-11-25 ~ 12-03,约 100 万用户 1 亿条行为)。
抽样口径是本案例的第一个决策点:最初按行级抽 10 万行,结果摊到 9.2 万用户、人均仅 1 条——用户级指标被严重稀释。改为用户级抽样:固定 seed=42、强制单线程,抽 1 万用户保留其全部行为(1,021,043 条);清洗窗口外脏时间戳(剔除 566 行,0.06%)后 1,020,477 行。同 seed 两次运行结果完全一致,报告数字可复现。
指标总览(口径先行)
| 指标 | 口径定义 | 数值 |
|---|---|---|
| PV | 窗口内 behavior_type=pv 的行为条数 | — |
| UV | 窗口内去重用户数 | 10,000 |
| 加购率(用户) | 有加购行为的用户 / UV | 75.2% |
| 收藏率(用户) | 有收藏行为的用户 / UV | 39.6% |
| 宽松漏斗第 1→2 层 | 浏览 → 加购/收藏 的 UV 转化 | 87.6%,流失 12.4% |
| 逐层转化 | 中间层 → 购买 | 77.7% |
| 复购率(代理口径) | 窗口内购买行为 ≥2 次的用户占购买用户比(未按订单去重) | 66.0% |
| RFM 分层对象 | 窗口内有购买行为的 6,788 用户;M 以购买频次代理(数据集无金额) | 重要价值 24.5% / 一般挽留 37.8% |
四条结论与产品建议
| # | 结论 | 数据依据 | 产品建议 |
|---|---|---|---|
| 1 | 加购意愿约为收藏的 1.9 倍,加购是主转化锚点 | 加购率 75.2% vs 收藏率 39.6% | 再营销以”加购”为主信号,收藏为辅 |
| 2 | 加购未购是最大的可运营流失人群 | 加购 7,432 人中 2,103 人(28.0%)未购 | 定向催付(限时券/降价提醒) |
| 3 | 尾段 DAU 跳升 +34.4%,但归因混杂 | 跳升日与周末、窗口尾部双重重合;开头周末无跳升 | 先归因再决策:延长窗口验证 |
| 4 | 决策链路短,优化重点在”浏览 → 加购” | 逐层转化 77.7%;第 1→2 层流失 12.4% | 资源投向前层而非付款环节 |
一条归因警示(本案例最想讲的)
DAU 在 12-02、12-03 跳升至 9,829 / 9,781,较前五日均值高出 34.4%。跳升日恰逢周末且是窗口尾部——但窗口开头的周末(11-25/26)DAU 与工作日无异。两个”周末”表现截然不同,说明周末效应与窗口尾部效应混杂,仅凭 9 天窗口无法归因。这是”不该拿单一窗口数据直接下运营决策”的典型案例。
局限与后续迭代
- 宽松漏斗未校验行为先后顺序,严格有序漏斗是迭代项;
- M 为代理口径(无金额字段),涉及客单价的结论不可下;
- 抽样占比 1%,绝对量级结论(如 DAU)不可外推全站;
- 复购率未按订单去重,严谨复购需订单级数据;
- 单窗口无法做时间归因,需要更长窗口。
完整图表、代码与逐节数值见上方嵌入的 Quarto 报告。