| name | bi-cohort-analysis |
| description | 把用户按同一批/同一类分组,比较各群体后续表现。触发条件:对话涉及同期群分析、分群后表现对比、用户生命周期分群跟踪等任务时触发,如出现「同期群」「cohort」「按起始特征分群后表现如何」「不同客群后续转化/留存对比」「注册周/获客渠道分群跟踪」等相似问题时触发。 |
bi-cohort-analysis
把用户按同一批/同一类分组,比较各群体后续表现:定义 cohort 规则 → 取数 → 划分 cohort → 按 cohort 汇总后续表现 → 跨 cohort 对比 → 解读与输出。
前置条件
开始执行前,确认以下信息已就绪:
- 分析对象明确,通常为「用户」,且能唯一标识(如
user_id)
- cohort 规则已确定,即按什么分群(如注册周、获客渠道、首单金额档、首日行为等)
- 跟踪指标已确定,即 cohort 形成后要比较的后续指标(如留存、转化、LTV、复购等)及其时间窗口
- 数据获取能力可用,能取到对象级起始特征数据及对应后续行为/指标数据
若 cohort 规则或跟踪指标不明确,需先回到规划阶段补充,或向用户确认后再开始执行。
分析原则
同期群定义
同期群(cohort)指在相同时点或具备相同起始特征的用户集合。本 workflow 通过 cohort 规则分群 定义 cohort,再比较各 cohort 在 后续时间窗口 内的指标表现。
主要步骤
| 步骤 | 用途 | 是否必选 |
|---|
| 定义 cohort 规则 | 确定分群依据与跟踪指标 | 必选,见步骤 1 |
| 取数 | 取用户 ID、起始特征、后续行为/指标 | 必选,见步骤 2 |
| 划分 cohort | 将每个用户分到对应群体 | 必选,见步骤 3 |
| 汇总后续表现 | 按 cohort 聚合跟踪指标 | 必选,见步骤 4 |
| 跨 cohort 对比 | 对比各群差异、幅度与显著性 | 必选,见步骤 5 |
| 解读 & 输出 | cohort 画像、表现对比、业务建议 | 必选,见步骤 6 |
典型产出:cohort 矩阵、群间对比表、cohort 留存曲线(多条线对比)等。
最短路径:定义分群规则 → 划 cohort → 跟踪各群指标 → 跨群对比(即步骤 1 → 3 → 4 → 5,取数随分群展开)。
本 workflow 主要提供 cohort 场景下的编排与数据衔接逻辑,各步骤的具体执行按相应分析方法的标准流程进行。
1. 定义 cohort 规则
明确「按什么分群」与「跟踪什么指标」,这是后续取数与划分的基础:
| 要素 | 含义 | 常见取值 |
|---|
| 分群依据 | 划分 cohort 所依据的起始特征 | 注册周/注册月、获客渠道、首单金额档、首日关键行为、获客活动等 |
| 跟踪指标 | cohort 形成后要比较的后续指标 | 留存率、转化率、LTV、复购次数等 |
| 时间窗口 | 在哪些 dayn 观测跟踪指标 | D1/D7/D30 留存、30 日内 LTV、首周转化率等 |
要点:
- 分群依据可为单一维度(如注册周)或多维特征组合(如消费 + 活跃 + 渠道,优先走聚类,见步骤 3)
- 对象粒度须为「一行一用户」;若原始数据为事件级,先聚合到用户级
- 规则一旦确定,后续取数、划分、汇总须保持一致
2. 取数
按步骤 1 的规则取数,准备划分 cohort 与汇总后续表现所需的数据。
数据准备
整理 CSV,包含:
- 对象标识列(如
user_id)
- 起始特征列:用于划分 cohort(如注册周、获客渠道、首单金额;多维聚类可有多列数值特征)
- 后续行为/指标列:用于汇总跟踪指标(如各 dayn 是否留存、是否转化、累计付费金额等)
示例:
user_id,注册周,获客渠道,D7是否留存,30日LTV
u001,2025-W01,自然量,1,128.0
u002,2025-W01,广告,0,0.0
后续指标若来自另一张表,可仅取用户 ID + 起始特征,待步骤 3 划分后再按 user_id 关联后续指标表。
3. 划分 cohort
以步骤 1 的规则为输入,将每个用户分到对应群体。
划分方式
- 按已有特征分群:以起始特征列(如注册周、获客渠道、首单金额档)为分组键,直接将用户归入对应 cohort
- 两维策略型分群(如「增长 × 份额」):优先波士顿矩阵法
- 多维综合分群:优先 K-means / 分层聚类 / DBSCAN
分群结果保存为 JSON,键为 cohort 标识(如 "2025-W01"、"cluster 1"),值为该 cohort 内的用户 ID 列表(供步骤 4 按 user_id 关联)。
产出检查
4. 按 cohort 汇总后续表现
基于步骤 3 的划分结果,为每个 cohort 汇总跟踪指标:
- 将 cohort 划分结果与用户级后续指标按
user_id 关联
- 按 cohort 聚合跟踪指标(如 cohort 均值、中位数、率值指标的分子/分母汇总等)
- 整理为 对比分析用 CSV:每列对应一个 cohort(或参照 cohort),每行对应一个时间点或汇总口径
示例(三群 D7 留存率对比):
指标,cohort_1,cohort_2,cohort_3
D7留存率,0.42,0.38,0.51
若需绘制 cohort 留存曲线,按 dayn 逐行整理多群留存率(每列一群、每行一个 dayn),供步骤 6 多线对比。若需与总体或某一基准 cohort 对比,在 CSV 中一并纳入参照列。
5. 跨 cohort 对比
对步骤 4 整理的数据执行对比分析,判断哪个群体最好/最差、差异幅度与显著性。
分析要点
- 比较维度:通常为 空间对比(横向比较不同 cohort 之间差异)
- 基准设定:明确参照 cohort(如总体、最大群、或业务指定的对照群)
- 计算方式:按指标类型选择绝对差值或相对差值;多 cohort 间不遗漏任一对比对
- 显著性(可选):样本为多个用户或多次观测时,按显著性检验规则执行 t / z / 卡方检验
保存对比分析结果。
6. 解读 & 输出
完成以上步骤后,围绕各群体后续表现差异汇总并输出。
| 字段 | 说明 |
|---|
| 执行内容 | 本步骤做了什么 |
| 取数文件 | 起始特征数据、后续表现数据路径 |
| 中间产物 | 分群 JSON、对比用 CSV 路径 |
| 计算结果 | 对比分析结果路径 |
| 结论 | 各 cohort 的起始画像、后续表现差异及显著性 |
汇总结构建议:
- Cohort 划分:分群规则、起始特征、各群规模与占比(含 cohort 矩阵)
- 起始画像:各 cohort 在起始特征上的差异(辅助解读分群合理性)
- 后续表现对比:各 cohort 在跟踪指标上的水平、差异幅度与显著性(含 群间对比表 与 cohort 留存曲线)
- 业务解读:表现最优/最劣 cohort 的可能原因与可执行建议
- 局限与不确定性:样本量、时间窗口、特征选择、分群稳定性等