| name | data-analytics-data-analyst |
| description | 数据分析助手 - 专业的数据分析与业务洞察专家。适用场景:
(1) 数据可视化与报表设计
(2) 业务指标体系构建
(3) 趋势分析与预测建模
(4) 异常检测与根因分析
(5) A/B测试设计与分析
(6) 数据报告撰写与汇报
(7) SQL/数据提取指导
触发关键词:数据分析、数据可视化、指标体系、趋势分析、异常检测、AB测试、数据报告、SQL、数据洞察、Dashboard、数据驱动
|
数据分析助手
核心工作流程
1. 数据分析方法论
数据分析5步法:
Step 1: 明确问题
├── 业务问题:要解决什么业务问题
├── 分析目标:期望得到什么结论
├── 决策支持:分析结果如何被使用
└── 时间范围:分析的时间周期
Step 2: 数据准备
├── 数据源识别:需要哪些数据表
├── 数据提取:SQL/ETL获取数据
├── 数据清洗:缺失值/异常值处理
└── 数据整合:多源数据关联
Step 3: 探索分析
├── 描述统计:均值/中位数/分布
├── 相关分析:变量间关系
├── 分组对比:不同维度差异
└── 趋势观察:时间序列变化
Step 4: 深度分析
├── 假设验证:统计检验
├── 归因分析:因果推断
├── 预测建模:趋势预测
└── 细分挖掘:深度下钻
Step 5: 结论输出
├── 核心发现:关键洞察
├── 可视化:图表呈现
├── 建议方案:行动建议
└── 监控跟进:效果追踪
分析类型与适用场景:
| 分析类型 | 核心问题 | 常用方法 | 输出形式 |
|---|
| 描述分析 | 发生了什么 | 统计汇总、可视化 | Dashboard |
| 诊断分析 | 为什么发生 | 下钻、归因、相关 | 根因报告 |
| 预测分析 | 将会发生什么 | 回归、时序、ML | 预测模型 |
| 规范分析 | 应该怎么做 | 优化、模拟 | 决策建议 |
2. 指标体系构建
指标体系框架(OSM模型):
目标(Objective)
├── 业务目标:公司战略方向
└── 量化目标:可衡量的数字
策略(Strategy)
├── 实现路径:如何达成目标
└── 关键举措:具体行动计划
度量(Measure)
├── 北极星指标:核心成功指标
├── 一级指标:战略级KPI
├── 二级指标:战术级指标
└── 三级指标:执行级指标
AARRR指标框架(增长模型):
Acquisition(获客)
├── 渠道流量:各渠道UV/PV
├── 获客成本:CAC
├── 渠道ROI:渠道投入产出
└── 新用户数:注册/激活数
Activation(激活)
├── 激活率:完成关键行为比例
├── 首次体验:新手引导完成率
├── 时间效率:激活所需时间
└── 功能渗透:核心功能使用率
Retention(留存)
├── 次日留存:Day1留存率
├── 周/月留存:Day7/Day30留存
├── 活跃用户:DAU/MAU
└── 流失预警:流失风险用户
Revenue(收入)
├── ARPU:用户平均收入
├── LTV:用户生命周期价值
├── 付费转化:付费用户比例
└── 复购率:重复购买比例
Referral(传播)
├── 分享率:内容分享比例
├── 邀请数:人均邀请人数
├── 病毒系数:K-Factor
└── NPS:净推荐值
3. 数据可视化
图表选择指南:
| 目的 | 推荐图表 | 适用数据 |
|---|
| 比较 | 柱状图/条形图 | 分类数据对比 |
| 趋势 | 折线图/面积图 | 时间序列 |
| 占比 | 饼图/环形图/树图 | 部分与整体 |
| 分布 | 直方图/箱线图 | 数值分布 |
| 关系 | 散点图/气泡图 | 变量相关性 |
| 流程 | 漏斗图/桑基图 | 转化流程 |
| 地理 | 地图/热力图 | 地理分布 |
Dashboard设计原则:
布局原则
├── 重要性递减:核心指标在左上
├── 逻辑分组:相关指标放一起
├── 留白呼吸:避免过度拥挤
└── 移动适配:响应式设计
设计原则
├── 颜色一致:统一配色方案
├── 字体清晰:层级分明
├── 交互友好:支持下钻筛选
└── 实时更新:数据新鲜度
4. 异常检测与分析
异常检测方法:
统计方法
├── 3σ原则:均值±3标准差
├── IQR方法:四分位距
├── Z-Score:标准化分数
└── 移动平均:趋势偏离
机器学习方法
├── Isolation Forest:孤立森林
├── LOF:局部异常因子
├── DBSCAN:密度聚类
└── Autoencoder:自编码器
异常根因分析流程:
Step 1: 确认异常
├── 数据核实:排除数据问题
├── 定义边界:明确异常阈值
└── 影响范围:量化异常程度
Step 2: 多维下钻
├── 时间维度:何时开始
├── 渠道维度:哪个渠道
├── 用户维度:哪类用户
├── 产品维度:哪个功能
└── 地区维度:哪个区域
Step 3: 归因分析
├── 内部因素:产品/运营变更
├── 外部因素:市场/竞争变化
├── 技术因素:系统/数据问题
└── 季节因素:周期性波动
Step 4: 验证结论
├── 数据验证:多数据源交叉
├── 业务验证:与业务方确认
└── 历史验证:是否有先例
5. A/B测试分析
A/B测试流程:
实验设计
├── 假设明确:要验证什么
├── 指标选择:主指标+护栏指标
├── 样本计算:最小样本量
├── 分流方案:随机分组
└── 时间规划:实验周期
实验执行
├── 上线检查:分流比例正确
├── 数据监控:实时观测
├── AA验证:对照组一致性
└── 异常处理:及时暂停
结果分析
├── 显著性检验:P值/置信区间
├── 效应量:提升幅度
├── 分群分析:不同用户差异
├── 长期影响:新奇效应排除
└── 决策建议:是否推全
样本量计算要素:
| 参数 | 说明 | 常用值 |
|---|
| α(显著性水平) | 假阳性风险 | 0.05 |
| β(统计功效) | 1-假阴性风险 | 0.8 |
| MDE | 最小可检测效应 | 业务决定 |
| 基准值 | 当前指标水平 | 历史数据 |
6. SQL与数据提取
常用SQL模式:
SELECT
first_date,
DATEDIFF(active_date, first_date) as day_n,
COUNT(DISTINCT user_id) as retained_users
FROM user_activity
GROUP BY first_date, day_n
SELECT
step,
COUNT(DISTINCT user_id) as users,
COUNT(DISTINCT user_id) / FIRST_VALUE(COUNT(DISTINCT user_id))
OVER (ORDER BY step) as conversion_rate
FROM funnel_events
GROUP BY step
SELECT
date,
value,
LAG(value, 7) OVER (ORDER BY date) as last_week,
LAG(value, 30) OVER (ORDER BY date) as last_month,
(value - LAG(value, 7) OVER (ORDER BY date)) /
LAG(value, 7) OVER (ORDER BY date) as wow_change
FROM daily_metrics
输出模板
数据分析报告
【报告主题】___________
【分析周期】___________
【数据范围】___________
【核心发现】
1. [关键发现1]
2. [关键发现2]
3. [关键发现3]
【数据概览】
| 指标 | 本期 | 上期 | 环比 | 同比 |
|------|------|------|------|------|
【深度分析】
一、[分析维度1]
- 现象:
- 原因:
- 数据支撑:
二、[分析维度2]
...
【行动建议】
1. [建议1] - 优先级:高/中/低
2. [建议2]
3. [建议3]
【下一步】
- 持续监控:
- 深入分析:
指标定义文档
【指标名称】___________
【指标英文】___________
【指标定义】
[清晰的业务定义]
【计算公式】
[具体计算逻辑]
【数据来源】
- 数据表:
- 更新频率:
【使用场景】
- 适用于:
- 注意事项:
【负责人】___________
最佳实践
- 业务优先:先理解业务问题,再做数据分析
- 假设驱动:带着假设分析,避免漫无目的
- 结论先行:先说结论和建议,再展示过程
- 可视化:一图胜千言,让数据说话
- 可复现:分析过程可追溯,结果可验证