数据分析常用方法大全
投放 · 覆盖 投放,约 11 分钟。
一、 描述性分析 (Descriptive Analytics) - “发生了什么?”
这是数据分析最基础、最核心的一步,旨在总结和呈现数据的基本特征。
| 方法名称 | 核心思想 | 应用场景 | 补充说明 |
|---|---|---|---|
| 1. 核心指标分析 | 监控和衡量业务表现的关键数值(KPIs)。 | 日活用户(DAU)、月活用户(MAU)、销售总额(GMV)、转化率、客单价等。 | 这是业务分析的起点,指标的选择必须紧扣业务目标。通常会结合对比分析来发现问题。 |
| 2. 集中趋势分析 | 描述数据集的中心点或典型值。 | 计算用户平均年龄、订单中位数金额、最常购买的商品类别(众数)。 | - 平均值 (Mean): 易受极端值影响。 -中位数 (Median): 不受极端值影响,更适合偏态分布数据。 - 众数 (Mode): 用于分类数据。 |
| 3. 离散趋势分析 | 衡量数据的分散程度或波动性。 | 分析产品价格的波动范围、用户收入的离散程度、考试成绩的分布情况。 | - 极差 (Range): 最大值-最小值,简单但粗糙。 - 方差/标准差 (Variance/Std Dev): 最常用,衡量数据点与均值的偏离程度。 - 四分位距 (IQR): 稳健,用于识别异常值。 |
| 4. 分布分析 | 探究数据的分布形状和规律。 | 查看用户年龄分布(是否符合正态分布)、消费金额分布(长尾分布)。 | 通常使用直方图 (Histogram)或核密度图 (KDE Plot) 进行可视化。了解数据分布有助于选择更合适的分析方法。 |
| 5. 交叉分析/多维度分析 | 将两个或多个维度(变量)进行交叉组合,以细分和审视数据。 | 分析“不同地区”的“不同产品类别”的销售额;分析“不同性别”的“不同年龄段”用户的点击率。 | 这是发现问题根源的利器。在Excel中常用数据透视表 (Pivot Table),在SQL中常用 GROUP BY 子句实现。 |
二、 诊断性分析 (Diagnostic Analytics) - “为什么会发生?”
在描述性分析的基础上,深入探究现象背后的原因。
| 方法名称 | 核心思想 | 应用场景 | 补充说明 |
|---|---|---|---|
| 1. 对比分析 | 将两个或多个数据进行比较,寻找差异和变化。 | - 时间对比: 同比(与去年同期比)、环比(与上个周期比)。 - 空间对比: 不同城市、不同渠道的业绩对比。 - 目标对比: 实际完成情况与设定目标(KPI)的对比。 |
对比分析需要有明确的参照系,否则对比没有意义。差异本身不是结论,对差异原因的探究才是。 |
| 2. 归因分析 | 确定各个渠道或因素对最终结果的贡献度。 | 营销活动中,分析是哪个广告渠道(如搜索引擎、社交媒体、邮件)带来了最终的转化。 | 常见模型有:首次点击归因、末次点击归因、线性归因、时间衰减归因等。选择哪种模型取决于业务逻辑。 |
| 3. 钻取/下探分析 (Drill-Down) | 从宏观指标层层深入到更细的维度,探究问题的具体构成。 | 发现本月总销售额下降 -> 钻取到各产品线,发现是A产品线下降 -> 再钻取到各销售区域,发现是华东区A产品线下降... | 这是一个由宏观到微观的探索过程,与多维度分析紧密相连,常用于交互式报表(Dashboard)中。 |
| 4. 相关性分析 | 研究两个或多个变量之间相互关联的程度和方向。 | 分析“广告投入”与“销售额”之间的关系;分析“用户活跃天数”与“用户付费金额”的关系。 | 警告:相关不等于因果! 两个变量高度相关,可能是由第三个隐藏变量(混淆变量)驱动的。相关性是发现潜在因果关系的线索。常用皮尔逊相关系数。 |
三、 预测性分析 (Predictive Analytics) - “未来会发生什么?”
利用历史数据和算法模型来预测未来的可能性,这部分开始涉及机器学习。
| 方法名称 | 核心思想 | 应用场景 | 补充说明 |
|---|---|---|---|
| 1. 回归分析 (Regression) | 预测一个连续的数值型结果。 | 预测未来一年的销售额、根据房屋特征预测房价、根据用户行为预测其生命周期价值(LTV)。 | - 线性回归 (Linear Regression): 最基础,研究自变量和因变量的线性关系。 - 逻辑回归 (Logistic Regression): 虽名为回归,但用于分类问题(如预测用户是否流失)。 |
| 2. 分类分析 (Classification) | 预测一个离散的、类别型的结果。 | 判断邮件是否为垃圾邮件、评估客户信用风险(高/中/低)、预测用户是否会购买某产品。 | 常用算法包括:决策树、支持向量机(SVM)、朴素贝叶斯、随机森林等。 |
| 3. 聚类分析 (Clustering) | 在没有预先定义标签的情况下,将相似的数据对象分组。 | 用户分群(高价值用户、潜力用户、流失风险用户)、商品聚类(寻找关联商品)、异常检测。 | 属于无监督学习。最经典的算法是 K-Means。聚类的关键在于如何解释和利用分出来的“群组”。 |
| 4. 时间序列分析 | 基于时间顺序数据,预测未来的数值。 | 预测未来一个月的网站流量、股票价格走势、季节性产品的销量。 | 考虑趋势性、季节性、周期性等因素。常用模型有ARIMA、Prophet等。 |
四、 指导性分析 (Prescriptive Analytics) - “我们应该做什么?”
数据分析的最高层次,不仅预测未来,还为决策提供最优建议。
| 方法名称 | 核心思想 | 应用场景 | 补充说明 |
|---|---|---|---|
| 1. A/B测试 (A/B Testing) | 通过设置对照组和实验组,以科学严谨的方式测试不同策略的效果,从而做出最优决策。 | 测试不同版本的网页设计哪个转化率更高;测试两种推荐算法哪个点击率更好;测试不同营销文案的打开率。 | 这是验证因果关系的黄金标准。需要关注样本量、测试时长和统计显著性,避免 случайные结果。 |
| 2. 最优化分析 | 在给定约束条件下,寻找能使某个目标(如利润、效率)最大化或成本最小化的解决方案。 | 供应链中如何规划物流路线以节省成本;航空公司如何定价以实现收益最大化;如何分配广告预算以获得最高ROI。 | 通常需要运筹学和数学规划知识,如线性规划。 |