数据分析专业词百科大全· 第 2 / 6 页
第三部分:描述性分析与探索性数据分析(6 个)
这部分旨在总结和可视化数据的主要特征,了解“发生了什么”。
- 均值 (Mean)
- 解释: 所有数值的总和除以数值的个数,即平均值。
- 案例: 5 个用户的年龄分别是 20, 22, 25, 28, 30,他们的平均年龄是 (20+22+25+28+30)/5 = 25 岁。
- 中位数 (Median)
- 解释: 将所有数值从⼩到⼤排序后,位于中间位置的数值。对异常值不敏感。
- 案例: 对于上述年龄数据,中位数是 25。如果数据是 20, 22, 25, 28, 100,均值会变为 39,但中位数仍然是 25,更好地反映了“典型”用户的年龄。
- 众数 (Mode)
- 解释: 数据集中出现次数最多的数值。
- 案例: 在一次问卷调查中,选择“满意”的人数最多,那么“满意”就是众数。
- 标准差 (Standard Deviation)
- 解释:衡量数据点偏离其均值的程度。标准差越大,数据波动越大。
- 案例: A 班学生成绩的标准差是 5 分,B 班是 15 分,说明 B 班的成绩分布更分散,学生水平更参差不齐。
- 分布 (Distribution)
- 解释: 显示数据集中每个可能值出现的频率或概率。
- 案例:正态分布(钟形曲线)常用于描述身高、体重等自然现象。偏态分布(Skewed Distribution)则常见于收入数据,大多数人收入较低,少数人收入极高,形成右偏态。
- 相关性 vs 因果性 (Correlation vs Causation)
- 解释: 一个至关重要的概念。相关性指两个变量同步变化,但不一定是一个导致另一个。因果性指一个变量的变化是另一个变量变化的原因。
- 案例: “夏天冰淇淋销量”和“溺水人数”高度相关,但它们之间没有因果关系。真正的原因是“高温天气”(共同的因),它同时导致了冰淇淋销量增加和更多人去游泳。数据分析只能证明相关性,证明因果性需要严谨的实验设计。
第四部分:推断性分析与假设检验(5 个)
这部分旨在通过样本数据推断总体特征,并验证某个假设是否成立。
- 总体 vs 样本 (Population vs Sample)
- 解释:总体是研究对象的全部集合。样本是从总体中抽取的一部分。我们通过分析样本来推断总体的特征。
- 案例: 想要了解全国所有大学生的平均生活费(总体),我们随机抽取了 1000 名大学生进行调查(样本)。
- 假设检验 (Hypothesis Testing)
- 解释: 一个统计方法,用于判断样本与总体的差异是由抽样误差引起还是本质差异所致。通常包括原假设(H0)和备择假设(H1)。
- 案例:
- 原假设(H0): 新的 APP 界面设计对用户点击率没有影响。
- 备择假设(H1): 新的 APP 界面设计对用户点击率有影响。
- 我们通过收集数据来判断是否有足够证据推翻原假设。
- P 值 (P-value)
- 解释: 在原假设为真的前提下,出现当前观测结果或更极端结果的概率。P 值越小,说明结果越不可能是由偶然因素造成的。
- 案例: 如果 P 值为 0.03,意味着如果新设计真的没用(H0 为真),我们只有 3%的概率会观测到这么大的点击率提升。通常,当 P 值小于一个预设的显著性水平(如 0.05),我们就会拒绝原假设。
- A/B 测试 (A/B Testing)
- 解释: 一种在线实验方法,通过将用户随机分成 A 组(对照组)和 B 组(实验组),比较两个版本(如不同颜色的按钮)的效果差异。它是假设检验在商业中最常见的应用。
- 案例: 为了测试红色购买按钮是否比蓝色更好,我们让 50%的用户看到蓝色按钮(A 组),50%的用户看到红色按钮(B 组),然后比较两组的转化率。
- 置信区间 (Confidence Interval)
- 解释: 根据样本数据计算出的一个范围,我们有一定信心(如 95%)认为总体的真实参数(如平均值)落在这个区间内。
- 案例: 分析得出,用户平均每日使用时长的 95%置信区间是[25 分钟, 35 分钟]。这意味着我们有 95%的把握,所有用户的真实平均使用时长在 25 到 35 分钟之间。
第五部分:预测建模与机器学习(5 个)
这部分利用算法从历史数据中学习规律,并对未来进行预测。
- 回归 (Regression)
- 解释: 预测一个连续的数值型结果。
- 案例: 根据房屋的面积、位置、房龄等特征,预测其销售价格。
- 分类 (Classification)
- 解释: 预测一个离散的类别型结果。
- 案例: 根据邮件的发件人、标题、内容等特征,判断该邮件是**“垃圾邮件”还是“非垃圾邮件”**。
- 聚类 (Clustering)
- 解释: 一种无监督学习方法,将数据点根据相似性自动分组成不同的簇(Cluster)。
- 案例: 根据用户的购买频率、消费金额、购买品类等,将用户自动分为“高价值用户”、“潜力用户”、“流失风险用户”等群体,以便进行精细化运营。
- 过拟合/欠拟合 (Overfitting/Underfitting)
- 解释:
- 过拟合: 模型在训练数据上表现极好,但在新的、未见过的数据上表现很差。它“记住”了训练数据的噪声,而不是学到了普适规律。
- 欠拟合: 模型过于简单,连训练数据上的规律都没有学好。
- 案例: 老师给学生一套练习题(训练数据)备考,一个过拟合的学生把所有题和答案都背了下来,但考试时换了新题(测试数据)就不会做了。一个欠拟合的学生则连练习题都没怎么学会。
- 解释:
- 模型评估指标 (Model Evaluation Metrics)
- 解释: 用于衡量预测模型性能的指标。
- 案例:
- 分类模型: 准确率(Accuracy)、精确率(Precision)、召回率(Recall)、F1 分数。例如,在垃圾邮件检测中,召回率衡量“所有真的垃圾邮件中,有多少被我们成功找出来了”。
- 回归模型: 均方根误差(RMSE)、R 平方(R-squared)。
第六部分:商业与产品分析指标(8 个)
这部分是将数据分析应用于商业决策的核心指标。
- 关键绩效指标 (KPI - Key Performance Indicator)
- 解释: 用于衡量业务在特定目标上进展情况的量化指标。
- 案例: 网站的 KPI 可能是“月活跃用户数”,销售团队的 KPI 可能是“月度销售额”。
- 转化率 (Conversion Rate)
- 解释: 完成某个期望行为的用户比例。
- 案例: 1000 人访问了商品页面,其中有 50 人点击了购买按钮,则购买转化率为 50/1000 = 5%。
- 用户生命周期价值 (LTV - Lifetime Value)
- 解释: 一个用户在其整个生命周期内(从注册到流失)为公司贡献的总价值。
- 案例: 如果一个用户平均每月付费 50 元,平均会持续使用 24 个月,那么他的 LTV 大约是 50 * 24 = 1200 元。
- 客户获取成本 (CAC - Customer Acquisition Cost)
- 解释: 获取一个新客户所需的平均成本。
- 案例: 公司在一个月内花费了 10,000 元用于市场推广,并获得了 200 个新客户,则 CAC = 10000 / 200 = 50 元。一个健康的商业模式通常要求 LTV > CAC。
- 用户留存率 (Retention Rate)
- 解释: 在特定时间段后,仍然在使⽤产品的用户比例。
- 案例: 1 月份有 1000 个新注册用户,到 2 月份仍有 400 个用户在活跃,那么次月留存率就是 40%。
- 用户流失率 (Churn Rate)
- 解释: 在特定时间段内,停止使用产品或服务的用户比例。流失率 = 1 - 留存率。
- 案例: 如果上个月有 1000 个付费用户,这个月有 50 个用户取消了订阅,那么月流失率为 50/1000 = 5%。
- DAU/MAU (Daily/Monthly Active Users)
- 解释: 日/月活跃用户数,是衡量产品健康度和用户粘性的核心指标。
- 案例: 某社交 App 今天的 DAU 是 100 万,过去 30 天的 MAU 是 1500 万。
- 漏斗分析 (Funnel Analysis)
- 解释: 一种可视化用户在完成关键任务(如购买、注册)过程中各个步骤转化情况的方法。
- 案例: 一个电商购买漏斗可能包括:访问首页 -> 浏览商品 -> 加入购物车 -> 提交订单 -> 完成支付。通过分析每一步的流失率,可以找到优化点。