数据分析专业词百科大全· 第 3 / 6 页

第七部分:数据架构与存储(6 个)

这部分描述了数据在企业中是如何被存储、管理和流转的。

  1. 数据库 (Database)
    • 解释: 组织、存储和管理数据的电子文件柜。主要分为关系型数据库和非关系型数据库。
    • 案例
      • 关系型数据库 (SQL Database): 如 MySQL, PostgreSQL。使用表格存储数据,各表格之间可以通过键(Key)建立关系。例如,用户表订单表可以通过用户ID关联。
      • 非关系型数据库 (NoSQL Database): 如 MongoDB, Redis。存储格式灵活,适用于非结构化数据或需要高性能读写的场景。例如,存储用户评论、会话信息。
  2. 数据仓库 (Data Warehouse - DW)
    • 解释: 一个为分析和报告而设计的、集成的、面向主题的数据集合。它从多个业务系统(如 ERP, CRM)中抽取数据,并进行清洗和整合,是商业智能(BI)的核心。
    • 案例: 一个零售公司的数据仓库会整合来自销售系统、库存系统、会员系统的数据,分析师可以在此基础上进行跨部门的销售趋势、用户行为等分析。
  3. 数据集市 (Data Mart)
    • 解释: 一个小型的、面向特定部门或业务线的数据仓库子集。
    • 案例: 市场部可能会建立一个专门用于营销活动分析的数据集市,只包含与客户、渠道、广告投放相关的数据。
  4. 数据湖 (Data Lake)
    • 解释: 一个集中式的存储库,允许你以任意规模存储所有结构化和非结构化数据。与数据仓库不同,数据湖存储的是原始的、未经处理的数据。
    • 案例: 一家公司将服务器日志、社交媒体抓取内容、用户上传的图片等原始数据全部存储在数据湖中,供数据科学家进行探索性分析和机器学习模型训练。
  5. ETL (Extract-Transform-Load)
    • 解释: 数据处理的经典流程。抽取(Extract):从源系统获取数据;转换(Transform):进行数据清洗、格式统一、计算等操作;加载(Load):将处理好的数据载入目标系统(通常是数据仓库)。
    • 案例: 每天晚上,系统自动从销售数据库中抽取当天的订单,将其中的地区代码转换为地区名称,计算订单总价,然后加载到数据仓库的销售事实表中。
  6. API (Application Programming Interface)
    • 解释: 应用程序接口,是获取外部数据的重要方式之一。它定义了不同软件组件之间进行交互和数据交换的规则。
    • 案例: 通过调用高德地图的 API,我们可以获取指定地点的经纬度信息或规划路线;通过调用微博的 API,可以获取特定话题下的帖子数据。

第八部分:高级分析方法与模型(5 个)

这些方法通常用于解决更复杂的问题或提供更深度的洞察。

  1. 时间序列分析 (Time Series Analysis)
    • 解释: 对按时间顺序排列的数据点进行分析,以识别趋势、季节性、周期性和随机波动,常用于预测。
    • 案例: 分析公司过去五年的月度销售数据,预测未来一年的销售额,并识别出每年第四季度是销售旺季(季节性)。
  2. 同期群分析 (Cohort Analysis)
    • 解释: 将具有共同特征的用户(同期群/Cohort)作为一个群体来观察其行为随时间的变化。最常见的同期群是按“注册时间”划分的用户。
    • 案例: 分析“2023 年 1 月注册的用户”在接下来几个月的留存率、付费率变化,并与“2023 年 2 月注册的用户”进行比较,以评估产品改版或运营活动的效果。
  3. 购物篮分析 (Market Basket Analysis)
    • 解释: 一种发现顾客购物篮中商品之间关联关系的技术,旨在找出哪些商品经常被一起购买。
    • 案例: 经典的“啤酒与尿布”的故事。超市通过分析发现,购买尿布的男性顾客有很大概率会同时购买啤酒,于是将这两种商品摆放在一起,提升了销量。核心指标包括支持度、置信度和提升度。
  4. 生存分析 (Survival Analysis)
    • 解释: 用于分析某个事件发生前所经过的时间的统计方法。在商业中,常用于分析用户流失。
    • 案例: 分析新用户在注册后多久会“流失”(事件),并研究不同特征(如来源渠道、首日行为)的用户其“生存曲线”有何不同,从而找到高流失风险的用户群体。
  5. 用户分群/用户细分 (User Segmentation)
    • 解释: 基于用户的属性、行为等特征,将用户划分为不同群组的过程,以便进行差异化运营和营销。
    • 案例: 除了前面提到的聚类方法,还可以使用** RFM 模型**进行分群:
      • R (Recency): 最近一次消费时间
      • F (Frequency): 消费频率
      • M (Monetary): 消费金额
      • 通过这三个维度,可以将用户分为:高价值用户、重点挽留用户、新用户等。

第九部分:数据可视化(8 个)

将数据转换成图形,以直观、清晰的方式传递信息。

  1. 条形图/柱状图 (Bar/Column Chart)
    • 解释: 用长条的高度或长度来表示不同类别数值的大小,非常适合类别间的比较。
    • 案例: 比较不同产品线在某一季度的销售额。
  2. 折线图 (Line Chart)
    • 解释: 用线条连接按顺序(通常是时间)排列的数据点,最适合展示数据随时间变化的趋势。
    • 案例: 展示公司网站过去 12 个月的每日活跃用户数(DAU)变化趋势。
  3. 饼图/环形图 (Pie/Donut Chart)
    • 解释: 显示部分占整体的比例。注意:当类别过多(>5)或各部分占比接近时,效果不佳。
    • 案例: 展示不同流量来源(如搜索、社交、直接访问)在总流量中的占比。
  4. 散点图 (Scatter Plot)
    • 解释: 显示两个连续变量之间的关系或分布趋势。
    • 案例: 探索广告投入(X 轴)与带来的销售额(Y 轴)之间是否存在正相关关系。
  5. 直方图 (Histogram)
    • 解释: 显示单个连续变量的频率分布情况,即将数据划分成若干个等距的区间(bins),然后统计每个区间内数据点的数量。
    • 案例: 展示某产品所有用户的年龄分布情况。
  6. 箱形图 (Box Plot)
    • 解释: 同时展示数据的中位数、四分位数(25%和 75%位置)、最大值、最小值和异常值,非常适合比较多组数据的分布情况。
    • 案例: 比较 A、B、C 三个不同班级学生考试成绩的分布、中位数及离散程度。
  7. 热力图 (Heatmap)
    • 解释: 用颜色的深浅来表示二维矩阵中数值的大小。
    • 案例: 在一张中国地图上,用不同深浅的红色来表示各省份的新增确诊病例数。或展示不同商品类别在一天中不同时段的销量热度。
  8. 仪表盘 (Dashboard)
    • 解释: 将多个关键指标(KPI)和图表组合在一个界面上,提供对业务状况的实时、全面的概览。
    • 案例: 一个电商运营仪表盘可能包括:实时 GMV(商品交易总额)、DAU、转化率、热门商品榜单、用户地域分布图等。

第十部分:数据分析工具与语言(5 个)

  1. SQL (Structured Query Language)
    • 解释: 用于从关系型数据库中查询、操作和定义数据的标准语言,是数据分析师的必备技能。
    • 案例SELECT user_id, order_amount FROM orders WHERE order_date > '2023-01-01'; (查询 2023 年 1 月 1 日之后的所有订单的用户 ID 和金额)
  2. Python
    • 解释: 一种功能强大的通用编程语言,拥有丰富的数据分析库(如 Pandas, NumPy, Scikit-learn, Matplotlib),使其成为数据科学领域的首选语言。
    • 案例: 使用 Pandas 库读取 Excel 文件,进行数据清洗,然后用 Matplotlib 库绘制折线图。
  3. R
    • 解释: 专为统计计算和图形显示而设计的语言和环境,在学术界和统计领域非常流行。
    • 案例: 使用 R 语言进行复杂的统计建模,如线性回归或时间序列 ARIMA 模型。
  4. 电子表格软件 (Spreadsheet)
    • 解释: 如 Microsoft Excel, Google Sheets。是最基础、最普及的数据分析工具,适合处理小规模数据、进行快速计算和图表制作。
    • 案例: 使用 Excel 的透视表(Pivot Table)功能快速汇总月度销售数据。
  5. BI 工具 (Business Intelligence Tools)
    • 解释: 如 Tableau, Power BI, Looker。提供拖放式界面,让用户可以轻松连接数据源,创建交互式图表和仪表盘,实现数据可视化的“自助服务”。
    • 案例: 业务人员使用 Tableau 连接到公司数据仓库,自己拖拽维度和度量,制作一个销售业绩监控仪表盘。