数据分析专业词百科大全
大合集,约 51 分钟。右侧目录可跳读;全文拆为 6 页。
前言
本文档内容旨在为数据分析领域的初学者、从业者和相关业务人员提供一个全面、清晰的术语参考,理解这些核心概念是有效沟通、精确分析并从数据中提取价值的关键。
这份手册涵盖了从基础概念到前沿战略的近 90 个核心词条,每一个都配有通俗易懂的解释和贴近实际的案例。无论你是刚刚踏入数据领域的新人,还是希望构建完整知识体系的在职分析师,甚至是需要与数据团队沟通的业务人员,都能在这里找到你需要的知识。我建议你不要一次性读完,而是根据你的角色和学习阶段,把它当作一本随时可以查阅的案头工具书。
针对不同学习者的个性化学习路径推荐
对于零基础的入门者或转行者 (e.g。:学生,业务人员)
- 学习目标: 建立基本的数据认知,理解数据分析的通用语言和核心流程。
- 推荐策略:“打地基”式学习路径
- 第一步:核心基础区 (必读)
- 第一部分:数据基础与类型 - 这是你认识“原材料”的第一课。
- 第三部分:描述性分析与探索性数据分析 - 学会如何总结数据,看懂“发生了什么”。
- 第六部分:商业与产品分析指标 - 将数据与商业价值联系起来,理解公司最关心的那些数字。
- 第十部分:电子表格软件 (Excel) - 从最熟悉的工具开始。
- 第二步:分析流程区
- 第二部分:数据收集与处理 - 了解数据分析不只是画图,清理数据是重要一步。
- 第九部分:数据可视化 - 学会用图表说话,这是最有成就感的部分。
- 建议: “先把这些最核心的部分读懂,你就能理解 80%的日常数据对话和基础报表了。其他的可以先收藏,遇到不懂的再来查。”
- 第一步:核心基础区 (必读)
对于初级数据分析师 (0-2 年经验)
- 学习目标: 巩固基础,深化对核心方法的理解,提升解决实际问题的能力。
- 推荐策略:“全流程强化”学习路径
- 第一步:巩固与深化
- 快速回顾 1-6 部分,确保每个概念都了然于胸。
- 重点攻坚 4, 5, 8, 12 部分:
- 第四部分 (推断性分析) &第八部分 (高级分析方法): 深入理解 A/B 测试、同期群、漏斗分析等,这些是你日常工作的“神兵利器”。
- 第五部分 (预测建模): 开始了解回归、分类、聚类的基本思想。
- 第十二部分 (分析框架): 学会用 AARRR、HEART 等框架来结构化地思考业务问题。
- 第二步:工具与技术栈
- 第七部分 (数据架构) &第十部分 (工具语言): 熟悉 SQL 和 Python,并理解数据仓库、ETL 这些你每天打交道的东西背后是什么。
- 建议: “这份手册可以帮你把日常工作中零散的点串成线、连成面。特别是分析方法和框架部分,能极大提升你分析报告的深度和逻辑性。”
- 第一步:巩固与深化
对于中高级数据分析师或数据科学家 (3 年以上经验)
- 学习目标: 拓宽知识边界,提升战略视野,向更高级的因果推断和数据治理领域迈进。
- 推荐策略:“T 型人才”拓展路径 (在深度基础上拓展广度)
- 第一步:高级方法论
- 第十三部分 (高级统计) &第十四、十九部分 (因果推断): 深入研究统计功效、辛普森悖论、DiD、RDD、IV 等,这些是区分你和普通分析师的关键,能让你在没有 A/B 测试时也能做出严谨的分析。
- 第二步:技术与架构视野
- 第十七部分 (大数据技术): 了解 Spark、流处理等,即使不亲自写代码,也要理解其原理和适用场景。
- 第十八部分 (数据质量) &第二十一部分 (数据战略): 从“使用数据”上升到“管理和规划数据”,理解数据血缘、数据网格、数据即产品等概念,这会让你在团队中的价值倍增。
- 第三步:责任与未来
- 第十一、二十部分 (数据伦理与治理): 关注数据偏见、可解释性 AI,这体现了你的专业素养和责任感。
- 建议: “这份手册的后半部分是为你准备的进阶指南。当你思考的不再是‘如何做一个分析’,而是‘如何设计一个可靠的分析体系’或‘如何评估一个复杂政策的影响’时,这些词条会给你提供强大的理论武器和框架支持。”
- 第一步:高级方法论
通过这样的分层推荐,学习者可以根据自己的定位快速找到学习重点,避免迷失在信息的海洋中,从而更有信心地开启或深化自己的数据分析之旅。
第一部分:数据基础与类型(6 个)
这部分是数据分析的基石,定义了我们处理的原始材料。
- 数据 (Data)
- 解释: 对事实、数字、文字、观察、测量或描述的集合。
- 案例: 客户的购买记录、网站的访问日志、用户的问卷调查回复。
- 定量数据 (Quantitative Data)
- 解释: 以数字形式存在,可以进行数学运算的数据,可分为离散型和连续型。
- 案例:
- 离散型 (Discrete): 可数的整数。例如,一个页面的点击次数(150 次),员⼯数量(30 人)。
- 连续型 (Continuous): 可在⼀定范围内取任意值。例如,用户身高(175.5cm),产品价格(99.9 元)。
- 定性/分类数据 (Qualitative/Categorical Data)
- 解释: 描述类别或属性的数据,不能进行数学运算。可分为定类型和定序型。
- 案例:
- 定类型 (Nominal): 类别之间没有内在顺序。例如,用户性别(男/女),商品颜色(红/黄/蓝)。
- 定序型 (Ordinal): 类别之间有明确的顺序或等级。例如,用户满意度(非常满意 > 满意 > 一般 > 不满意),用户等级(VIP > 普通用户)。
- 元数据 (Metadata)
- 解释: “关于数据的数据”,用于描述数据背景、来源、格式、结构等信息。
- 案例: 一张照片的元数据可能包括拍摄时间、相机型号、GPS 位置等。一个数据表的元数据可能包括列名、数据类型、创建日期。
- 结构化数据 (Structured Data)
- 解释: 具有固定格式或模型的数据,通常存储在关系型数据库的表格中。
- 案例: 公司的销售报表,每一行是一个订单,每一列是订单 ID、金额、日期等固定字段。
- 非结构化数据 (Unstructured Data)
- 解释: 没有预定义数据模型或组织方式的数据。
- 案例: 邮件正文、社交媒体帖子、客服聊天记录、视频、音频文件。
第二部分:数据收集与处理 (5 个)
在分析之前,我们需要获取并清理数据,这是保证分析质量的关键步骤。
- 数据清洗 (Data Cleaning/Cleansing)
- 解释: 识别并纠正(或删除)数据中的错误、不一致、不完整或不准确的部分。
- 案例: 删除重复的客户记录;将“北京”和“北京市”统一为“北京”;纠正格式错误的日期(如
2023-13-01)。
- 缺失值处理 (Missing Value Imputation)
- 解释: 对数据集中缺失的数据点进行填充的过程。
- 案例: 某个用户的年龄信息缺失,可以用所有用户的平均年龄或中位数年龄来填充,或者使用更复杂的模型进行预测填充。
- 异常值/离群点 (Outlier)
- 解释: 与数据集中其余观察值差异极大的数据点。
- 案例: 在一份用户月消费记录中,大多数消费在 100-1000 元之间,但出现了一个 500 万元的记录,这可能是一个异常值(也可能是真实的高价值用户,需要甄别)。
- 特征工程 (Feature Engineering)
- 解释: 从原始数据中创建新的、更有信息量的变量(特征),以提高分析或模型性能。
- 案例: 从“用户注册日期”和“最后登录日期”两个原始特征,可以创建一个新特征“用户活跃天数”,这个新特征可能对预测用户流失更有帮助。
- 数据标准化/归一化 (Standardization/Normalization)
- 解释: 将不同尺度的数据调整到同一量级,以消除量纲的影响。
- 案例: 分析用户时,“年龄”(范围 18-60)和“年收入”(范围 5 万 -100 万)的数值差异巨大。通过标准化,可以将它们都转换到均值为 0、标准差为 1 的分布,使得两者在模型中的权重相当。