← 返回首页
应用统计分析 · 核心知识点整理
第三章 · 数据可视化 基础
| 图形 | 用途 | 说明 |
| 散点图 |
描述两个变量之间的关系 |
最直观的变量关系图,可观察线性/非线性趋势 |
| 条形图 |
对比不同分类下数值大小 |
最直接的分类对比图形,适合展示类别间差异 |
第四章 · 聚类分析 重点
1. 系统聚类法(层次聚类)
| 要点 | 说明 |
| 初始状态 | n 个样品各自为一类,共 n 类 |
| 缺点① | 计算速度慢 |
| 缺点② | 样品一旦被分到某组,无法重新分配(K-means 可调整分组) |
2. 快速聚类(K-means 聚类)算法
核心步骤:
- 预先指定聚类数 K,从 n 个样本中随机选取 K 个作为初始质心
- 计算每个样本到各质心的距离,将样本分配到最近的簇
- 重新计算每个簇的均值(新质心)
- 重复步骤 ②-③,直到质心不再变化或达到迭代次数上限
第六章 · 主成分分析 重点
1. 主成分定义
主成分是原始变量的线性组合,保留了原始变量的绝大部分信息。
2. 主成分性质
| 性质 | 说明 |
| 各主成分之间互不相关 | PCA 提取的主成分彼此正交独立 |
| 方差依次递减 | $Var(y_1) \ge Var(y_2) \ge \cdots \ge Var(y_p) > 0$ |
3. 主成分得分与综合评价
| 概念 | 公式 / 说明 |
| 综合得分 | $F = \sum w_j \cdot PC_j$,以各主成分的方差贡献率为权重 |
| 应用 | 将多个维度的指标整合为一个综合得分,用于样本的综合排序与评价 |
第七章 · 因子分析 必考
| 概念 | 定义 | 含义 |
| 公共因子贡献 $g_j^2$ |
公共因子 $F_j$ 对所有变量 $X$ 的方差贡献 |
$g_j^2$ 越大 → $F_j$ 对变量的影响/作用力越强 |
| 共同度 |
全部公共因子对单个变量 $X_i$ 的方差贡献 |
反映变量被公共因子解释的程度 |
第九章 · 相关分析与多元线性回归 必考·大题
1. 相关分析 vs 回归分析
相关分析
- 不区分自变量与因变量,二者地位平等
- 关注变量间的关联程度
回归分析
- 自变量与因变量地位不对等
- 关注变量间的因果关系与预测效果
2. 多元数据相关系数矩阵
d94.corr() # d94 为数据集名称
3. 多元线性回归分析
| 项目 | 代码 / 形式 |
| 建模代码 | fm = ols('y ~ x1 + x2 + x3 + x4', data=d94).fit() |
| 方程形式 | $\hat{y} = 58.5 + 0.02x_1 + 0.37x_2 + \cdots$ |
4. 模型检验
| 检验 | 作用 | 判断标准 |
| F 检验 |
检验模型整体显著性 |
判断所有自变量是否对因变量有联合影响 |
| t 检验 |
检验单个回归系数的显著性 |
$p < 0.05$ → 该变量对模型有显著贡献,应保留 |
5. 模型结果输出
print(fm.summary())
需解读表格中的 F值、t值、P值 等关键统计量。
6. 拟合优度
$R^2$ 越接近 1,模型对数据的拟合效果越好。
第十一章 · 方差分析与逻辑回归 必考·综合
1. 模型选择依据
逻辑回归模型
因变量 $y$ 为0-1 二分类变量
2. 方差分析模型类型
| 模型 | 说明 |
| 完全随机设计模型 | 单因素,随机分配 |
| 随机区组设计模型 | 控制区组效应 |
| 析因设计模型 | 多因素交叉,可分析交互作用 |
| 正交设计模型 | 利用正交表安排多因素实验 |
可根据数据表结构判断模型类型,参考教材 P293。
3. 析因设计模型代码
M3 = ols('Y ~ C(A)*C(B)', data=d113).fit()
ANOVA(M3)
4. 正交设计表解读
$L_8(2^7)$ 表示:8 次实验,7 个因素,每个因素 2 水平;$L$ 代表正交设计表。
5. 逻辑回归模型
| 要点 | 内容 |
| 分布假设 | 因变量服从二项分布(Binomial) |
| 建模代码 |
logit = sm.GLM.from_formula('y ~ x1 + x2 + x3',
family=sm.families.Binomial(), data=数据集) |
| 方程形式 | $\text{logit}(p) = 0.5976 - 1.49x_1 + \cdots$ |
第十二章 · 判别分析 重点
1. Fisher 判别
| 类型 | 假设 |
| 线性判别 | 假设各类别协方差矩阵相等 |
| 非线性(二次)判别 | 假设各类别协方差矩阵不相等 |
2. Bayes 判别
| 要点 | 说明 |
| 核心区别 | 需要预先输入先验概率 |
| 示例 | 判断明天是否下雨:先输入下雨概率 70%,不下雨概率 30% |
| 原理 | 基于先验概率和样本信息,计算后验概率,将样本归为后验概率最大的类别 |
考前速记 13 条
- 散点图 → 变量关系最直观;条形图 → 分类对比最直接
- 系统聚类:n 个样品各为一类开始,不可重新分配
- K-means:随机选 K 个质心 → 分配 → 更新质心 → 迭代至收敛
- 主成分 = 原始变量线性组合,各 PC 互不相关,方差递减
- 综合得分 $F = \sum w_j \cdot PC_j$,用于综合评价排序
- $g_j^2$(公共因子贡献)越大 → $F_j$ 对所有变量影响越强
- 共同度 → 反映单个变量被公共因子解释的程度
- 相关分析:变量平等,看关联;回归分析:变量不平等,看因果
- F 检验 → 整体显著性;t 检验 → 单个系数显著性 ($p < 0.05$ 保留)
- $R^2$ 越接近 1,拟合越好
- y 连续 → 线性回归;y 二分类 → 逻辑回归(Binomial)
- $L_8(2^7)$:8次实验、7因素、每因素2水平
- Bayes 判别需要先验概率 → 后验概率最大者归类
← 返回首页