ExamPass Assistant
oitedu.online

← 返回首页

应用统计分析 · 核心知识点整理

目录

第三章 · 数据可视化 基础

图形用途说明
散点图 描述两个变量之间的关系 最直观的变量关系图,可观察线性/非线性趋势
条形图 对比不同分类下数值大小 最直接的分类对比图形,适合展示类别间差异

第四章 · 聚类分析 重点

1. 系统聚类法(层次聚类)

要点说明
初始状态n 个样品各自为一类,共 n 类
缺点①计算速度慢
缺点②样品一旦被分到某组,无法重新分配(K-means 可调整分组)

2. 快速聚类(K-means 聚类)算法

核心步骤:
  1. 预先指定聚类数 K,从 n 个样本中随机选取 K 个作为初始质心
  2. 计算每个样本到各质心的距离,将样本分配到最近的簇
  3. 重新计算每个簇的均值(新质心)
  4. 重复步骤 ②-③,直到质心不再变化或达到迭代次数上限

第六章 · 主成分分析 重点

1. 主成分定义

主成分是原始变量的线性组合,保留了原始变量的绝大部分信息。

2. 主成分性质

性质说明
各主成分之间互不相关PCA 提取的主成分彼此正交独立
方差依次递减$Var(y_1) \ge Var(y_2) \ge \cdots \ge Var(y_p) > 0$

3. 主成分得分与综合评价

概念公式 / 说明
综合得分$F = \sum w_j \cdot PC_j$,以各主成分的方差贡献率为权重
应用将多个维度的指标整合为一个综合得分,用于样本的综合排序与评价

第七章 · 因子分析 必考

概念定义含义
公共因子贡献 $g_j^2$ 公共因子 $F_j$ 对所有变量 $X$ 的方差贡献 $g_j^2$ 越大 → $F_j$ 对变量的影响/作用力越强
共同度 全部公共因子对单个变量 $X_i$ 的方差贡献 反映变量被公共因子解释的程度

第九章 · 相关分析与多元线性回归 必考·大题

1. 相关分析 vs 回归分析

相关分析
回归分析

2. 多元数据相关系数矩阵

d94.corr()   # d94 为数据集名称

3. 多元线性回归分析

项目代码 / 形式
建模代码fm = ols('y ~ x1 + x2 + x3 + x4', data=d94).fit()
方程形式$\hat{y} = 58.5 + 0.02x_1 + 0.37x_2 + \cdots$

4. 模型检验

检验作用判断标准
F 检验 检验模型整体显著性 判断所有自变量是否对因变量有联合影响
t 检验 检验单个回归系数的显著性 $p < 0.05$ → 该变量对模型有显著贡献,应保留

5. 模型结果输出

print(fm.summary())

需解读表格中的 F值、t值、P值 等关键统计量。

6. 拟合优度

$R^2$ 越接近 1,模型对数据的拟合效果越好。

第十一章 · 方差分析与逻辑回归 必考·综合

1. 模型选择依据

线性回归模型

因变量 $y$ 为连续变量

逻辑回归模型

因变量 $y$ 为0-1 二分类变量

2. 方差分析模型类型

模型说明
完全随机设计模型单因素,随机分配
随机区组设计模型控制区组效应
析因设计模型多因素交叉,可分析交互作用
正交设计模型利用正交表安排多因素实验

可根据数据表结构判断模型类型,参考教材 P293。

3. 析因设计模型代码

M3 = ols('Y ~ C(A)*C(B)', data=d113).fit()
ANOVA(M3)

4. 正交设计表解读

$L_8(2^7)$ 表示:8 次实验,7 个因素,每个因素 2 水平;$L$ 代表正交设计表。

5. 逻辑回归模型

要点内容
分布假设因变量服从二项分布(Binomial)
建模代码
logit = sm.GLM.from_formula('y ~ x1 + x2 + x3',
    family=sm.families.Binomial(), data=数据集)
方程形式$\text{logit}(p) = 0.5976 - 1.49x_1 + \cdots$

第十二章 · 判别分析 重点

1. Fisher 判别

类型假设
线性判别假设各类别协方差矩阵相等
非线性(二次)判别假设各类别协方差矩阵不相等

2. Bayes 判别

要点说明
核心区别需要预先输入先验概率
示例判断明天是否下雨:先输入下雨概率 70%,不下雨概率 30%
原理基于先验概率和样本信息,计算后验概率,将样本归为后验概率最大的类别

考前速记 13 条

  1. 散点图 → 变量关系最直观;条形图 → 分类对比最直接
  2. 系统聚类:n 个样品各为一类开始,不可重新分配
  3. K-means:随机选 K 个质心 → 分配 → 更新质心 → 迭代至收敛
  4. 主成分 = 原始变量线性组合,各 PC 互不相关,方差递减
  5. 综合得分 $F = \sum w_j \cdot PC_j$,用于综合评价排序
  6. $g_j^2$(公共因子贡献)越大 → $F_j$ 对所有变量影响越强
  7. 共同度 → 反映单个变量被公共因子解释的程度
  8. 相关分析:变量平等,看关联;回归分析:变量不平等,看因果
  9. F 检验 → 整体显著性;t 检验 → 单个系数显著性 ($p < 0.05$ 保留)
  10. $R^2$ 越接近 1,拟合越好
  11. y 连续 → 线性回归;y 二分类 → 逻辑回归(Binomial)
  12. $L_8(2^7)$:8次实验、7因素、每因素2水平
  13. Bayes 判别需要先验概率 → 后验概率最大者归类

← 返回首页