统计学基础:从描述统计到方差分析
概述
本笔记合并统计学系列讲义,从描述统计、抽样分布与置信区间、假设检验,到相关分析与方差分析(ANOVA),形成一条完整的基础统计学习线。
一、统计学导论与描述统计基础(原 F022·A)
一句话概括
本课件是面向感官分析(sensorial analysis)方向学生的统计学入门课,围绕”设计研究-采集数据-描述数据-分析数据-得出结论”五步流程展开,重点讲解描述统计中的频数分布、集中趋势与离散度量方法,并以学生数据集和 SAT 分数为例演示分组直方图的构建。
关键结论
- 统计学研究的完整流程包括五步:设计研究(designing a study)、采集优质数据(collecting good data)、用数字和图形描述数据、分析数据、得出结论,且样本(sample)不等于总体(population),采样需具备代表性并避免偏差(bias)(p.5-8)。
- 得出结论时须警惕相关性不等于因果性(correlation ≠ causation),也不应过度解读(overstate)统计结果,二者是本课程反复强调的方法论底线(p.10-11)。
- 变量分为定量(quantitative:离散/连续)和定性(qualitative:名义/顺序)两大类,描述统计主要有三种工具:频数分布(frequency distribution)、集中趋势度量(measures of central tendency)、离散度量(measures of variability)(p.12-13)。
- 构建频数分布需先求最大最小值,再确定分组数并计算组距(class amplitude),进而算出各组绝对频数与相对频数;组数的选择可参考 Freedman-Diaconis 法则并结合可视化目的,避免因分组不当掩盖或夸大信息(p.17-23)。
- 集中趋势常用样本均值(sample average)和中位数(median),均值受极端值/离群值(outlier)影响大,中位数更稳健(robust);离散度量包括极差、四分位距(IQR=Q3-Q1)、方差与标准差及变异系数(CV),二者需配合使用才能完整刻画样本特征(p.24-32)。
相关 A 级笔记
- 无
二、统计学基础——描述统计与随机变量(原 F017·B)
一句话概括
本课件是食品统计学课程的第一部分,系统讲解描述性统计(均值、中位数、众数、方差、频数)与随机变量(离散型/连续型)及正态分布、卡方分布、t 分布、F 分布等基础概念,为后续假设检验与方差分析课程做铺垫。
关键结论
- 描述统计常用三种集中趋势指标——样本均值(sample mean)、中位数(median)、众数(mode),并配合样本方差(sampling variance)和标准差衡量数据离散程度,是任何统计分析的起点(p.6-7)。
- 随机变量(random variable)分为离散型(用概率质量函数 PMF 描述,如伯努利分布 Bernoulli、二项分布 Binomial)和连续型(用概率密度函数 PDF 描述),二者的期望值(expected value)与方差(variance)是描述总体分布的两个核心矩(moments)(p.14-30)。
- 需要区分样本层面的统计量(样本均值、样本方差)与总体随机变量的矩(期望、方差),两者概念相似但本质不同,是后续统计推断(statistical inference)的关键区分(p.24)。
- 统计推断依赖四类连续分布:正态分布 N(μ,σ²)、标准正态分布 N(0,1)(通过标准化 Z=(X-μ)/σ 得到,便于查表)、卡方分布 χ²(k)(标准正态平方和)、学生 t 分布(Student’s t)(正态与卡方比值,尾部更厚)以及 F 分布(F distribution)(两个卡方比值),它们分别对应不同检验场景(p.32-43)。
- 以身高服从 N(150, 20²) 为例演示标准化查表求概率的具体方法,说明标准正态表的实用价值(p.38)。
相关 A 级笔记
- 无
三、统计推断基础——总体分布与抽样分布(原 F020·B)
一句话概括
本课件以红酒酒精度估计为引例,讲解统计推断(statistical inference)的必要性与基本流程,介绍离散/连续总体分布的区分、抽样分布(sampling distribution)概念、正态分布(Normal distribution)特性及其标准化,并说明中心极限定理(CLT)与 t 分布在样本量不足或方差未知时的应用。
关键结论
- 统计推断源于普查(census)成本过高而抽样调查更经济但精度较低的权衡:通过对样本统计量的分布规律进行建模,可以量化样本估计对总体的推断不确定性(p.2-3)。
- 统计推断的标准流程为:确定目标总体及关注特征(均值、方差、中位数等)→抽取 J 个样本→计算各样本统计量→得到抽样分布→用抽样分布量化估计的不确定性(p.4)。
- 总体分布可分为离散型(如抛硬币、次品检测,有限个可能结果)和连续型(如酒精度、身高、测量误差等取值连续的变量),两者需要用不同数学工具建模(p.5-6)。
- 正态分布(Normal/Gaussian distribution)是自然与社会现象中最常见的分布,其密度对称、均值=中位数,约99.7%的观测落在均值±3个标准差内;通过标准化(standardization,减均值除以标准差)可将任意正态分布转为标准正态分布(μ=0, σ=1),便于查表计算概率(p.9-13)。
- 当总体不服从正态分布时,只要样本量足够大(经验上不小于30),依据中心极限定理(Central Limit Theorem, CLT)样本均值的抽样分布仍可近似为正态分布;当样本量较小且方差未知时,则应改用尾部更厚的 t 分布(t-distribution)来描述抽样分布(p.14-16)。
相关 A 级笔记
- 无
四、抽样分布与置信区间(原 F003·B)
一句话概括
本课件讲解统计推断中抽样分布(sampling distribution)与置信区间(confidence interval)的构造逻辑,涵盖样本均值的分布性质、大数定律与中心极限定理,以及在方差已知/未知两种情形下如何用枢轴量(pivotal quantity)构造总体均值的置信区间,并以冷冻披萨重量为例完整演算。
关键结论
- 从总体中反复抽样并计算某统计量(如样本均值)得到的所有取值的分布称为抽样分布(sampling distribution);样本必须具有代表性且随机抽取,样本量越大推断越可靠(p.3-6)。
- 样本均值 X̄ 本身是一个随机变量,服从 N(μ, σ²/n),具有无偏性(unbiasedness) E[X̄]=μ;弱大数定律(weak law of large numbers)保证 n→∞时 X̄ 收敛于总体期望,中心极限定理(central limit theorem)保证不论 X 原始分布形态如何,标准化后的 X̄ 都趋于标准正态分布(p.10-11)。(据课件,未经核实)
- 置信区间是由样本计算出的区间估计(interval estimate)而非点估计,其含义是:若重复抽样多次构造区间,约 C%(如95%)的区间会包含真实参数 μ;置信区间本身不是概率分布,区间内的值不具有概率含义(p.17-19、p.27)。
- 构造置信区间需要枢轴量(pivotal quantity)——其分布不依赖于待估参数;总体方差已知时枢轴量 Z=(X̄-μ)/(σ/√n) 服从标准正态分布,方差未知、用样本方差替代时枢轴量服从自由度 n-1 的 t 分布(Student’s t)(p.20-28)。
- 案例:对 n=25 份冷冻披萨重量样本(x̄=354.07,σ̂=23.44)构造 95% 置信区间,利用 t(24) 分布查表得临界值 ±2.064,最终得到均值的 95% 置信区间为 [344.39, 363.75](p.31-33)。
相关 A 级笔记
- 无
五、置信区间与假设检验入门(原 F021·B)
一句话概括
本讲是统计推断系列的第二讲,讲授如何利用抽样分布构建置信区间(confidence interval)并进行假设检验(hypothesis testing),从而对总体参数(如均值μ)做出带不确定性度量的推断。
关键结论
- 统计推断需要三要素:总体分布假设、抽样分布、样本及样本统计量;在此基础上才能给样本估计值附加不确定性度量(p.2)。
- 置信区间是包含真实总体参数(1-α)比例次数的数值区间,α为区间出错的比例,常见取值1%、5%、10%,α越小区间越宽(p.4, p.6)。
- 置信区间的正确解读是”该区间在重复抽样下有(1-α)%的概率包含真实参数”,而非”参数落在某具体区间内的概率”——这是常见误解(p.6)。
- 假设检验分为单尾(one-sided)和双尾(two-sided)两类,核心步骤为:设定原假设H0与备择假设H1、抽样计算样本统计量、转换为标准化检验统计量、与临界值比较(p.8, p.10)。
- 原假设代表”无意义”的默认情形,检验目标是寻找反对它的证据;若原假设为真却被错误拒绝,称为第一类错误(Type I Error),检验程序应尽量降低此类错误概率(p.8, p.11)。
相关 A 级笔记
- 无
六、假设检验与统计功效分析(原 F010·B)
一句话概括
本课件讲解统计假设检验(statistical tests)的完整逻辑——从原假设(null hypothesis)与备择假设(alternative hypothesis)的设定、检验统计量与拒绝域的构造,到第一类/第二类错误与统计功效(power)分析,并以冷冻披萨重量检验为例演示完整计算流程。
关键结论
- 假设检验的基本流程是:确定关注参数(如总体均值 μ)→设定原假设 H0 与备择假设 H1(单侧或双侧)→构造检验统计量 T(S) 及其在 H0 成立下的抽样分布→根据显著性水平确定拒绝域(rejection region)(p.3-9)。
- 显著性水平 α 即第一类错误(Type I error)概率——原假设为真却被错误拒绝的概率,常取 1%、5%、10%;p 值表示观测到比当前样本更极端结果的概率,p 值小于 α 即拒绝原假设(p.11、p.15)。
- 拒绝原假设不等于证明原假设错误,只能说明数据在原假设下出现的可能性很低,检验结论高度依赖数据采集质量,须警惕过度解读显著性结果(p.20-21)。
- 第二类错误(Type II error)β 是原假设为假却未被拒绝的概率,统计功效(power)=1-β 衡量检验正确识别真实效应的能力,功效随样本量 n、效应量(effect size)增大而提高,随方差 σ 增大、显著性水平收紧而降低;常见经验阈值为功效需达到约 80% 方可信(p.23-33)。
- 功效分析(power analysis)应在检验前基于假设的效应量预先设定,而非利用已获得的显著结果反推功效,否则会人为夸大功效、属于不当做法(p.35-37)。
- 案例:对 n=25 份冷冻披萨重量做单侧检验(H0: μ=350 vs H1: μ>350),计算得检验统计量 T(s)=-0.176,小于临界值 t(24,0.95)=1.71,故不能拒绝原假设(p.39-42)。
相关 A 级笔记
- 无
七、多变量分析——双向表与相关性(原 F023·B)
一句话概括
本课件在单变量描述统计基础上引入多变量分析,讲解如何用双向表(two-way table)呈现两个变量的联合频数分布、通过边际化(marginalization)得到边际分布,并用协方差(covariance)与相关系数(correlation)量化变量间的线性关联,最后讨论独立性与相关性的关系。
关键结论
- 当样本含两个以上变量时,可用双向表(two-way table)将各变量分组后交叉列联,呈现联合频数分布(joint frequency distribution),例如按销售额与利润分组统计门店数量(p.6-8)。
- 对双向表按行或按列求和得到的分布称为边际频数分布(marginal frequency distribution),这一操作叫边际化(marginalization),相当于单独考察某一变量而忽略另一变量的信息(p.9-10)。
- 样本协方差(sample covariance)衡量两变量线性关联的方向和程度,但对非线性关系(如二次关系)会失效或产生误导,因此常配合散点图判断关系形态是否为线性(p.11-17)。
- 样本相关系数(sample correlation) ρ 是协方差除以两变量标准差之积,取值范围 [-1,1],便于跨变量对比;例如案例中酒类销售额与门店利润相关系数为0.76,而费用与利润相关系数仅为-0.019,说明后者几乎无线性关系(p.19)。
- 双向表还可用于计算联合概率(joint probability)、边际概率(marginal probability)和条件概率(conditional probability);需特别注意:独立(independence)必然导致零相关,但零相关不能反推独立,因为相关系数只捕捉线性关系(p.20-22)。
相关 A 级笔记
- 无
八、单因素参数方差分析(ANOVA)原理与实例(原 F019·B)
一句话概括
本课件讲解单因素参数方差分析(one-way parametric ANOVA)的假设条件、组间/组内方差分解逻辑与 F 检验流程,并以三种肥料对作物产量影响的实例完整演示计算步骤,是感官分析课程中判断多组均值差异的核心工具。
关键结论
- ANOVA 用于将数据总变异分解为多个来源,主要应用于受控实验设计数据;核心概念包括响应变量(response variable)、处理变量(treatment variable)与不可观测的外部变量(external variable / unobservable)(p.2-3)。
- 单因素 ANOVA 要求 K 个独立随机样本均服从正态分布且方差齐性(homoscedasticity)相同,原假设为各组总体均值相等 H0: μ1=…=μK,目的是检验处理是否造成组间系统性差异(p.4-6)。
- 通过计算各组样本均值、总体均值,进一步得到组间方差(between variance, s²b)与组内方差(within variance, s²w):前者反映跨组变化,后者反映组内随机波动;当组间方差显著大于组内方差时倾向于拒绝原假设(p.8-12)。
- 检验统计量 TS=s²b/s²w 在原假设下服从自由度为(K-1, n-K)的 F 分布(F distribution),属单侧检验,判定规则为若计算值大于临界值 F(0.05,K-1,n-K) 则拒绝原假设(p.13-14)。
- 肥料产量实例(三组各5次观测,n=15)计算得 s²b=115.4,s²w=5.9,检验统计量=19.44,远超临界值 F(0.05,2,12)=3.88,据此拒绝原假设,结论为至少一种肥料的产量与其他不同(p.15-17)。
相关 A 级笔记
- 无
九、方差分析(ANOVA)与 Friedman 非参数检验(原 F016·B)
一句话概括
本课件系统讲解单因素参数方差分析(one-way ANOVA)的原理、假设、组间/组内方差分解与 F 检验流程,并介绍适用于非正态或排序数据的非参数替代方法 Friedman 检验,均配有肥料产量和感官排序的实例计算。
关键结论
- ANOVA 的核心思想是将数据总变异分解为处理效应导致的组间变异(between-group variance, SSb)和随机噪声导致的组内变异(within-group variance, SSw),通过比较二者判断分组均值是否存在系统性差异(p.3-14)。
- 单因素 ANOVA 需满足三个假设:K 个独立随机样本、各样本服从正态分布、且方差齐性(homoscedasticity)相同;原假设为各组总体均值相等 H0: μ1=…=μK(p.6)。
- 检验统计量为组间方差与组内方差之比 T(S)=σb²/σw²,在原假设下服从自由度为(K-1, n-K)的 F 分布(F distribution),统计量越大越倾向拒绝原假设(p.15、p.22-25)。
- 肥料产量案例(3组各5次观测)计算得 SSb=230.8、SSw=71.2,检验统计量 F=19.44 远大于临界值 F(0.05,2,12)=3.89,故拒绝原假设,说明三种肥料产量存在显著差异(p.27-33)。
- 当数据非正态或为排序型(如感官评价中的产品排名)时,需改用非参数方法 Friedman 检验(Friedman test),该检验仅要求处理随机分配且各组分布连续,通过对每行排序后计算列秩和构造统计量,在样本量大时近似服从卡方分布(p.35-41)。(据课件,未经核实)
相关 A 级笔记
- 无
术语表(合并)
| 中文 | 原文 |
|---|---|
| 样本 | sample |
| 总体 | population |
| 频数分布 | frequency distribution |
| 集中趋势 | central tendency |
| 四分位距 | interquartile range (IQR) |
| 离群值 | outlier |
| 变异系数 | coefficient of variation (CV) |
| 稳健统计量 | robust statistic |
| 随机变量 | random variable |
| 概率质量函数 | probability mass function (PMF) |
| 概率密度函数 | probability density function (PDF) |
| 期望值 | expected value |
| 方差 | variance |
| 标准正态分布 | standard normal distribution |
| 卡方分布 | chi-squared distribution |
| 学生t分布 | Student’s t distribution |
| F分布 | F distribution |
| 伯努利分布 | Bernoulli distribution |
| 二项分布 | Binomial distribution |
| 统计推断 | statistical inference |
| 普查 | census |
| 抽样分布 | sampling distribution |
| 正态分布 | Normal (Gaussian) distribution |
| 标准化 | standardization |
| 中心极限定理 | Central Limit Theorem (CLT) |
| t分布 | t-distribution |
| 置信区间 | confidence interval |
| 枢轴量 | pivotal quantity |
| 大数定律 | law of large numbers |
| 无偏性 | unbiasedness |
| 点估计 | point estimation |
| 区间估计 | interval estimation |
| 置信水平 | confidence level |
| 显著性水平 | α (significance level) |
| 原假设 | null hypothesis, H0 |
| 备择假设 | alternative hypothesis, H1 |
| 检验统计量 | test statistic |
| 第一类错误 | Type I Error |
| 单尾/双尾检验 | one-sided/two-sided test |
| 第二类错误 | Type II error |
| 统计功效 | power |
| 效应量 | effect size |
| 拒绝域 | rejection region |
| p值 | p-value |
| 响应变量 | response variable |
| 处理变量 | treatment variable |
| 组间方差 | between variance |
| 组内方差 | within variance |
| 方差齐性 | homoscedasticity |
| 方差分析 | ANOVA (Analysis of Variance) |
| Friedman检验 | Friedman test |
| 双向表 | two-way table |
| 联合频数分布 | joint frequency distribution |
| 边际化 | marginalization |
| 协方差 | covariance |
| 相关系数 | correlation coefficient |
| 联合概率 | joint probability |
| 条件概率 | conditional probability |
| 独立性 | independence |