统计学基础:从描述统计到方差分析

概述

本笔记合并统计学系列讲义,从描述统计、抽样分布与置信区间、假设检验,到相关分析与方差分析(ANOVA),形成一条完整的基础统计学习线。

一、统计学导论与描述统计基础(原 F022·A)

一句话概括

本课件是面向感官分析(sensorial analysis)方向学生的统计学入门课,围绕”设计研究-采集数据-描述数据-分析数据-得出结论”五步流程展开,重点讲解描述统计中的频数分布、集中趋势与离散度量方法,并以学生数据集和 SAT 分数为例演示分组直方图的构建。

关键结论

  1. 统计学研究的完整流程包括五步:设计研究(designing a study)、采集优质数据(collecting good data)、用数字和图形描述数据、分析数据、得出结论,且样本(sample)不等于总体(population),采样需具备代表性并避免偏差(bias)(p.5-8)。
  2. 得出结论时须警惕相关性不等于因果性(correlation ≠ causation),也不应过度解读(overstate)统计结果,二者是本课程反复强调的方法论底线(p.10-11)。
  3. 变量分为定量(quantitative:离散/连续)和定性(qualitative:名义/顺序)两大类,描述统计主要有三种工具:频数分布(frequency distribution)、集中趋势度量(measures of central tendency)、离散度量(measures of variability)(p.12-13)。
  4. 构建频数分布需先求最大最小值,再确定分组数并计算组距(class amplitude),进而算出各组绝对频数与相对频数;组数的选择可参考 Freedman-Diaconis 法则并结合可视化目的,避免因分组不当掩盖或夸大信息(p.17-23)。
  5. 集中趋势常用样本均值(sample average)和中位数(median),均值受极端值/离群值(outlier)影响大,中位数更稳健(robust);离散度量包括极差、四分位距(IQR=Q3-Q1)、方差与标准差及变异系数(CV),二者需配合使用才能完整刻画样本特征(p.24-32)。

相关 A 级笔记

二、统计学基础——描述统计与随机变量(原 F017·B)

一句话概括

本课件是食品统计学课程的第一部分,系统讲解描述性统计(均值、中位数、众数、方差、频数)与随机变量(离散型/连续型)及正态分布、卡方分布、t 分布、F 分布等基础概念,为后续假设检验与方差分析课程做铺垫。

关键结论

  1. 描述统计常用三种集中趋势指标——样本均值(sample mean)、中位数(median)、众数(mode),并配合样本方差(sampling variance)和标准差衡量数据离散程度,是任何统计分析的起点(p.6-7)。
  2. 随机变量(random variable)分为离散型(用概率质量函数 PMF 描述,如伯努利分布 Bernoulli、二项分布 Binomial)和连续型(用概率密度函数 PDF 描述),二者的期望值(expected value)与方差(variance)是描述总体分布的两个核心矩(moments)(p.14-30)。
  3. 需要区分样本层面的统计量(样本均值、样本方差)与总体随机变量的矩(期望、方差),两者概念相似但本质不同,是后续统计推断(statistical inference)的关键区分(p.24)。
  4. 统计推断依赖四类连续分布:正态分布 N(μ,σ²)、标准正态分布 N(0,1)(通过标准化 Z=(X-μ)/σ 得到,便于查表)、卡方分布 χ²(k)(标准正态平方和)、学生 t 分布(Student’s t)(正态与卡方比值,尾部更厚)以及 F 分布(F distribution)(两个卡方比值),它们分别对应不同检验场景(p.32-43)。
  5. 以身高服从 N(150, 20²) 为例演示标准化查表求概率的具体方法,说明标准正态表的实用价值(p.38)。

相关 A 级笔记

三、统计推断基础——总体分布与抽样分布(原 F020·B)

一句话概括

本课件以红酒酒精度估计为引例,讲解统计推断(statistical inference)的必要性与基本流程,介绍离散/连续总体分布的区分、抽样分布(sampling distribution)概念、正态分布(Normal distribution)特性及其标准化,并说明中心极限定理(CLT)与 t 分布在样本量不足或方差未知时的应用。

关键结论

  1. 统计推断源于普查(census)成本过高而抽样调查更经济但精度较低的权衡:通过对样本统计量的分布规律进行建模,可以量化样本估计对总体的推断不确定性(p.2-3)。
  2. 统计推断的标准流程为:确定目标总体及关注特征(均值、方差、中位数等)→抽取 J 个样本→计算各样本统计量→得到抽样分布→用抽样分布量化估计的不确定性(p.4)。
  3. 总体分布可分为离散型(如抛硬币、次品检测,有限个可能结果)和连续型(如酒精度、身高、测量误差等取值连续的变量),两者需要用不同数学工具建模(p.5-6)。
  4. 正态分布(Normal/Gaussian distribution)是自然与社会现象中最常见的分布,其密度对称、均值=中位数,约99.7%的观测落在均值±3个标准差内;通过标准化(standardization,减均值除以标准差)可将任意正态分布转为标准正态分布(μ=0, σ=1),便于查表计算概率(p.9-13)。
  5. 当总体不服从正态分布时,只要样本量足够大(经验上不小于30),依据中心极限定理(Central Limit Theorem, CLT)样本均值的抽样分布仍可近似为正态分布;当样本量较小且方差未知时,则应改用尾部更厚的 t 分布(t-distribution)来描述抽样分布(p.14-16)。

相关 A 级笔记

四、抽样分布与置信区间(原 F003·B)

一句话概括

本课件讲解统计推断中抽样分布(sampling distribution)与置信区间(confidence interval)的构造逻辑,涵盖样本均值的分布性质、大数定律与中心极限定理,以及在方差已知/未知两种情形下如何用枢轴量(pivotal quantity)构造总体均值的置信区间,并以冷冻披萨重量为例完整演算。

关键结论

  1. 从总体中反复抽样并计算某统计量(如样本均值)得到的所有取值的分布称为抽样分布(sampling distribution);样本必须具有代表性且随机抽取,样本量越大推断越可靠(p.3-6)。
  2. 样本均值 X̄ 本身是一个随机变量,服从 N(μ, σ²/n),具有无偏性(unbiasedness) E[X̄]=μ;弱大数定律(weak law of large numbers)保证 n→∞时 X̄ 收敛于总体期望,中心极限定理(central limit theorem)保证不论 X 原始分布形态如何,标准化后的 X̄ 都趋于标准正态分布(p.10-11)。(据课件,未经核实)
  3. 置信区间是由样本计算出的区间估计(interval estimate)而非点估计,其含义是:若重复抽样多次构造区间,约 C%(如95%)的区间会包含真实参数 μ;置信区间本身不是概率分布,区间内的值不具有概率含义(p.17-19、p.27)。
  4. 构造置信区间需要枢轴量(pivotal quantity)——其分布不依赖于待估参数;总体方差已知时枢轴量 Z=(X̄-μ)/(σ/√n) 服从标准正态分布,方差未知、用样本方差替代时枢轴量服从自由度 n-1 的 t 分布(Student’s t)(p.20-28)。
  5. 案例:对 n=25 份冷冻披萨重量样本(x̄=354.07,σ̂=23.44)构造 95% 置信区间,利用 t(24) 分布查表得临界值 ±2.064,最终得到均值的 95% 置信区间为 [344.39, 363.75](p.31-33)。

相关 A 级笔记

五、置信区间与假设检验入门(原 F021·B)

一句话概括

本讲是统计推断系列的第二讲,讲授如何利用抽样分布构建置信区间(confidence interval)并进行假设检验(hypothesis testing),从而对总体参数(如均值μ)做出带不确定性度量的推断。

关键结论

  1. 统计推断需要三要素:总体分布假设、抽样分布、样本及样本统计量;在此基础上才能给样本估计值附加不确定性度量(p.2)。
  2. 置信区间是包含真实总体参数(1-α)比例次数的数值区间,α为区间出错的比例,常见取值1%、5%、10%,α越小区间越宽(p.4, p.6)。
  3. 置信区间的正确解读是”该区间在重复抽样下有(1-α)%的概率包含真实参数”,而非”参数落在某具体区间内的概率”——这是常见误解(p.6)。
  4. 假设检验分为单尾(one-sided)和双尾(two-sided)两类,核心步骤为:设定原假设H0与备择假设H1、抽样计算样本统计量、转换为标准化检验统计量、与临界值比较(p.8, p.10)。
  5. 原假设代表”无意义”的默认情形,检验目标是寻找反对它的证据;若原假设为真却被错误拒绝,称为第一类错误(Type I Error),检验程序应尽量降低此类错误概率(p.8, p.11)。

相关 A 级笔记

六、假设检验与统计功效分析(原 F010·B)

一句话概括

本课件讲解统计假设检验(statistical tests)的完整逻辑——从原假设(null hypothesis)与备择假设(alternative hypothesis)的设定、检验统计量与拒绝域的构造,到第一类/第二类错误与统计功效(power)分析,并以冷冻披萨重量检验为例演示完整计算流程。

关键结论

  1. 假设检验的基本流程是:确定关注参数(如总体均值 μ)→设定原假设 H0 与备择假设 H1(单侧或双侧)→构造检验统计量 T(S) 及其在 H0 成立下的抽样分布→根据显著性水平确定拒绝域(rejection region)(p.3-9)。
  2. 显著性水平 α 即第一类错误(Type I error)概率——原假设为真却被错误拒绝的概率,常取 1%、5%、10%;p 值表示观测到比当前样本更极端结果的概率,p 值小于 α 即拒绝原假设(p.11、p.15)。
  3. 拒绝原假设不等于证明原假设错误,只能说明数据在原假设下出现的可能性很低,检验结论高度依赖数据采集质量,须警惕过度解读显著性结果(p.20-21)。
  4. 第二类错误(Type II error)β 是原假设为假却未被拒绝的概率,统计功效(power)=1-β 衡量检验正确识别真实效应的能力,功效随样本量 n、效应量(effect size)增大而提高,随方差 σ 增大、显著性水平收紧而降低;常见经验阈值为功效需达到约 80% 方可信(p.23-33)。
  5. 功效分析(power analysis)应在检验前基于假设的效应量预先设定,而非利用已获得的显著结果反推功效,否则会人为夸大功效、属于不当做法(p.35-37)。
  6. 案例:对 n=25 份冷冻披萨重量做单侧检验(H0: μ=350 vs H1: μ>350),计算得检验统计量 T(s)=-0.176,小于临界值 t(24,0.95)=1.71,故不能拒绝原假设(p.39-42)。

相关 A 级笔记

七、多变量分析——双向表与相关性(原 F023·B)

一句话概括

本课件在单变量描述统计基础上引入多变量分析,讲解如何用双向表(two-way table)呈现两个变量的联合频数分布、通过边际化(marginalization)得到边际分布,并用协方差(covariance)与相关系数(correlation)量化变量间的线性关联,最后讨论独立性与相关性的关系。

关键结论

  1. 当样本含两个以上变量时,可用双向表(two-way table)将各变量分组后交叉列联,呈现联合频数分布(joint frequency distribution),例如按销售额与利润分组统计门店数量(p.6-8)。
  2. 对双向表按行或按列求和得到的分布称为边际频数分布(marginal frequency distribution),这一操作叫边际化(marginalization),相当于单独考察某一变量而忽略另一变量的信息(p.9-10)。
  3. 样本协方差(sample covariance)衡量两变量线性关联的方向和程度,但对非线性关系(如二次关系)会失效或产生误导,因此常配合散点图判断关系形态是否为线性(p.11-17)。
  4. 样本相关系数(sample correlation) ρ 是协方差除以两变量标准差之积,取值范围 [-1,1],便于跨变量对比;例如案例中酒类销售额与门店利润相关系数为0.76,而费用与利润相关系数仅为-0.019,说明后者几乎无线性关系(p.19)。
  5. 双向表还可用于计算联合概率(joint probability)、边际概率(marginal probability)和条件概率(conditional probability);需特别注意:独立(independence)必然导致零相关,但零相关不能反推独立,因为相关系数只捕捉线性关系(p.20-22)。

相关 A 级笔记

八、单因素参数方差分析(ANOVA)原理与实例(原 F019·B)

一句话概括

本课件讲解单因素参数方差分析(one-way parametric ANOVA)的假设条件、组间/组内方差分解逻辑与 F 检验流程,并以三种肥料对作物产量影响的实例完整演示计算步骤,是感官分析课程中判断多组均值差异的核心工具。

关键结论

  1. ANOVA 用于将数据总变异分解为多个来源,主要应用于受控实验设计数据;核心概念包括响应变量(response variable)、处理变量(treatment variable)与不可观测的外部变量(external variable / unobservable)(p.2-3)。
  2. 单因素 ANOVA 要求 K 个独立随机样本均服从正态分布且方差齐性(homoscedasticity)相同,原假设为各组总体均值相等 H0: μ1=…=μK,目的是检验处理是否造成组间系统性差异(p.4-6)。
  3. 通过计算各组样本均值、总体均值,进一步得到组间方差(between variance, s²b)与组内方差(within variance, s²w):前者反映跨组变化,后者反映组内随机波动;当组间方差显著大于组内方差时倾向于拒绝原假设(p.8-12)。
  4. 检验统计量 TS=s²b/s²w 在原假设下服从自由度为(K-1, n-K)的 F 分布(F distribution),属单侧检验,判定规则为若计算值大于临界值 F(0.05,K-1,n-K) 则拒绝原假设(p.13-14)。
  5. 肥料产量实例(三组各5次观测,n=15)计算得 s²b=115.4,s²w=5.9,检验统计量=19.44,远超临界值 F(0.05,2,12)=3.88,据此拒绝原假设,结论为至少一种肥料的产量与其他不同(p.15-17)。

相关 A 级笔记

九、方差分析(ANOVA)与 Friedman 非参数检验(原 F016·B)

一句话概括

本课件系统讲解单因素参数方差分析(one-way ANOVA)的原理、假设、组间/组内方差分解与 F 检验流程,并介绍适用于非正态或排序数据的非参数替代方法 Friedman 检验,均配有肥料产量和感官排序的实例计算。

关键结论

  1. ANOVA 的核心思想是将数据总变异分解为处理效应导致的组间变异(between-group variance, SSb)和随机噪声导致的组内变异(within-group variance, SSw),通过比较二者判断分组均值是否存在系统性差异(p.3-14)。
  2. 单因素 ANOVA 需满足三个假设:K 个独立随机样本、各样本服从正态分布、且方差齐性(homoscedasticity)相同;原假设为各组总体均值相等 H0: μ1=…=μK(p.6)。
  3. 检验统计量为组间方差与组内方差之比 T(S)=σb²/σw²,在原假设下服从自由度为(K-1, n-K)的 F 分布(F distribution),统计量越大越倾向拒绝原假设(p.15、p.22-25)。
  4. 肥料产量案例(3组各5次观测)计算得 SSb=230.8、SSw=71.2,检验统计量 F=19.44 远大于临界值 F(0.05,2,12)=3.89,故拒绝原假设,说明三种肥料产量存在显著差异(p.27-33)。
  5. 当数据非正态或为排序型(如感官评价中的产品排名)时,需改用非参数方法 Friedman 检验(Friedman test),该检验仅要求处理随机分配且各组分布连续,通过对每行排序后计算列秩和构造统计量,在样本量大时近似服从卡方分布(p.35-41)。(据课件,未经核实)

相关 A 级笔记

术语表(合并)

中文原文
样本sample
总体population
频数分布frequency distribution
集中趋势central tendency
四分位距interquartile range (IQR)
离群值outlier
变异系数coefficient of variation (CV)
稳健统计量robust statistic
随机变量random variable
概率质量函数probability mass function (PMF)
概率密度函数probability density function (PDF)
期望值expected value
方差variance
标准正态分布standard normal distribution
卡方分布chi-squared distribution
学生t分布Student’s t distribution
F分布F distribution
伯努利分布Bernoulli distribution
二项分布Binomial distribution
统计推断statistical inference
普查census
抽样分布sampling distribution
正态分布Normal (Gaussian) distribution
标准化standardization
中心极限定理Central Limit Theorem (CLT)
t分布t-distribution
置信区间confidence interval
枢轴量pivotal quantity
大数定律law of large numbers
无偏性unbiasedness
点估计point estimation
区间估计interval estimation
置信水平confidence level
显著性水平α (significance level)
原假设null hypothesis, H0
备择假设alternative hypothesis, H1
检验统计量test statistic
第一类错误Type I Error
单尾/双尾检验one-sided/two-sided test
第二类错误Type II error
统计功效power
效应量effect size
拒绝域rejection region
p值p-value
响应变量response variable
处理变量treatment variable
组间方差between variance
组内方差within variance
方差齐性homoscedasticity
方差分析ANOVA (Analysis of Variance)
Friedman检验Friedman test
双向表two-way table
联合频数分布joint frequency distribution
边际化marginalization
协方差covariance
相关系数correlation coefficient
联合概率joint probability
条件概率conditional probability
独立性independence