统计学与数据分析(IE 视角):从数据到决策的完整链路
引言:为什么你的统计学「学过但不会用」
很多 IE 学生的统计学学习经历是这样的:
- 课堂上学了一堆公式:正态分布、t 分布、卡方分布、置信区间、假设检验
- 考试能算出标准答案
- 到了工作中遇到实际问题,完全不知道该用哪个方法
问题出在哪?
答案是:统计学课程通常是按「方法的数学结构」组织的,而工作需要的是按「问题类型」组织的。
课程的顺序是:概率 → 随机变量 → 分布 → 抽样 → 估计 → 检验 → 回归 → 实验设计
工作的顺序是:我要回答什么问题?→ 该用什么方法?→ 怎么解读结果?
本文按后者组织,把统计学重新映射到 IE 的真实工作场景。
一、先建立问题框架:IE 的六类统计问题
| # | 问题 | 对应方法 | 典型场景 |
|---|---|---|---|
| 1 | 这批数据的特征是什么? | 描述统计 + 可视化 | 统计某工序的加工时间分布 |
| 2 | 总体的真实值是多少? | 参数估计(置信区间) | 估计某工序的平均工时 |
| 3 | 改善前后有差别吗? | 假设检验(t 检验等) | 验证改善措施是否有效 |
| 4 | 多个方案哪个更好? | 方差分析(ANOVA) | 比较三种工艺的效率 |
| 5 | 变量之间什么关系? | 回归分析 / 相关分析 | 工时与影响因素的关系 |
| 6 | 怎么找到最优参数组合? | 试验设计(DOE) | 优化注塑工艺参数 |
接下来按这个顺序展开。
二、第一类问题:数据长什么样(描述统计)
2.1 三类特征
拿到一批数据,先用三个维度描述它:
(1)集中趋势(数据集中在哪)
| 指标 | 计算 | 特点 | 何时用 |
|---|---|---|---|
| 均值(Mean) | x̄ = Σx/n | 利用全部信息 | 分布近似对称时 |
| 中位数(Median) | 排序后中间的数 | 不受极端值影响 | 有异常值或偏态分布时 |
| 众数(Mode) | 出现次数最多的值 | 分类数据 |
IE 场景提醒:工时数据通常是右偏的(少数情况耗时特别长)。此时中位数比均值更能代表「典型情况」。
举例:某工序 10 次观测(秒):52, 48, 51, 49, 50, 53, 47, 52, 50, 180(其中一次设备卡料)
均值 = (52+48+51+49+50+53+47+52+50+180)/10 = 63.2 秒
中位数 = 排序后第 5、6 个的平均 = (50+51)/2 = 50.5 秒
→ 均值被那次异常拉高了 25%,中位数更接近实际
(2)离散程度(数据有多分散)
| 指标 | 计算 | 用途 |
|---|---|---|
| 极差(Range) | R = max - min | 粗略、快速(控制图用) |
| 方差(Variance) | s² = Σ(x-x̄)²/(n-1) | 理论计算 |
| 标准差(SD) | s = √s² | 最常用,与原数据同量纲 |
| 变异系数(CV) | CV = s/x̄ × 100% | 比较不同量纲数据的离散度 |
★ 变异系数是 IE 中极其实用但常被忽视的指标。
举例:比较两条产线的稳定性
A 线:生产大型件,平均工时 120 秒,标准差 6 秒
B 线:生产小型件,平均工时 15 秒,标准差 1.5 秒
用标准差比较:A 的 6 > B 的 1.5,A 更不稳定
用变异系数比较:CV_A = 5%,CV_B = 10%
→ 实际上 B 线的相对波动更大,B 更不稳定
为什么重要:质量改进的本质是减小变异。 而「变异」必须相对于「水平」来衡量。
(3)分布形态(数据怎么分布)
| 特征 | 说明 | IE 意义 |
|---|---|---|
| 偏度(Skewness) | 分布是否对称 | 工时数据通常右偏 |
| 峰度(Kurtosis) | 尾部厚重程度 | |
| 正态性 | 是否服从正态分布 | 很多统计方法的前提假设 |
2.2 可视化:六种必备图表
| 图表 | 用途 | IE 场景 |
|---|---|---|
| 直方图 | 看分布形状 | 工时分布、尺寸分布 |
| 箱线图 | 看分布 + 异常值 + 多组对比 | 比较不同班次的效率 |
| 散点图 | 看两变量关系 | 工时 vs 经验年限 |
| 帕累托图 | 排序 + 累计百分比 | 不良原因排序(二八法则) |
| 趋势图/时序图 | 看随时间变化 | 日产量趋势 |
| 控制图 | 看过程是否稳定 | SPC |
帕累托图是 IE 最常用的图表之一:
不良原因统计:
外观划伤 145 件 (50.9%)
尺寸超差 78 件 (27.4%) 累计 78.3%
装配不良 32 件 (11.2%) 累计 89.5%
功能失效 18 件 (6.3%) 累计 95.8%
其他 12 件 (4.2%) 累计 100%
结论:优先解决前两项(划伤 + 尺寸),就能解决 78% 的问题。这正是二八法则的应用。
三、第二类问题:真实值是多少(参数估计)
3.1 点估计与区间估计
点估计:用一个数值估计总体参数(如用样本均值 x̄ 估计总体均值 μ)
区间估计:给出一个范围,并说明这个范围包含真值的可信程度
置信区间的一般形式:
点估计 ± 边际误差
= 点估计 ± (临界值) × (标准误)
3.2 总体均值的置信区间
情形一:总体标准差 σ 已知(或大样本 n ≥ 30)
x̄ ± z_{α/2} × σ/√n
情形二:总体标准差 σ 未知(小样本,最常见)
x̄ ± t_{α/2, n-1} × s/√n
其中 t 分布的自由度 = n - 1
常用临界值:
| 置信水平 | z 值(双尾) | 说明 |
|---|---|---|
| 90% | 1.645 | |
| 95% | 1.96 | 最常用 |
| 99% | 2.576 |
3.3 IE 算例:估计标准工时
场景:要确定某装配工序的标准工时
抽样:随机观测 25 次,得到:
样本均值 x̄ = 48.5 秒
样本标准差 s = 4.2 秒
求总体平均工时的 95% 置信区间:
由于 σ 未知,用 t 分布,自由度 = 24
t_{0.025, 24} = 2.064
置信区间 = 48.5 ± 2.064 × 4.2/√25
= 48.5 ± 2.064 × 0.84
= 48.5 ± 1.73
= (46.77, 50.23) 秒
结论:我们有 95% 的把握,该工序的真实平均工时在 46.8 到 50.2 秒之间。
⚠️ 置信区间的常见误读:
| 错误解读 | 正确解读 |
|---|---|
| 「真值有 95% 的概率落在这个区间内」 | 真值是固定的,区间是随机的。「如果重复抽样 100 次,约有 95 个区间会包含真值」 |
| 「95% 的观测值落在这个区间内」 | 这是对均值的区间,不是对个体观测值的区间 |
3.4 样本量的确定
估计均值时所需样本量:
n = (z_{α/2} × σ / E)²
其中 E 是允许的误差(边际误差)
IE 算例:
要求:以 95% 置信度估计标准工时,误差不超过 ±1 秒
已知:σ ≈ 4 秒(来自历史数据或预抽样)
n = (1.96 × 4 / 1)² = 61.5 → 取 62 次
结论:需要观测 62 次才能满足精度要求。
实务提醒:这就是为什么作业测定通常要求观测 20-30 次以上——样本量太小,估计精度不够,标准工时不可信。
四、第三类问题:有差别吗(假设检验)
这是 IE 工作中使用频率最高的统计工具,没有之一。
4.1 假设检验的基本逻辑
反证法思想:
1. 提出原假设 H₀(通常表示「没有差异」「没有效果」)
2. 提出备择假设 H₁(表示「有差异」「有效果」)
3. 假设 H₀ 为真,计算得到当前样本(或更极端)结果的概率 p
4. 如果 p 很小(< α,通常 0.05),说明 H₀ 为真时几乎不可能出现这样的结果
→ 拒绝 H₀,接受 H₁
否则不拒绝 H₀
4.2 两类错误(必须理解)
| H₀ 为真 | H₀ 为假 | |
|---|---|---|
| 不拒绝 H₀ | ✅ 正确 | ❌ 第二类错误(β) 「漏检」 |
| 拒绝 H₀ | ❌ 第一类错误(α) 「误报」 |
✅ 正确 |
记忆类比(法庭审判):
H₀:被告无罪
第一类错误:无辜的人被判有罪(冤枉好人)
第二类错误:有罪的人被判无罪(放过坏人)
在 IE 场景中的含义:
| 场景 | H₀ | 第一类错误 | 第二类错误 |
|---|---|---|---|
| 验证改善是否有效 | 改善无效 | 误以为改善有效(推行了无效方案) | 漏掉了真正有效的改善 |
| 判断两批原料是否一致 | 两批一致 | 误判为不一致(合格原料被拒收) | 用了不合格原料 |
两类错误的权衡:在样本量固定时,α 减小会导致 β 增大。要同时减小两者,只能增大样本量。
功效(Power):1 - β,表示「当 H₁ 为真时,检验能发现差异的概率」。通常要求功效 ≥ 0.8。
4.3 四步法:假设检验的标准流程
步骤 1:建立假设
H₀:μ = μ₀(或 μ₁ = μ₂,表示无差异)
H₁:μ ≠ μ₀(或 μ₁ ≠ μ₂,表示有差异) ← 双尾
(或 μ > μ₀,μ < μ₀) ← 单尾
步骤 2:选择检验统计量,确定显著性水平 α(通常 0.05)
步骤 3:计算检验统计量的值和 p 值
步骤 4:做出决策
p < α → 拒绝 H₀
p ≥ α → 不拒绝 H₀
4.4 常用检验方法速查
| 场景 | 检验方法 | 条件 |
|---|---|---|
| 单样本均值 vs 已知值 | 单样本 t 检验 | 正态或大样本 |
| 两独立样本均值比较 | 独立样本 t 检验 | 两总体独立、正态或大样本 |
| 配对样本比较(改善前后) | 配对 t 检验 | 同一对象前后测量 |
| 两个总体方差比较 | F 检验 | 正态 |
| 多个总体均值比较 | 方差分析(ANOVA) | 正态、方差齐 |
| 比例检验(合格率等) | z 检验 / 卡方检验 | 大样本 |
| 分布拟合检验 | 卡方拟合优度检验 | |
| 非正态数据 | 非参数检验(Mann-Whitney、Wilcoxon 等) | 不满足正态性 |
4.5 IE 核心场景:改善前后是否真的有效
这是 IE 每天都要回答的问题。
情形一:配对 t 检验(同一批人/同一条线改善前后)
场景:对某装配线做了工装改善,记录了 10 名工人的操作时间(改善前 vs 改善后)。
| 工人 | 改善前(秒) | 改善后(秒) | 差值 d |
|---|---|---|---|
| 1 | 52 | 46 | -6 |
| 2 | 48 | 45 | -3 |
| 3 | 55 | 50 | -5 |
| 4 | 50 | 47 | -3 |
| 5 | 47 | 43 | -4 |
| 6 | 53 | 49 | -4 |
| 7 | 49 | 44 | -5 |
| 8 | 51 | 48 | -3 |
| 9 | 46 | 42 | -4 |
| 10 | 50 | 46 | -4 |
H₀:μ_d = 0(改善无效)
H₁:μ_d < 0(改善后时间更短,有效)
计算差值:
d̄ = (-6-3-5-3-4-4-5-3-4-4)/10 = -4.1
s_d = 0.994
n = 10
检验统计量:
t = d̄ / (s_d/√n) = -4.1 / (0.994/√10) = -4.1 / 0.314 = -13.05
自由度 = 9,单尾检验
查 t 分布表:t_{0.05, 9} = 1.833(单尾)
|t| = 13.05 > 1.833 → 拒绝 H₀
结论:p < 0.001,改善后工时显著下降,改善措施有效。
为什么用配对检验:因为每个工人的基础速度不同(有的人本来就快),配对检验消除了个体间的差异,只关注「改善带来的变化」,检验的灵敏度更高。
情形二:独立样本 t 检验(两批不同对象)
场景:比较 A、B 两条产线(不同工人)的单位产品工时。
A 线:n₁=15, x̄₁=52 秒, s₁=5.2
B 线:n₂=15, x̄₂=48 秒, s₂=4.8
H₀:μ_A = μ_B
H₁:μ_A ≠ μ_B(双尾)
(假设方差齐性,用合并方差)
(n₁-1)s₁² + (n₂-1)s₂²
s_p² = ────────────────────
n₁ + n₂ - 2
= (14×27.04 + 14×23.04) / 28
= (378.56 + 322.56) / 28 = 25.04
s_p = 5.004
x̄₁ - x̄₂ 52 - 48
t = ───────────────── = ───────────────── = 2.19
s_p√(1/n₁ + 1/n₂) 5.004 × √(2/15)
自由度 = 28,双尾
t_{0.025, 28} = 2.048
|t| = 2.19 > 2.048 → 拒绝 H₀
结论:p < 0.05,两条产线的工时存在显著差异,B 线更快。
4.6 假设检验的五大常见误用
| # | 误用 | 正确做法 |
|---|---|---|
| 1 | 把「不拒绝 H₀」说成「H₀ 成立」 | 只能说「没有足够证据表明有差异」,不能说「证明无差异」 |
| 2 | p 值理解错误 | p 值不是「H₀ 为真的概率」,而是「H₀ 为真时观察到当前结果(或更极端)的概率」 |
| 3 | 统计显著 ≠ 实际显著 | 样本量很大时,微小差异也能显著。要看效应量(Effect Size) |
| 4 | 多重比较不做校正 | 比较次数越多,偶然显著的概率越大。需要用 Bonferroni 校正等方法 |
| 5 | 数据不满足前提仍强行用参数检验 | 先做正态性检验(Shapiro-Wilk)和方差齐性检验(Levene),不满足就用非参数方法 |
关于第 3 点,特别重要:
某改善使工时从 50.0 秒降到 49.8 秒
样本量 n = 10000,标准差 s = 5
t = 0.2 / (5/√10000) = 0.2/0.05 = 4.0 → p < 0.001,统计显著
但:0.2 秒的改善,在实际生产中有意义吗?
→ 每小时生产 72 件,节省 14.4 秒/小时 = 0.4%
→ 实际意义极小
结论:统计显著 ≠ 实际重要。必须结合效应量和业务意义判断。
五、第四类问题:多个方案哪个好(方差分析)
5.1 为什么不能直接用多次 t 检验
问题:比较 3 个工艺方案的效率,用 t 检验两两比较,需要 C(3,2) = 3 次。
每次检验的第一类错误率 α = 0.05,至少犯一次错误的概率是:
1 - (1 - 0.05)³ = 1 - 0.857 = 0.143
比较次数越多,错误率越高:
| 组数 | 两两比较次数 | 至少一次犯第一类错误的概率 |
|---|---|---|
| 3 | 3 | 14.3% |
| 4 | 6 | 26.5% |
| 5 | 10 | 40.1% |
| 6 | 15 | 53.7% |
ANOVA 的作用:一次检验判断「所有组的均值是否全相等」,把第一类错误率控制在 α。
5.2 单因素方差分析的原理
核心思想:把总变异分解为「组间变异」和「组内变异」。
总变差 SST = 组间变差 SSB + 组内变差 SSW
SST = ΣΣ(x_ij - x̄)² 全部数据与总均值的差异
SSB = Σ n_j(x̄_j - x̄)² 各组均值与总均值的差异(反映处理效应)
SSW = ΣΣ(x_ij - x̄_j)² 组内数据与组均值的差异(反映随机误差)
F 检验:
F = MSB / MSW = (SSB/(k-1)) / (SSW/(N-k))
其中 k 是组数,N 是总样本量
判别:F > F_{α, k-1, N-k} → 拒绝 H₀,认为至少有两组均值不等
5.3 方差分析表(标准格式)
| 变异来源 | 平方和 SS | 自由度 df | 均方 MS | F 值 | p 值 |
|---|---|---|---|---|---|
| 组间(因素) | SSB | k-1 | MSB = SSB/(k-1) | F = MSB/MSW | |
| 组内(误差) | SSW | N-k | MSW = SSW/(N-k) | ||
| 总和 | SST | N-1 |
5.4 IE 算例:三种工艺方案比较
场景:比较三种装配工艺的单位工时,每种工艺测 5 次
工艺 A: 45, 48, 46, 47, 49 → x̄_A = 47.0
工艺 B: 42, 44, 43, 45, 41 → x̄_B = 43.0
工艺 C: 50, 52, 49, 51, 48 → x̄_C = 50.0
总均值 x̄ = (47+43+50)/3 = 46.67
SSB = 5×[(47-46.67)² + (43-46.67)² + (50-46.67)²]
= 5×[0.11 + 13.47 + 11.11] = 5 × 24.69 = 123.45
SSW = Σ 各组内部变差
A: (45-47)²+(48-47)²+(46-47)²+(47-47)²+(49-47)² = 4+1+1+0+4 = 10
B: (42-43)²+(44-43)²+(43-43)²+(45-43)²+(41-43)² = 1+1+0+4+4 = 10
C: (50-50)²+(52-50)²+(49-50)²+(51-50)²+(48-50)² = 0+4+1+1+4 = 10
SSW = 30
方差分析表:
来源 SS df MS F
组间 123.45 2 61.73 24.69
组内 30.00 12 2.50
总计 153.45 14
F_{0.05, 2, 12} = 3.89
F = 24.69 > 3.89 → 拒绝 H₀
结论:三种工艺的工时存在显著差异(p < 0.001)。
ANOVA 只告诉你「有差异」,不告诉你「谁和谁有差异」。
要进一步确定,需要做多重比较:
| 方法 | 特点 |
|---|---|
| LSD(最小显著差异法) | 最灵敏,但第一类错误率高 |
| Tukey HSD | 最常用,控制整体错误率 |
| Bonferroni 校正 | 保守,比较次数多时过于严格 |
| Dunnett | 用于「多个实验组 vs 一个对照组」的比较 |
5.5 两因素方差分析
当需要同时考察两个因素(如「工艺」和「班次」)时使用。
三种效应:
| 效应 | 含义 |
|---|---|
| 主效应 A | 因素 A 各水平间的差异 |
| 主效应 B | 因素 B 各水平间的差异 |
| 交互效应 A×B | 因素 A 的效应是否依赖于因素 B 的水平 |
交互效应是两因素 ANOVA 的核心价值:
举例:
工艺 A 在白班的效率是 47 秒,夜班是 55 秒
工艺 B 在白班的效率是 43 秒,夜班是 44 秒
→ 工艺 B 普遍更快(主效应显著)
→ 但工艺 A 在夜班效率下降明显,工艺 B 几乎不受影响(存在交互效应)
结论:如果产线有夜班,选择工艺 B 的价值更大
六、第五类问题:变量间什么关系(回归分析)
6.1 相关 vs 回归
| 概念 | 回答的问题 | 指标 |
|---|---|---|
| 相关分析 | 两个变量有多强的线性关联? | 相关系数 r(-1 到 1) |
| 回归分析 | 一个变量如何随另一个变化?能否预测? | 回归方程 ŷ = a + bx |
关键提醒:
- 相关系数 r 只衡量线性关联的强度
- r = 0 不意味着无关(可能存在非线性关系)
- ⚠️ 相关性不等于因果性——这是统计学中最重要的一条警示
6.2 一元线性回归
模型:
y = β₀ + β₁x + ε
ŷ = b₀ + b₁x (拟合的回归方程)
其中(最小二乘法):
Σ(x_i - x̄)(y_i - ȳ)
b₁ = ───────────────────
Σ(x_i - x̄)²
b₀ = ȳ - b₁x̄
模型评价:
| 指标 | 公式 | 含义 |
|---|---|---|
| 判定系数 R² | R² = SSR/SST | 模型解释了变异的多大比例(0-1,越大越好) |
| 估计标准误差 S | S = √(SSE/(n-2)) | 预测的平均误差 |
| F 检验 | 整体模型是否显著 | |
| t 检验 | 单个系数是否显著 |
变差分解:SST = SSR + SSE
SST(总变差)= Σ(y - ȳ)² 数据的总变异
SSR(回归变差)= Σ(ŷ - ȳ)² 模型解释的变异
SSE(残差变差)= Σ(y - ŷ)² 模型未解释的变异
R² = SSR / SST
6.3 IE 算例:工时与经验的关系
场景:研究工人经验(月)与单位产品工时(秒)的关系
数据(经验 x,工时 y):
(3, 52) (6, 48) (9, 45) (12, 43) (15, 40) (18, 38) (21, 36) (24, 35)
计算:
x̄ = 13.5, ȳ = 42.125
Σ(x-x̄)(y-ȳ) = -535.5
Σ(x-x̄)² = 378
b₁ = -535.5 / 378 = -1.417
b₀ = 42.125 - (-1.417)(13.5) = 42.125 + 19.13 = 61.25
回归方程:ŷ = 61.25 - 1.417x
解读:工人经验每增加 1 个月,单位产品工时平均减少 1.42 秒。
R² 计算(略):假设 R² = 0.96
→ 经验可以解释工时变异的 96%,模型拟合很好
预测的两种区间(重要区别):
| 区间类型 | 含义 | 宽度 |
|---|---|---|
| 置信区间(CI) | 对均值响应的区间 | 较窄 |
| 预测区间(PI) | 对单个新观测的区间 | 较宽 |
实务提醒:如果你要预测「某个新工人的工时」,用预测区间;如果你要估计「所有同类工人的平均工时」,用置信区间。
6.4 多元线性回归
模型:y = β₀ + β₁x₁ + β₂x₂ + ... + β_k x_k + ε
IE 典型应用:建立工时预估模型
ŷ = b₀ + b₁·(零件数量) + b₂·(装配复杂度) + b₃·(工位布局得分) + ...
多元回归的关键问题:
| 问题 | 表现 | 诊断 | 处理 |
|---|---|---|---|
| 多重共线性 | 自变量间高度相关 | VIF > 10 或 VIF > 5 | 删除变量、主成分回归、岭回归 |
| 异方差性 | 残差方差不齐 | 残差图呈喇叭形 | 变量变换、加权最小二乘 |
| 自相关 | 残差间相关(时序数据常见) | DW 检验 | 时序模型 |
| 异常值/强影响点 | 个别点严重拉动模型 | Cook 距离 | 检查数据、稳健回归 |
调整后 R²(Adjusted R²):
普通 R² 会随着自变量增加而单调增大(即使加入无用变量)
调整后 R² 会对变量个数进行惩罚
建模时应看调整后 R²,而不是 R²
6.5 回归分析的常见陷阱
| 陷阱 | 说明 | 防范 |
|---|---|---|
| 外推 | 在自变量取值范围之外做预测 | 不要超出数据范围预测 |
| 把相关当因果 | 冰淇淋销量与溺水人数正相关,但都是「气温」导致 | 需要实验设计或因果推断方法 |
| 遗漏变量 | 关键变量没纳入模型 | 结合领域知识 |
| 过度拟合 | 变量太多,模型在训练数据上很好但预测很差 | 交叉验证 |
| 忽略残差诊断 | 只看 R² 不检查残差 | 必须做残差分析 |
七、第六类问题:怎么找最优参数(试验设计 DOE)
7.1 为什么需要 DOE
问题:要优化一个注塑工艺,有 3 个参数(温度、压力、时间),每个参数 3 个水平。
方法对比:
| 方法 | 试验次数 | 问题 |
|---|---|---|
| 一次一因素(OFAT) | 3 × 3 = 9 次(还不能考察交互作用) | 效率低,且无法发现交互作用 |
| 全因子试验 | 3³ = 27 次 | 全面,但次数多 |
| 正交试验 | 9 次(L9 正交表) | 高效,能考察主效应 |
| 响应面法(RSM) | 15-20 次 | 能拟合二次曲面,找最优区域 |
DOE 的核心价值:
- 用最少的试验次数获得最多的信息
- 能考察交互作用(OFAT 做不到)
- 能给出统计上可靠的结论
7.2 DOE 的基本概念
| 概念 | 说明 |
|---|---|
| 因子(Factor) | 要研究的自变量(如温度) |
| 水平(Level) | 因子的取值(如 180℃、200℃) |
| 响应(Response) | 要优化的因变量(如强度、良率) |
| 处理(Treatment) | 各因子水平的一种组合 |
| 主效应 | 单个因子对响应的影响 |
| 交互效应 | 一个因子的效应是否依赖于另一个因子的水平 |
| 随机化 | 随机安排试验顺序,消除未知干扰 |
| 重复(Replication) | 同一处理重复多次,估计试验误差 |
| 区组(Blocking) | 把试验分成若干组,消除已知干扰(如不同班次、不同批次原料) |
DOE 三原则(Fisher):随机化、重复、区组化
7.3 全因子设计(2^k)
最常用的筛选设计:每个因子取 2 个水平(低 -1,高 +1)。
2 因子 2 水平:2² = 4 次试验
3 因子 2 水平:2³ = 8 次试验
4 因子 2 水平:2⁴ = 16 次试验
2² 设计示例:
| 试验 | 温度 A | 压力 B | 响应(强度) |
|---|---|---|---|
| 1 | -1(180℃) | -1(50MPa) | 42 |
| 2 | +1(220℃) | -1(50MPa) | 51 |
| 3 | -1(180℃) | +1(70MPa) | 48 |
| 4 | +1(220℃) | +1(70MPa) | 62 |
效应计算:
A 的主效应 = [(51-42) + (62-48)] / 2 = (9 + 14)/2 = 11.5
B 的主效应 = [(48-42) + (62-51)] / 2 = (6 + 11)/2 = 8.5
AB 交互效应 = [(62-51) - (48-42)] / 2 = (11 - 6)/2 = 2.5
解读:
- 温度的主效应最大(11.5),是影响强度的关键因素
- 压力也有明显影响(8.5)
- 交互效应较小(2.5),说明两因子的作用相对独立
7.4 正交试验设计(最实用的方法)
正交表记号:Lₙ(m^k)
n:试验次数
m:水平数
k:最多可安排的因子数
常用正交表:
| 正交表 | 适用 |
|---|---|
| L4(2³) | 3 个 2 水平因子,4 次试验 |
| L8(2⁷) | 最多 7 个 2 水平因子,8 次试验 |
| L9(3⁴) | 最多 4 个 3 水平因子,9 次试验 |
| L16(4⁵) | 最多 5 个 4 水平因子,16 次试验 |
| L18(2×3⁷) | 混合水平 |
L9(3⁴) 正交表:
| 试验号 | 列1 | 列2 | 列3 | 列4 |
|---|---|---|---|---|
| 1 | 1 | 1 | 1 | 1 |
| 2 | 1 | 2 | 2 | 2 |
| 3 | 1 | 3 | 3 | 3 |
| 4 | 2 | 1 | 2 | 3 |
| 5 | 2 | 2 | 3 | 1 |
| 6 | 2 | 3 | 1 | 2 |
| 7 | 3 | 1 | 3 | 2 |
| 8 | 3 | 2 | 1 | 3 |
| 9 | 3 | 3 | 2 | 1 |
正交表的性质(为什么它有效):
- 均衡分散性:每一列中,各水平出现的次数相同
- 整齐可比性:任意两列中,各水平组合出现的次数相同
7.5 正交试验的分析步骤
步骤 1:确定因子和水平
步骤 2:选择合适的正交表,安排试验方案
步骤 3:按方案做试验,记录响应值
步骤 4:数据分析
· 直观分析法(极差分析):计算各因子各水平的平均响应,画图
· 方差分析:判断哪些因子显著
步骤 5:确定最优组合
步骤 6:验证试验(在最优条件下做几次确认性试验)
极差分析法(最直观):
计算每个因子在每个水平下的响应平均值:
K_ij = 第 j 列第 i 水平对应的响应之和
k_ij = K_ij / (该水平出现次数)
极差 R_j = max(k_ij) - min(k_ij)
极差越大 → 该因子对响应的影响越大 → 越重要
示例:
某试验 4 因子 3 水平,响应为良率(越大越好)
因子 A(温度):k_A1 = 82%, k_A2 = 91%, k_A3 = 86% → R_A = 9%
因子 B(压力):k_B1 = 85%, k_B2 = 87%, k_B3 = 87% → R_B = 2%
因子 C(时间):k_C1 = 80%, k_C2 = 86%, k_C3 = 93% → R_C = 13%
因子 D(湿度):k_D1 = 86%, k_D2 = 86%, k_D3 = 87% → R_D = 1%
因子重要性排序:C(13%)> A(9%)> B(2%)> D(1%)
最优组合:A2 + B2(或B3) + C3 + D3
7.6 响应面法(RSM)
用途:当要找精确的最优参数点(而不只是筛选出重要因子)时使用。
核心设计:
| 设计 | 试验次数(k 因子) | 特点 |
|---|---|---|
| CCD(中心复合设计) | 2^k + 2k + n_c | 最常用,能拟合二次模型 |
| Box-Behnken | 较少 | 不包含角点,适合极端条件不可行的情况 |
二次响应面模型:
y = β₀ + Σβ_i x_i + Σβ_ii x_i² + ΣΣβ_ij x_i x_j + ε
能拟合曲面,找到极值点(驻点)
RSM 的优化流程:
1. 筛选试验(部分因子设计)→ 找出关键因子
2. 最速上升法 → 快速接近最优区域
3. 响应面设计(CCD)→ 在最优区域拟合二次模型
4. 求解最优参数组合
5. 验证试验
八、统计过程控制(SPC)
SPC 是统计学在质量管理中最成熟的应用,此处只讲与统计方法直接相关的部分。
8.1 两类变异(核心概念)
| 变异类型 | 原因 | 特点 | 处理 |
|---|---|---|---|
| 普通原因(Common Cause) | 系统固有的随机因素 | 始终存在,难以消除 | 只有改进系统才能减小 |
| 特殊原因(Special Cause) | 异常事件(设备故障、原料批次问题) | 偶发、可查明 | 由现场人员查明并消除 |
⚠️ 最重要的原则:
把普通原因当特殊原因处理(过度调整),会增加变异; 把特殊原因当普通原因处理(漏判),会失去改进机会。
这个错误(过度调整)在工业现场极其常见,统计学上称为「tampering」。
8.2 控制图的原理
控制界限 = μ ± 3σ (3σ 原则)
根据中心极限定理,样本均值近似服从正态分布
落在 ±3σ 之外的概率仅约 0.27%
常用控制图:
| 类型 | 控制图 | 用途 |
|---|---|---|
| 计量型 | X̄-R 图(均值-极差图) | 最常用,监控连续变量 |
| X̄-S 图(均值-标准差图) | 样本量大时(n ≥ 10) | |
| X-MR 图(单值-移动极差图) | 每次只能测一个值 | |
| 计数型 | p 图 | 不合格品率 |
| np 图 | 不合格品数(样本量固定) | |
| c 图 | 缺陷数(样本量固定) | |
| u 图 | 单位缺陷数 |
X̄-R 图的控制限:
X̄ 图:
UCL = x̄̄ + A₂·R̄
CL = x̄̄
LCL = x̄̄ - A₂·R̄
R 图:
UCL = D₄·R̄
CL = R̄
LCL = D₃·R̄
其中 x̄̄ 是各子组均值的平均,R̄ 是各子组极差的平均
A₂、D₃、D₄ 是系数(查表,取决于子组大小 n)
常用系数表:
| n | A₂ | D₃ | D₄ |
|---|---|---|---|
| 2 | 1.880 | 0 | 3.267 |
| 3 | 1.023 | 0 | 2.574 |
| 4 | 0.729 | 0 | 2.282 |
| 5 | 0.577 | 0 | 2.114 |
8.3 判异准则(八大准则)
最基本的两条:
| 准则 | 描述 |
|---|---|
| 准则 1 | 1 点超出控制限(±3σ 外) |
| 准则 2 | 连续 9 点位于中心线同一侧 |
其他常用准则(Western Electric 规则的一部分):
| 准则 | 描述 | 检出的问题 |
|---|---|---|
| 准则 3 | 连续 6 点递增或递减 | 趋势(如刀具磨损) |
| 准则 4 | 连续 14 点交替上下 | 系统性波动(如两班交替) |
| 准则 5 | 连续 3 点中有 2 点在 2σ 之外(同侧) | 过程偏移 |
| 准则 6 | 连续 5 点中有 4 点在 1σ 之外(同侧) | 过程偏移 |
| 准则 7 | 连续 15 点在 1σ 之内(中心线两侧) | 数据分层不当 |
| 准则 8 | 连续 8 点在 1σ 之外(中心线两侧) | 混合分布 |
⚠️ 实务提醒:不要过度使用判异准则。准则越多,误报率越高。多数现场只使用前 2-4 条。
九、工具选择:Minitab vs Python
9.1 Minitab(IE 行业标准)
优势:
- 菜单操作,无需编程
- 内置 DOE、SPC、测量系统分析(MSA)等专业模块
- 输出报告规范,可直接用于汇报
- 六西格玛项目的标准工具
适合:
- DOE 试验设计
- SPC 控制图
- 测量系统分析(MSA)
- 能力分析
9.2 Python(数据科学主流)
核心库:
| 库 | 用途 |
|---|---|
| NumPy | 数值计算 |
| Pandas | 数据处理、表格操作 |
| Matplotlib / Seaborn | 可视化 |
| SciPy.stats | 统计检验、分布 |
| Statsmodels | 回归、时间序列、ANOVA |
| Scikit-learn | 机器学习 |
| PyDOE | 试验设计 |
常用代码示例:
import pandas as pd
import numpy as np
from scipy import stats
import statsmodels.api as sm
import statsmodels.formula.api as smf
# 读取数据
df = pd.read_csv('production_data.csv')
# 描述统计
print(df['cycle_time'].describe())
print(df.groupby('shift')['cycle_time'].agg(['mean', 'std', 'count']))
# 正态性检验(Shapiro-Wilk)
stat, p = stats.shapiro(df['cycle_time'])
print(f'Shapiro-Wilk: W={stat:.4f}, p={p:.4f}')
# 方差齐性检验(Levene)
stat, p = stats.levene(group_a, group_b, group_c)
# 独立样本 t 检验
t, p = stats.ttest_ind(before, after)
print(f't={t:.4f}, p={p:.4f}')
# 配对 t 检验
t, p = stats.ttest_rel(before, after)
# 单因素方差分析
f, p = stats.f_oneway(group_a, group_b, group_c)
# 双因素方差分析(带交互作用)
model = smf.ols('time ~ C(method) * C(shift)', data=df).fit()
print(sm.stats.anova_lm(model, typ=2))
# 线性回归
model = smf.ols('cycle_time ~ experience + complexity', data=df).fit()
print(model.summary()) # 输出 R²、系数、p 值等
# 相关分析
r, p = stats.pearsonr(df['x'], df['y'])
rho, p = stats.spearmanr(df['x'], df['y']) # 秩相关(非正态时用)
# 置信区间
mean = df['cycle_time'].mean()
sem = stats.sem(df['cycle_time'])
ci = stats.t.interval(0.95, len(df)-1, loc=mean, scale=sem)
9.3 选择建议
| 场景 | 推荐工具 |
|---|---|
| 快速探索性分析 | Python / Excel |
| 标准 DOE 设计 | Minitab |
| SPC 控制图 | Minitab |
| 测量系统分析 MSA | Minitab |
| 大批量数据处理 | Python |
| 需要自动化、可复现 | Python |
| 需要生成规范报告给管理层 | Minitab |
| 机器学习建模 | Python |
建议:两个都学。Minitab 应对标准场景(快),Python 应对复杂场景(强)。
十、学习方法:从「会算」到「会用」
10.1 三阶段学习路径
阶段一:理解概念(不用背公式)
重点理解:
- p 值到底是什么意思
- 两类错误的实际后果
- 置信区间的正确解读
- 相关与因果的区别
方法:用「法庭审判」「医学检测」等类比帮助理解。
阶段二:掌握流程(建立决策树)
拿到数据 →
目的是描述?→ 描述统计 + 图表
目的是估计?→ 置信区间
目的是比较?→
两组?→ t 检验(独立 or 配对)
多组?→ ANOVA + 多重比较
目的是找关系?→ 相关 + 回归
目的是找最优?→ DOE
目的是监控?→ SPC
阶段三:反复实战(最重要)
找真实数据做分析。推荐数据源:
- 学校的课程设计数据
- 实习单位的生产数据(脱敏后)
- Kaggle 上的制造业数据集
- 自己设计的小实验(如测量自己的某项活动耗时)
10.2 五个必做的练习
| # | 练习 | 训练的技能 |
|---|---|---|
| 1 | 测量自己做某件事 30 次(如系鞋带),做描述统计和直方图 | 数据收集、描述统计 |
| 2 | 改善前后的对比实验(如改变整理方式后测量耗时) | 配对 t 检验 |
| 3 | 比较三种方法的效果(如三种记忆方法) | ANOVA |
| 4 | 两个变量的回归分析(如学习时间与成绩) | 回归分析 |
| 5 | 设计一个 3 因子 2 水平的正交试验 | DOE |
做完这五个练习,你的统计学就从「知识」变成了「能力」。
十一、结语:统计学的本质是「在不确定性中做决策」
IE 的工作环境充满了不确定性:
- 工人的操作时间每次都不同
- 设备的故障是随机的
- 原料的质量有波动
- 需求是波动的
统计学给你一套工具,让你在这种不确定性中做出可靠的判断:
- 用置信区间量化估计的不确定性
- 用假设检验判断观察到的差异是否真实
- 用回归分析理解变量间的关系
- 用DOE高效地找到最优方案
- 用SPC区分正常波动和异常信号
但请始终记住三条警示:
第一,统计方法都有前提假设。 正态性、独立性、方差齐性——这些假设不满足时,结论可能完全错误。 用方法之前先做诊断。
第二,统计显著不等于实际重要。 大样本下,微小差异也能显著;小样本下,重要差异也可能不显著。永远要结合业务意义判断。
第三,相关不等于因果。 这是统计学中最容易被滥用的一点。要证明因果,需要严格的实验设计(DOE),而不是从观测数据中找相关。
最后一句:统计学是 IE 最有说服力的语言。 当你的改善方案遭到质疑时,一句「我们做了配对 t 检验,p = 0.003,改善效果在统计上显著」,比任何主观描述都有力量。
附:方法选择速查表
| 你的问题 | 数据类型 | 推荐方法 |
|---|---|---|
| 这批数据的特征? | 连续 | 均值+标准差+直方图 |
| 分类 | 频数+帕累托图 | |
| 真实的平均值是多少? | 连续 | 置信区间(t 分布) |
| 需要测多少次? | — | n = (z·σ/E)² |
| 改善前后有差别吗? | 同一对象前后 | 配对 t 检验 |
| 两组不同对象 | 独立样本 t 检验 | |
| 三个及以上方案比较? | 一个因素 | 单因素 ANOVA + Tukey |
| 两个因素 | 两因素 ANOVA(看交互效应) | |
| 两个变量有什么关系? | 线性 | Pearson 相关 + 线性回归 |
| 非线性/非正态 | Spearman 秩相关 | |
| 一个结果受多个因素影响? | — | 多元线性回归(注意共线性) |
| 怎么找到最优参数? | 筛选阶段 | 部分因子设计 / 正交试验 |
| 优化阶段 | 响应面法(CCD) | |
| 过程是否稳定? | 连续 | X̄-R 控制图 |
| 不合格率 | p 图 | |
| 数据不满足正态分布? | — | 非参数检验(Mann-Whitney、Kruskal-Wallis) |
相关阅读
- 质量管理完全学习指南:从 QC 七大手法到六西格玛:质量问题的本质是变异,质量管理的所有方法都在描述变异、区分变异、减小变异。本文按四层展开:质…
- Minitab 工业工程实战指南:从数据到结论的完整链路:工业工程领域出镜率最高的统计软件。本文按拿到数据后的真实使用顺序组织:数据导入清洗、图形化汇…
- 工业工程必备软件地图:从 Excel 到 FlexSim,每个阶段该学什么:按学习阶段给出 IE 的软件全景图:Excel、统计分析、仿真建模、CAD、企业系统,并给出…
- 工业工程专业值得参加的学科竞赛清单与备赛建议:按推荐度分级梳理工业工程与精益管理创新大赛、机械创新设计、工程训练、数学建模、物流设计等竞赛…
- 工业工程毕设选题与写作指南:真题真做,做出能写进简历的作品:给出校园场景、企业实习、方法研究、调研综述四类选题清单与三条判断原则,提供改善类毕设的七章结…