写在前面:一个省力的测量方法
假设你要测一条产线上 5 台设备一周的利用率。
方法一:连续观测。 派人盯着看,记录每台设备的开机/停机时间。5 台设备 × 5 天 × 8 小时 = 200 人小时。要花一个人整整一个月。
方法二:工作抽样。 每天随机去看 40 次,每次花 2 分钟走一圈看 5 台设备的状态。5 天 × 40 次 × 2 分钟 = 约 6.7 人小时。一天就做完了。
更妙的是,两种方法得到的结果在统计意义上是等价的——前提是你做得对。
这就是工作抽样(Work Sampling),也叫瞬时观测法、比率延迟研究(Ratio Delay Study)。
它的核心思想是:不需要连续观测整个过程,只需要对过程进行大量的随机瞬时观测,用"某状态出现的频率"来估计"该状态所占的时间比例"。
数学基础很简单:如果我们在随机时刻对系统做 N 次观测,其中 m 次观测到"设备在运行",那么:
设备利用率的估计值 p̂ = m / N
为什么这成立? 因为如果观测时刻是真正随机的,那么"观测到某个状态"的概率,就等于"该状态在时间上所占的比例"。这是大数定律的直接应用。
一、什么时候用工作抽样,什么时候用秒表测时
这是最容易搞混的问题。先给结论:
| 维度 | 工作抽样 | 秒表测时 |
|---|---|---|
| 测什么 | 状态的时间占比(利用率、空闲率、宽放率) | 单个作业的标准时间 |
| 输出 | 比例(%) | 时间值(秒/分钟) |
| 精度 | 相对精度(±3%、±5%) | 绝对精度(可到 0.1 秒) |
| 观测方式 | 随机瞬时观测 | 连续计时 |
| 观测者负担 | 低(可以一人测多个对象) | 高(一人盯一个工位) |
| 对作业的干扰 | 小 | 大(霍桑效应明显) |
| 成本 | 低 | 高 |
| 周期 | 长(数天到数周) | 短(数小时到数天) |
决策规则
用工作抽样的场景:
- 测量设备利用率、OEE 中的可用率;
- 测量宽放率(宽放时间占总作业时间的比例);
- 测量人员的工作/空闲比例;
- 多对象、长时间的观测(一人可测多个对象);
- 初步诊断(快速找出大致的问题分布);
- 被观测者不希望被长时间盯着(减少干扰)。
用秒表测时的场景:
- 要制定标准工时(需要具体的作业时间值);
- 作业周期短、重复度高;
- 需要拆解作业要素的时间;
- 精度要求高。
一个经典的组合用法:
用工作抽样测出宽放率(如 12%)
+
用秒表测时测出正常时间(如 8.5 分钟)
↓
标准工时 = 正常时间 × (1 + 宽放率) = 8.5 × 1.12 = 9.52 分钟
这是标准工时制定的标准做法。两者不是替代关系,是搭档。
二、样本量怎么算
这是工作抽样最关键的技术环节。样本量太小,结果不可信;样本量太大,浪费时间。
2.1 基本公式
工作抽样本质上是对一个**比例(p)**的估计,因此用比例的样本量公式:
n = (Z² × p × (1−p)) / E²
其中:
n = 需要的观测次数
Z = 置信水平对应的 Z 值(95% 置信度时 Z = 1.96)
p = 预估的比例(如预估利用率 70%,则 p = 0.7)
E = 允许的绝对误差(如 ±3%,则 E = 0.03)
举例:预估设备利用率 70%,要求 95% 置信度下误差不超过 ±3%:
n = (1.96² × 0.7 × 0.3) / 0.03²
= (3.8416 × 0.21) / 0.0009
= 0.8067 / 0.0009
≈ 897 次
约 900 次观测。 如果每次观测能同时记录 5 台设备(走一圈),那就是 180 次巡回路程。
2.2 相对精度 vs 绝对精度
工业实务中更常用**相对精度(S)**来表达要求:
相对精度 S = E / p
即:E = S × p
代入公式:
n = (Z² × p × (1−p)) / (S×p)²
= Z² × (1−p) / (S² × p)
这个形式更方便,因为工程师通常说"我要 ±5% 的相对精度",而不是"我要 ±3 个百分点的绝对精度"。
举例:预估 p = 0.7,要求相对精度 ±5%,95% 置信度:
n = 1.96² × (1−0.7) / (0.05² × 0.7)
= 3.8416 × 0.3 / (0.0025 × 0.7)
= 1.1525 / 0.00175
≈ 659 次
2.3 速查表(95% 置信度)
为避免每次手算,给一张常用速查表(95% 置信度,Z = 1.96):
| 预估比例 p | 相对精度 ±10% | 相对精度 ±5% | 相对精度 ±3% | 相对精度 ±1% |
|---|---|---|---|---|
| 0.05(5%) | 约 7300 次 | 约 29200 次 | 约 81100 次 | 约 730000 次 |
| 0.10(10%) | 约 3457 次 | 约 13830 次 | 约 38416 次 | 约 345700 次 |
| 0.20(20%) | 约 1537 次 | 约 6147 次 | 约 17074 次 | 约 153700 次 |
| 0.30(30%) | 约 897 次 | 约 3589 次 | 约 9970 次 | 约 89700 次 |
| 0.50(50%) | 约 384 次 | 约 1537 次 | 约 4268 次 | 约 38416 次 |
| 0.70(70%) | 约 165 次 | 约 659 次 | 约 1830 次 | 约 16480 次 |
| 0.80(80%) | 约 96 次 | 约 384 次 | 约 1067 次 | 约 9604 次 |
| 0.90(90%) | 约 43 次 | 约 171 次 | 约 474 次 | 约 4268 次 |
(注:本表基于上述公式计算,数值已四舍五入。实际使用时可按公式精确计算。)
读这张表的三个关键洞察:
洞察一:比例越小,需要的样本量越大(在相同相对精度下)。
测一个 5% 发生率的事件(如设备故障),要达到 ±10% 的相对精度,需要约 7300 次观测。而测一个 70% 的利用率,只要 165 次。
这意味着:用工作抽样测"小概率事件"是不划算的。 如果要测的是 1% 的事件,工作抽样可能需要几十万次观测——这时候应该用连续记录或事件驱动的日志(如设备的停机记录),而不是抽样。
洞察二:精度要求提高一倍,样本量变成四倍。
因为 n 与 S² 成反比。从 ±10% 提高到 ±5%,样本量 × 4。
所以精度要求要务实。 工作抽样的典型精度目标是 ±5%(相对),这对大多数管理决策已经足够。追求 ±1% 是不必要的,除非你有特殊的理由。
洞察三:预估比例 p 不准怎么办?
样本量计算需要预估 p。有两种处理方式:
- 保守做法:取 p = 0.5(因为 p(1−p) 在 p = 0.5 时最大),这样算出的样本量一定足够。代价是样本量偏大。
- 两段法:先做一个小的预抽样(如 100 次),用得到的结果重新计算样本量,再补足。
实务中推荐两段法,尤其是当你对 p 完全没有概念时。
三、观测设计:怎么做才算"随机"
样本量算对了,但如果观测时刻不随机,结论仍然可能是错的。
3.1 为什么要随机
最典型的错误:每天固定时间去观测。
比如每天上午 9:00、10:00、11:00 各看一次。问题在于:如果设备每天 8:30—9:30 做保养,那你永远观测不到保养时段,利用率会被系统性高估。
随机化的目的,是让每个时刻都有同等的机会被观测到,从而保证样本对总体有代表性。
3.2 三种随机化方法
方法一:简单随机抽样
用随机数表或随机数生成器,在观测期内随机生成观测时刻。
做法:
- 把观测期(如 5 天 × 8 小时 = 2400 分钟)编号 1—2400;
- 用随机数生成器抽出 n 个不重复的随机数;
- 把随机数转换为具体的时间点(第 1 分钟 = 第 1 天 8:00,第 481 分钟 = 第 2 天 8:00,等等)。
优点:理论最严谨。 缺点:观测时刻可能过于分散(比如连续两次相隔 3 分钟,下一次在 2 小时后),实操上很累。
方法二:分层随机抽样(推荐)
把观测期分成若干"层"(如每个小时一层),在每层内随机抽取固定数量的观测时刻。
做法:
- 观测期 5 天 × 8 小时 = 40 个小时;
- 每小时随机抽 2 个时刻(共 80 个时刻);
- 每个时刻用随机数确定具体分钟(如 8:00—9:00 之间随机选 2 分钟)。
优点:
- 保证每个时段都被覆盖(避免系统性偏差);
- 观测时刻分布相对均匀,实操方便;
- 统计效率通常高于简单随机抽样(因为减少了层间变异)。
这是实务中最常用的方法。
方法三:系统抽样 + 随机起点
每隔固定间隔观测一次,但起点随机。
做法:
- 观测期 2400 分钟,需要 80 次观测 → 间隔 30 分钟;
- 第一个时刻在 0—30 分钟之间随机选(如第 17 分钟);
- 后续时刻为 47、77、107……分钟。
优点:最简单易行。 风险:如果被观测的过程存在周期性,且与抽样间隔一致,会产生严重偏差。
比如:如果设备每 30 分钟做一次自动清洗(2 分钟),而你的抽样间隔恰好是 30 分钟,你可能永远只观测到清洗时刻(或永远观测不到)。
所以方法三要慎用,除非你确认过程没有周期性。如果要用,抽样间隔不要与被观测过程的周期成整数倍关系。
3.3 观测路线设计
如果要观测多个对象(如 10 台设备、20 个工位),需要设计一条巡回路线:
起点 → 对象1 → 对象2 → 对象3 → ... → 对象n → 回到起点
关键原则:路线必须固定,且在每个观测时刻的方位一致。
为什么? 因为走完一圈需要时间(比如 10 分钟)。如果你这次从 1 号开始、下次从 10 号开始,那么每台设备被观测的"相对时刻"就不一致了,会引入偏差。
更好的做法(如果条件允许):随机化起点。
每次观测时,随机决定从哪个对象开始走。这样能保证每个对象在"走完一圈"的各个相对位置都被观测到,消除系统性偏差。
四、数据收集与分析
4.1 记录表设计
一个标准的工作抽样记录表:
| 观测时刻 | 对象1 | 对象2 | 对象3 | ... | 备注 |
|---|---|---|---|---|---|
| 08:17 | 运行 | 停机 | 运行 | ||
| 08:43 | 运行 | 运行 | 待料 | ||
| ... |
关键设计要点:
- 状态分类必须互斥且完备。每一个观测瞬间,对象必须处于且只能处于一个状态。
常见的状态分类(设备):
- 运行中(加工)
- 换型/调整
- 故障停机
- 待料/待指令
- 计划停机(休息、保养)
- 空闲(无任务)
常见的状态分类(人员):
- 直接作业(增值)
- 辅助作业(必要但不增值:取料、搬运、检验)
- 等待(等料、等设备)
- 离岗(休息、洗手间)
- 非工作活动
分类太粗会丢信息,太细则观测难度上升。实务中通常 4—6 类。
每个状态要有明确的判定标准。比如"运行"是"主轴在转动"还是"设备通电"?必须在开始前定义清楚,且所有观测者理解一致。
观测者要培训。不同观测者的判定标准要一致(这本质上是"测量系统分析"的问题)。
4.2 数据分析
基本计算:
某状态的占比 = 该状态的观测次数 / 总观测次数
置信区间(95%):
p̂ ± 1.96 × √(p̂(1−p̂)/n)
举例:900 次观测中,设备运行 630 次:
p̂ = 630/900 = 0.70
标准误 = √(0.7 × 0.3 / 900) = √0.000233 = 0.01528
95% 置信区间 = 0.70 ± 1.96 × 0.01528 = 0.70 ± 0.030
= [0.670, 0.730]
结论:设备利用率的 95% 置信区间是 67.0%—73.0%。
注意:置信区间不是"真实值一定在这个范围内",而是"如果重复做很多次同样的抽样,约 95% 的置信区间会包含真实值"。
4.3 用控制图做稳定性检查
这是一个经常被忽略但很有价值的步骤。
把每天的观测结果(当天的利用率)画在一张 p 控制图上:
中心线 CL = p̄(总平均)
控制限 = p̄ ± 3 × √(p̄(1−p̄)/nᵢ)
其中 nᵢ 是第 i 天的观测次数
为什么要做这一步? 因为工作抽样的结论是"一段时间内的平均利用率"。但如果这段时间内利用率波动很大(比如周一 90%、周五 50%),那么一个平均值会掩盖重要的信息。
控制图能告诉你:
- 是否存在异常的某几天(需要单独分析原因);
- 利用率是否稳定(如果不稳定,平均值对管理的指导意义有限)。
更进一步:可以按班次、按天、按周分层分析,往往能发现模式(如夜班利用率低、周五行程安排混乱)。
五、五大典型应用场景
场景一:测设备利用率(OEE 中的可用率)
适用原因:设备状态是离散的(运行/停机),且不需要精确的时间值。
做法:
- 定义状态分类;
- 计算样本量(通常 ±5% 相对精度);
- 设计分层随机观测方案;
- 观测数天至数周(要覆盖完整的生产周期,包括换型、保养);
- 分析,并按停机原因分层。
一个重要的价值:把"停机"进一步分解为原因(故障、待料、换型、缺人),你就得到了一份停机原因的帕累托图——这是改善的直接输入。
场景二:测宽放率
这是工作抽样最经典的应用之一。
标准工时的构成:
标准工时 = 正常时间 × (1 + 宽放率)
宽放包括:私事宽放(喝水、洗手间)、疲劳宽放、延迟宽放(等非人为可控的延误)。
宽放率通常是多少? 因行业而异,一般在 5%—20% 之间。一些参考量级(具体数值请以行业标准或企业规定为准):
| 作业类型 | 典型宽放率范围 |
|---|---|
| 轻体力、坐姿作业 | 较低(如 5%—10%) |
| 中等强度、站立作业 | 中等(如 10%—15%) |
| 重体力、不良环境 | 较高(如 15%—25% 或更多) |
为什么用工作抽样测宽放率?
因为宽放事件(喝水、上洗手间、等待)是随机发生的、间歇性的,用秒表连续测时会干扰作业,且很难捕获所有偶发事件。工作抽样的随机瞬时观测,恰好适合这类"占比"的测量。
关键做法:把人员状态分为"作业中"和"各类宽放",观测足够多的次数,得出各类宽放的时间占比。
场景三:测人员工作负荷
适用:评估某个岗位(如检验员、维修工、护士)的工作饱和度。
价值:
- 识别人员是"忙不过来"还是"工作量不饱和";
- 为人力配置提供依据;
- 发现"无效工作"的占比。
一个典型案例:某公司怀疑检验员人手不足,要求加人。工作抽样后发现,检验员的"纯检验"时间只占 45%,其余是"等待样品"(30%)和"填写记录/找文件"(25%)。真正的问题是流程安排,不是人手。 改善流程后,不加人也够用。
场景四:初步瓶颈识别
做法:对一条线的所有工位做工作抽样,比较各工位的"忙碌"占比。
判断:忙碌占比最高(且等待占比最低)的工位,通常是瓶颈。
注意:这是初步判断。准确识别瓶颈还要结合各工位的标准工时和产能(见 TOC 一文)。但工作抽样的优势是快速、低成本,适合作为诊断的第一步。
场景五:改善前后的效果对比
做法:改善前做一次工作抽样,改善后做一次,对比关键指标的变化。
关键:两次抽样的状态定义、观测方法、观测期长度必须一致,否则不可比。
统计检验:如果要严谨,可以做两个比例的假设检验(双比例 z 检验),判断改善是否"统计显著"。
z = (p̂₁ − p̂₂) / √(p̂(1−p̂)(1/n₁ + 1/n₂))
其中 p̂ 是合并比例
这能避免一个常见错误:改善后利用率从 70% 涨到 73%,就宣称"改善有效"。实际上,如果样本量不大,这个差异可能只是随机波动。
六、六个常见错误
错误一:观测时刻不随机
表现:每天固定时间去,或"有空的时候去"。
后果:系统性偏差(如总是错过换型时段)。
对策:严格用随机数确定观测时刻,并记录下来。
错误二:状态分类不互斥或定义模糊
表现:观测时不知道该归到哪一类;不同观测者判定不一致。
后果:数据不可靠,甚至无法分析。
对策:开始前明确定义每个状态,做观测者培训,必要时做一次"观测者一致性检验"(两人同时观测,比较结果)。
错误三:观测期太短,没覆盖完整周期
表现:只观测了 2 天,而生产周期是一周(含周末保养、周初换型)。
后果:严重偏差。
对策:观测期至少要覆盖一个完整的业务周期。如果有周度、月度规律,就要观测足够长的时间。
这是最容易犯的错误之一:很多人急着要结果,观测两天就出报告,结论往往是错的。
错误四:样本量拍脑袋
表现:"看 200 次够了"——没有依据。
后果:精度不可知,结论可能完全不可信。
对策:用公式计算,并在报告中明确说明置信度和精度。
错误五:用工作抽样测小概率事件
表现:想用工作抽样测"设备故障率"(1%)。
后果:需要天文数字的样本量(见速查表)。
对策:小概率事件用连续记录(如设备停机日志、MES 记录),不用抽样。
判断标准:如果预估比例低于 5%,且你能拿到连续记录(或通过系统自动采集),就不要用工作抽样。
错误六:忽略霍桑效应
表现:观测期间,被观测者的行为改变了(更认真、更忙碌)。
后果:高估效率。
对策:
- 观测前不要宣布具体目的,或说明是"研究流程而非考核个人";
- 观测期要够长,让被观测者适应(前 1—2 天的数据可以单独分析或剔除);
- 用常态化的观测(如班组长日常巡线记录),而不是"特殊的研究活动";
- 在报告中说明可能存在的偏差。
一个实用的技巧:如果条件允许,把工作抽样做成常态化的日常活动(如班组长每小时巡线时随手记录设备状态),而不是一次性的"研究项目"。这样既降低了霍桑效应,又积累了长期数据。
七、现代替代方案:系统自动采集
必须承认一个现实:在很多现代化工厂,工作抽样的角色正在被系统数据取代。
| 传统工作抽样 | 现代替代 |
|---|---|
| 人工巡线记录设备状态 | SCADA/MES 自动采集设备状态 |
| 人工记录人员作业状态 | 工位终端、传感器、视觉系统 |
| 抽样估计 | 全量记录 |
如果企业已经上了 MES 并能自动采集设备状态,那么"人工工作抽样测设备利用率"这件事就没有必要做了——你有全量数据,比抽样准确得多。
但工作抽样仍然有价值,在以下情况:
- 没有系统数据的场景(中小企业、老旧设备、非生产岗位);
- 需要人工判断的状态(如"作业是否规范""人员在做什么类型的工作"),这些无法通过传感器自动采集;
- 测量宽放率(人员行为,系统记录不了);
- 服务与办公场景(如护士的工作分布、行政人员的时间分配);
- 作为验证手段(验证系统数据的准确性)。
一个务实建议:能用系统数据就用系统数据,不能用才做抽样。 但工作抽样的方法论思想(随机化、样本量、分层、置信区间)仍然重要,因为你需要用它来判断系统数据是否可靠。
小结
工作抽样,六句话:
核心思想:随机瞬时观测的频率,可以估计状态的时间占比。 这是大数定律的应用,也是它比连续观测省力的根本原因。
样本量公式 n = Z²×p×(1−p)/E²(或相对精度形式 n = Z²×(1−p)/(S²×p))。三个关键洞察:比例越小样本量越大、精度提高一倍样本量变四倍、p 未知时用两段法或取 p = 0.5 保守估计。
随机化是成败的关键。推荐分层随机抽样(每小时随机抽 2 个时刻),既保证覆盖又实操方便。系统抽样的风险是过程周期性。
状态分类必须互斥、完备、有明确定义,且观测者要经过培训和一致性检验。
五大典型应用:设备利用率、宽放率(最经典)、人员负荷、初步瓶颈识别、改善前后对比。
六个常见错误中,最致命的是"观测期太短没覆盖完整周期"和"样本量拍脑袋"。另外,小概率事件(<5%)不要用工作抽样,用连续记录。
最后一句:工作抽样是一种"用统计换人力"的技术。它的价值不在于省了多少观测时间,而在于它让你用可控的、可量化的精度,回答一个管理上重要的问题——而且你能说清楚这个答案有多可靠。这种"知道自己有多不确定"的能力,正是工业工程区别于拍脑袋的地方。
相关阅读
- GB/T 工时标准完全指南:用国标体系建立可信的标准工时:标准工时不是掐秒表掐出来的数,而是有国标依据的科学测定结果。本文讲清 GB/T 工时标准体系…
- 标准工时怎么定?秒表测时 + 评比系数 + 宽放率的完整流程:从观测单元划分、观测次数确定、异常值剔除,到平准化评比与四类宽放,用完整算例讲透标准工时的全…
- MODAPTS 模特排时法入门:21 个动作与工时计算:产线还没建就能算出工时。本文系统讲解 MODAPTS 的 21 个基本动作、MOD 时间单位…
- MTM 与预定时间标准(PTS):不开秒表就能定出标准工时:产品还没投产,就要算出这条线需要多少人——这时秒表测时做不到,PTS 可以。本文讲透四种 P…
- 工作研究与程序分析:ECRS、人机作业分析与改善的底层套路:讲清方法研究与作业测定的先后顺序,用完整算例演示程序分析如何把周期从 167 分钟压到 30…