测量系统分析 MSA
在分析数据之前,先确认收集这些数据的测量系统是否可靠。
MSA 如何判断测量系统是否可靠
MSA 的评价方法取决于数据类型: 连续型 / 计量型数据使用 Gage R&R;离散型 / 计数型数据中的分类、判定与等级结果使用 Attribute Agreement Analysis。
连续型 / 计量型数据
长度、重量、温度、压力、时间、扭矩等连续测量结果。
σGage R&R = √(σ²Repeatability + σ²Reproducibility)
σTotal = √(σ²Gage R&R + σ²Part-to-Part)
Study Variation 通常采用 6σ 表示;分子和分母同时乘以 6,因此比例与标准差之比相同。 %Study Var 各分量不能直接相加。
同一人员、同一设备、同一方法,对同一件样品重复测量产生的波动。
不同人员、设备或测量条件,对同一件样品测量产生的系统差异。
反映测量系统区分样品真实差异的能力;ndc ≥ 5 通常作为基本要求。
3 名测量者 × 5 个样品 × 每件重复 2 次,共 30 个测量结果。
| Operator | Part | Trial | Result (mm) |
|---|---|---|---|
| A | 1 | 1 | 10.02 |
| A | 1 | 2 | 10.04 |
| B | 1 | 1 | 10.10 |
| B | 1 | 2 | 10.11 |
| … | … | … | … |
| Source | %Study Var | 判断 |
|---|---|---|
| Total Gage R&R | 13.0% | 条件接受 |
| Repeatability | 9.5% | 重复测量波动 |
| Reproducibility | 8.9% | 人员 / 条件差异 |
| ndc | 8 | 区分能力可接受 |
Total Gage R&R = 13.0%,位于 10–30% 区间。可根据用途和风险条件接受;Repeatability 与 Reproducibility 均需关注。
离散型 / 计数型数据
合格 / 不合格、缺陷类别、等级、人工判定等分类结果。
同一评价者自己是否稳定。
不同评价者之间是否一致。
存在标准答案时,判断是否正确。
Po 为实际一致率;Pe 为随机情况下的预期一致率。
低:同一个人前后判断不稳定,优先检查判定标准是否清晰。
低:不同人员理解不一致,需要统一标准、培训和边界样品。
低:即使人员之间一致,也可能共同判断错误;有标准时应重点检查该指标。
Agreement % 越高越好,但没有与 Gage R&R 完全对应的 10% / 30% 统一判定线。关键质量或放行场景应结合误判风险设定更严格要求。
3 名评价者 × 8 个样品 × 2 轮判定,并为每个样品准备标准答案。
| Sample | Standard | Appraiser | Trial | Result |
|---|---|---|---|---|
| 1 | OK | A | 1 | OK |
| 1 | OK | A | 2 | OK |
| 2 | NG | A | 1 | NG |
| 2 | NG | A | 2 | OK |
| … | … | … | … | … |
| Metric | Result | 判断 |
|---|---|---|
| Within Appraiser | 91.7% | 重复一致性较高 |
| Between Appraisers | 87.5% | 仍存在人员差异 |
| Appraiser vs Standard | 91.7% | 存在少量误判 |
| Kappa | 0.82 | 一致性良好 |
Kappa = 0.82,总体一致性良好。Between Appraisers 与 Vs Standard 仍低于重复一致率,应检查人员之间的边界判定和误判样品。
交叉型 Gage R&R
每个测量者或设备都能对同一组样品重复测量,测量过程不会明显改变样品。
3 人更容易识别再现性问题;资源有限时可先用 2 人。
5 个用于快速筛查;8 个兼顾效率与覆盖;10 个是更稳妥的常规方案。
常规起始研究用 2 次;高风险或测量噪声较大时用 3 次。
Attribute Agreement Analysis
结果是合格/不合格、缺陷类别、等级或评分,重点是判定是否稳定、一致并尽可能正确。
3 名评价者更容易发现判定标准理解不一致。
5 个用于试跑;正式研究更建议 8–10 个,并刻意加入边界样品。
每一轮都必须重新随机化,不能看到上一轮答案。
破坏性测试与嵌套型设计
不同人员无法测量同一个样品时,样品差异会与人员差异混在一起。需要先确认母样、子样、批次和同质性。
例如同一批材料或相邻位置试片。
必须保留批次与样品之间的结构。
有替代方法时应优先评估。
目标不同,设计和方差分解也不同。
计数结果与自动检测系统
先验证人员对缺陷识别是否一致,再比较总数。
重点看漏检、误检、重复计数和阈值。
按有序分类处理,可考虑 Weighted Kappa。
保存逐缺陷或逐事件匹配,而不只保存总数。
5、8、10 个样品是面向现场执行的实用选项。样品数量少时,样品代表性和边界覆盖尤其重要,不能用“随便拿几件正常品”代替研究设计。
生成随机数据收集表
根据第 04 部分确定的研究方案,网站直接生成随机化数据收集表。 现场按“随机运行序”执行并填写结果,收集完成后再使用下面唯一的分析 Prompt。
从第 04 部分进入时,会自动读取你已经选择的人数、样品数和重复次数。
建议先完成第 03 判断树与第 04 研究设计。
返回判断树 →有问题?联系作者
如果以上操作、样本量计算或 Prompt 使用过程中有任何问题, 请通过邮件联系作者。