ACADEMY — 04 · ANALYZE
生产数据/影响因素很多,
怎么找出最关键那几个?
Key Driver Analysis · 关键因子分析
从实验或生产记录中筛选与结果最相关的候选 X
02基本概念
从一张实验/生产宽表,找到最值得优先验证的 X
真实生产数据通常不是一个 X 对一个 Y,而是十几个甚至几十个字段同时变化。这一页要解决的是:面对一张多 X、多 Y 的生产数据表,应该先看什么、怎么筛选、哪些结论可以相信。
EXAMPLE · PRODUCTION DATA一张典型的数据宽表
X 可以是连续型,也可以是分类 / 属性型;Y 也可能不止一个。
| 候选 X · Process / Material / Environment | Response Y | ||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|
| 温度 °C |
压力 bar |
速度 rpm |
时间 min |
原料水分 % |
供应商 Attribute |
班次 Attribute |
设备 Attribute |
配方版本 Attribute |
环境湿度 %RH |
得率 % · Continuous |
是否合格 Discrete |
| 72.1 | 4.8 | 235 | 14.5 | 2.8 | Supplier A | 白班 | Line 1 | R03 | 48 | 93.2 | 合格 |
| 74.0 | 5.1 | 250 | 13.0 | 3.4 | Supplier A | 夜班 | Line 1 | R03 | 56 | 89.6 | 不合格 |
| 70.8 | 4.7 | 228 | 15.2 | 2.6 | Supplier B | 白班 | Line 2 | R04 | 45 | 94.1 | 合格 |
| 73.5 | 5.4 | 262 | 12.8 | 3.7 | Supplier C | 夜班 | Line 1 | R03 | 61 | 87.9 | 不合格 |
| 71.6 | 4.9 | 241 | 14.8 | 2.9 | Supplier B | 白班 | Line 2 | R04 | 50 | 92.7 | 合格 |
| 75.2 | 5.6 | 270 | 12.1 | 4.1 | Supplier C | 夜班 | Line 1 | R05 | 64 | 85.8 | 不合格 |
| 69.9 | 4.6 | 222 | 15.7 | 2.5 | Supplier A | 白班 | Line 2 | R04 | 43 | 95.0 | 合格 |
| 72.8 | 5.0 | 246 | 13.9 | 3.2 | Supplier B | 夜班 | Line 2 | R05 | 54 | 90.8 | 合格 |
这类表最常见的问题:
10 个 X 都在一起变化,到底哪几个最值得优先研究?连续型 Y 和离散型 Y 又该用同一种算法吗?
THIS PAGE主要解决这个问题
从已有生产数据中,筛出与 Y 关系最稳定、最值得进一步验证的 2–4 个候选 X。
输出不是“真正原因已经找到”,而是一份更小、更可信的候选因子清单,供后续 DOE、试运行或工艺验证继续确认。
01多字段生产数据
→
02筛选稳定关系
→
03候选关键 X
→
04DOE / 现场验证
分析之前
四个必须先分清的概念
历史数据只能说明两个字段一起变化。温度高的批次得率也高,不代表把温度调高就一定提高得率;班次、原料批次或设备状态可能同时改变了两者。
返工次数、让步接收、复检结果、客诉等字段往往在 Y 之后才产生。它们可能让模型表现非常好,却没有任何前置控制价值。
温度、压力、蒸汽量和能耗可能高度相关。模型有时只会把重要性分给其中一个,不能因为另外几个排名下降就直接判断“不重要”。
供应商、班次、设备编号可能非常有预测价值,但不一定是可以直接调整的工艺旋钮。Key Driver Analysis 要区分“能预测”与“能行动”。
常用算法
不同算法,侧重点不同
没有一个模型适合所有生产数据。选择方法时主要看:Y 的类型、数据量、字段数量、关系是否非线性,以及你更需要解释还是预测。
| 方法 | 主要适用场景 | Y 类型 | 主要特点 | 重点注意 |
|---|---|---|---|---|
| Multiple Regression多元线性回归 | 想量化每个 X 与连续 Y 的关系 | Continuous | 系数直观,可输出 p-value、CI、VIF | 线性关系、残差、共线性、Interaction |
| Logistic Regression逻辑回归 | Y 为合格 / 不合格、发生 / 未发生 | Binary | 可用 Odds Ratio 解释 X 与事件概率的关系 | 类别不平衡、样本量、分类变量编码 |
| Poisson / Negative Binomial计数回归 | 缺陷数、停机次数、事件发生数 | Count | 适合非负离散计数,可处理 Exposure | Overdispersion、Offset、Zero Inflation |
| Lasso / Elastic Net正则化变量筛选 | X 很多,想先把候选字段缩小 | ContinuousBinary | 自动压缩系数,输出更精简的变量集合 | λ 需交叉验证;共线变量之间会竞争 |
| Ridge Regression岭回归 | X 高度共线,又希望保留全部变量 | Continuous | 比普通回归稳定,不会把变量直接压到 0 | 系数经过收缩,不适合直接当无偏效应量 |
| Decision Tree · CART决策树 | 需要可执行阈值和条件组合 | Any | 能给出“X > 某值且 Z < 某值”的规则 | 容易过拟合;单棵树稳定性较差 |
| Random Forest / GBM随机森林 / 梯度提升 | 非线性明显、Interaction 多、预测优先 | Any | 预测能力强,可配合 SHAP / Permutation Importance | 重要性不是因果;高相关字段会分摊贡献 |
| PCA主成分分析 | 很多 X 高度相关,先理解变量结构 | X only | 把大量相关字段压缩成少数独立变化方向 | 不是关键因子结论;主成分不一定有工艺含义 |
| Clustering / Anomaly Detection聚类 / 异常检测 | 还没有明确 Y,想先找批次结构或异常模式 | Unsupervised | 适合探索、分群和异常批次筛选 | 输出是探索线索,不是驱动因子结论 |
判断树会继续帮你缩小选择:先看 Y 类型,再看数据规模和你最终想要“系数、规则、排序还是预测”。
03KEY DRIVER BUILDER
定义 X 和 Y,生成关键因子分析 Prompt
只需要告诉 AI 哪些列是候选 X、哪些列是 Response Y。 AI 会先筛选关键 X,再根据你的目标寻找更有利的参数区域。
EXAMPLE
假设你的 Excel 长这样
前 10 列是候选 X,后 2 列是 Y。
| A 温度 |
B 压力 |
C 速度 |
D 时间 |
E 水分 |
F 供应商 |
G 班次 |
H 设备 |
I 配方 |
J 湿度 |
K 得率 |
L 成本 |
|---|---|---|---|---|---|---|---|---|---|---|---|
| 72.1 | 4.8 | 235 | 14.5 | 2.8 | A | 白班 | L1 | R03 | 48 | 93.2 | 18.4 |
| 74.0 | 5.1 | 250 | 13.0 | 3.4 | A | 夜班 | L1 | R03 | 56 | 89.6 | 21.1 |
| 70.8 | 4.7 | 228 | 15.2 | 2.6 | B | 白班 | L2 | R04 | 45 | 94.1 | 17.9 |
例如:
X = A:J,共 10 个;Y = K:L,共 2 个。先找关键 X,再设定 K 最大、L 最小。
STEP 01 · X COLUMNS
候选 X 有几个?在哪些列?
例如:10 个 X,位于 A:J。
可以输入连续列,也可以输入不连续列。
STEP 02 · Y COLUMNS
Response Y 有几个?在哪些列?
不需要填写 Y 名称或数据类型,AI 会从表头和真实数据自动识别。
生成 Prompt 后,AI 会读取这些列对应的真实字段名。
STEP 03 · Y TARGET
筛出关键 X 后,希望 Y 怎么变化?
多个 Y 可以分别设定不同目标。
KEY DRIVER ANALYSIS PROMPT
与原始 Excel 一起上传