Cyber Sigma Lab

ACADEMY — 04 · ANALYZE

生产数据/影响因素很多,
怎么找出最关键那几个?

Key Driver Analysis · 关键因子分析

从实验或生产记录中筛选与结果最相关的候选 X

02基本概念

从一张实验/生产宽表,找到最值得优先验证的 X

真实生产数据通常不是一个 X 对一个 Y,而是十几个甚至几十个字段同时变化。这一页要解决的是:面对一张多 X、多 Y 的生产数据表,应该先看什么、怎么筛选、哪些结论可以相信。

EXAMPLE · PRODUCTION DATA一张典型的数据宽表
X 可以是连续型,也可以是分类 / 属性型;Y 也可能不止一个。
候选 X · Process / Material / Environment Response Y
温度
°C
压力
bar
速度
rpm
时间
min
原料水分
%
供应商
Attribute
班次
Attribute
设备
Attribute
配方版本
Attribute
环境湿度
%RH
得率
% · Continuous
是否合格
Discrete
72.14.823514.52.8Supplier A白班Line 1R034893.2合格
74.05.125013.03.4Supplier A夜班Line 1R035689.6不合格
70.84.722815.22.6Supplier B白班Line 2R044594.1合格
73.55.426212.83.7Supplier C夜班Line 1R036187.9不合格
71.64.924114.82.9Supplier B白班Line 2R045092.7合格
75.25.627012.14.1Supplier C夜班Line 1R056485.8不合格
69.94.622215.72.5Supplier A白班Line 2R044395.0合格
72.85.024613.93.2Supplier B夜班Line 2R055490.8合格
这类表最常见的问题: 10 个 X 都在一起变化,到底哪几个最值得优先研究?连续型 Y 和离散型 Y 又该用同一种算法吗?
THIS PAGE主要解决这个问题
从已有生产数据中,筛出与 Y 关系最稳定、最值得进一步验证的 2–4 个候选 X。

输出不是“真正原因已经找到”,而是一份更小、更可信的候选因子清单,供后续 DOE、试运行或工艺验证继续确认。

01多字段生产数据
02筛选稳定关系
03候选关键 X
04DOE / 现场验证
分析之前

四个必须先分清的概念

01相关 ≠ 因果

历史数据只能说明两个字段一起变化。温度高的批次得率也高,不代表把温度调高就一定提高得率;班次、原料批次或设备状态可能同时改变了两者。

02先排除 Data Leakage

返工次数、让步接收、复检结果、客诉等字段往往在 Y 之后才产生。它们可能让模型表现非常好,却没有任何前置控制价值。

03共线性会改变“排名”

温度、压力、蒸汽量和能耗可能高度相关。模型有时只会把重要性分给其中一个,不能因为另外几个排名下降就直接判断“不重要”。

04预测重要 ≠ 可以直接调

供应商、班次、设备编号可能非常有预测价值,但不一定是可以直接调整的工艺旋钮。Key Driver Analysis 要区分“能预测”与“能行动”。

常用算法

不同算法,侧重点不同

没有一个模型适合所有生产数据。选择方法时主要看:Y 的类型、数据量、字段数量、关系是否非线性,以及你更需要解释还是预测。

方法主要适用场景Y 类型主要特点重点注意
Multiple Regression多元线性回归想量化每个 X 与连续 Y 的关系Continuous系数直观,可输出 p-value、CI、VIF线性关系、残差、共线性、Interaction
Logistic Regression逻辑回归Y 为合格 / 不合格、发生 / 未发生Binary可用 Odds Ratio 解释 X 与事件概率的关系类别不平衡、样本量、分类变量编码
Poisson / Negative Binomial计数回归缺陷数、停机次数、事件发生数Count适合非负离散计数,可处理 ExposureOverdispersion、Offset、Zero Inflation
Lasso / Elastic Net正则化变量筛选X 很多,想先把候选字段缩小ContinuousBinary自动压缩系数,输出更精简的变量集合λ 需交叉验证;共线变量之间会竞争
Ridge Regression岭回归X 高度共线,又希望保留全部变量Continuous比普通回归稳定,不会把变量直接压到 0系数经过收缩,不适合直接当无偏效应量
Decision Tree · CART决策树需要可执行阈值和条件组合Any能给出“X > 某值且 Z < 某值”的规则容易过拟合;单棵树稳定性较差
Random Forest / GBM随机森林 / 梯度提升非线性明显、Interaction 多、预测优先Any预测能力强,可配合 SHAP / Permutation Importance重要性不是因果;高相关字段会分摊贡献
PCA主成分分析很多 X 高度相关,先理解变量结构X only把大量相关字段压缩成少数独立变化方向不是关键因子结论;主成分不一定有工艺含义
Clustering / Anomaly Detection聚类 / 异常检测还没有明确 Y,想先找批次结构或异常模式Unsupervised适合探索、分群和异常批次筛选输出是探索线索,不是驱动因子结论
判断树会继续帮你缩小选择:先看 Y 类型,再看数据规模和你最终想要“系数、规则、排序还是预测”。
03KEY DRIVER BUILDER

定义 X 和 Y,生成关键因子分析 Prompt

只需要告诉 AI 哪些列是候选 X、哪些列是 Response Y。 AI 会先筛选关键 X,再根据你的目标寻找更有利的参数区域。

EXAMPLE 假设你的 Excel 长这样
前 10 列是候选 X,后 2 列是 Y。
A
温度
B
压力
C
速度
D
时间
E
水分
F
供应商
G
班次
H
设备
I
配方
J
湿度
K
得率
L
成本
72.14.823514.52.8A白班L1R034893.218.4
74.05.125013.03.4A夜班L1R035689.621.1
70.84.722815.22.6B白班L2R044594.117.9
例如: X = A:J,共 10 个;Y = K:L,共 2 个。先找关键 X,再设定 K 最大、L 最小。
STEP 01 · X COLUMNS 候选 X 有几个?在哪些列?
例如:10 个 X,位于 A:J。
可以输入连续列,也可以输入不连续列。
STEP 02 · Y COLUMNS Response Y 有几个?在哪些列?
不需要填写 Y 名称或数据类型,AI 会从表头和真实数据自动识别。
生成 Prompt 后,AI 会读取这些列对应的真实字段名。
STEP 03 · Y TARGET 筛出关键 X 后,希望 Y 怎么变化?
多个 Y 可以分别设定不同目标。
05 使用支持
CONTACT

有问题?联系作者

如果以上操作,算法或 Prompt 使用过程中有任何问题, 请通过邮件联系作者。

发送邮件到: cybersigmalab@proton.me