从「凭手感调参数」到「用设计找答案」· 14 张卡片 + 3 个速查板块
产品良率只有 92%,工程师申请了三天时间调机。第一天,改温度——不行,改回去;再改保压压力——好一点,又去改时间——反而差了,把时间调回来。第二天在温度和保压之间来回拉锯。第三天,生产催着交货,工程师选了「看起来最不坏」的一组参数,写下工艺卡。三个月后,同样的戏码换个产品再演一遍。
试错不是错,错的是试错的顺序和结构。一次只改一个因素,你永远看不见因素之间互相「帮忙」或者「拆台」的那一刻——而那恰恰是工艺的真相。 —— 自卷青年 · 关于实验设计的思考
每张卡片:定义 → 要点 → 图解 → 工厂案例(具体数字)→ 误区 → 一句话记住
同样是注塑件良率从 92% 往上抬:老师傅凭手感调了一个星期,最后停在 94.2%;换用 DOE,温度、保压、时间三个因素各取高低两档,8 组试验一天做完,分析发现温度和保压有强交互——两个一起上调,良率直接到 97%。后来再补 8 组中心点试验,把工艺窗口收窄,良率稳定在 98% 以上。差距不在熟练度,在方法。
某团队做 DOE 优化外观良率,把「检验员评分(1~5 分主观打分)」当响应。做完 16 组,ANOVA 显示什么都不显著——不是没有效应,是响应本身没分辨力:评分的波动比工艺效应还大。换成「外观缺陷点数 + 尺寸 CPK」两个客观响应重做,两个因子立刻浮出水面。响应是 DOE 的「眼睛」,眼睛不行,看什么都模糊。
某团队做 8 组全因子,图省事按「低温组 → 高温组」顺序做。早上做低温组、下午做高温组——而那台注塑机下午料筒温度本身就漂高 3℃。结果「温度效应」被高估了近一倍,按结论改工艺,量产良率不升反降。重做一遍随机化顺序,温度效应只剩一半,另一半原来是「时间漂移」冒名顶替的。
还是注塑那台机器。基准条件(180℃ / 60bar)良率 88%。单独把温度升到 200℃,良率 90%,+2;单独把保压升到 80bar,良率 89%,+1。按 OFAT 的逻辑:温度值 2 分,保压值 1 分,都「不痛不痒」。
回流焊虚焊率超标。工程师加高一段温区温度,虚焊少了但立碑多了;压低风速,立碑好了虚焊又回来。来回拉锯三天,最后在周会上甩锅「设备老化」。其实真相是:温区温度和风速存在交互——低温区必须配低速风,高温区必须配高速风,一冷一热搭起来才稳定。一个 2³ 全因子,8 组数据把这张「搭配表」直接画了出来。单因素思维救火,常常越救越火。
标准顺序(1 = 低水平,+ = 高水平):
(1) 180/60/8 → 88% | a 200/60/8 → 90% | b 180/80/8 → 89% | ab 200/80/8 → 97%
c 180/60/12 → 90% | ac 200/60/12 → 92% | bc 180/80/12 → 91% | abc 200/80/12 → 99%
实际执行时顺序要随机化(卡③)。
上面的 8 组就是真实案例:一天做完(每次 30 分钟,8 组 + 重复共 16 次开机),当晚出分析。结论三句话:温度主效应 5 分、保压主效应 4 分、交互 3 分;时间不显著。落地动作:工艺卡改成「200℃ / 80bar」组合条件,时间收紧到 8s——良率 88% → 97%,周期还缩短了 33%。这就是「数据说话」和「手感调机」的差距。
卡⑤的案例里,交互效应 3 分比 C 的主效应 2 分还大。工程师没有只写「温度 200、保压 80」,而是把交互图贴在工艺卡上:温度 190℃ 时保压必须 ≥75bar,温度 200℃ 时 80bar 即可。后来原料换供应商、熔体流动性变化,操作工照着交互图微调保压,良率稳住了。主效应告诉你拧多少,交互作用告诉你拧的时候看谁的脸色。
涂布工序面密度波动,头脑风暴列了 8 个因子:浆料固含量、涂布速度、间隙、烘箱一段/二段/三段温度、张力、环境湿度。全因子 2⁸ = 256 组——不可能。做法:第一轮 2⁸⁻⁴ = 16 组(分辨率 IV),两个晚上跑完,固含量、间隙、二段温度三个因子效应最大;第二轮对这 3 个因子补 2³ = 8 组全因子,交互关系看清。两轮合计 24 组,锁定「固含量 52.5% + 间隙 0.22mm」的组合,面密度 CPK 从 0.8 提到 1.4。
卡⑤的全因子把良率抬到 97% 后,工程师追问:还能更高吗?对 A(温度)、B(保压)加做 CCD:4 角点已做,补 4 个轴向点(180/205/215℃ 等外延档)和 4 个中心点。拟合曲面发现良率峰值不在角落,而在205℃ / 85bar——两水平设计根本到不了的位置。验证三批:平均 99.6%,且把 ±5℃/±3bar 的波动窗口标注进工艺卡。2 水平给了方向,曲面给了坐标。
现代主流做法是合体:用经典部分因子/CCD 的框架,把噪声因子显式引入试验,再补 S/N 比或「均值+方差双响应」分析——两头的好处都拿到。
注塑件收缩率夏天 0.52%、冬天 0.48%,模具一套尺寸「两季两个样」。改模要 8 万,调机没效果。田口思路:把环境温度(噪声因子)搬进试验,用 L8 内表 × 温度外表跑一轮,找 S/N 最大的组合——料温 230℃ + 冷却 18s + 保压 85bar 时,冬夏收缩率都落在 0.49~0.505%。没换模具、没加空调,波动腰斩——参数设计省下的钱,比容差设计便宜一个数量级。
粉末冶金烧结:想试 3 种保护气氛 × 3 种装载量。气氛切换要抽真空置换,一天只能换一次——普通随机化 9 组要 9 天。改用裂区设计:每天固定一种气氛,炉内随机换装载量(几乎零成本),3 天跑完。代价是分析要用裂区模型,气氛效应的检验更保守。设计要迁就产线的物理现实——统计学为生产服务,不是反过来。
某厂第一次做 DOE,工程师一人扛全部:白天开会定方案、晚上自己跑试验、周末做分析,两周后累垮且数据作废一半。第二次学乖了,开工前一张分工表:工艺工程师定因子水平、质量部做 MSA、生产班长保证机台档期(含 3 个夜班窗口)、维修待命、工程师只管记录和分析。同一个试验,5 天收工。DOE 是团队项目,不是个人英雄主义。
来源 | P 值 | 判定
温度 A | 0.012 | 显著 ✓(P<0.05)
保压 B | 0.021 | 显著 ✓
时间 C | 0.148 | 不显著(效应 2 分但没甩开噪声)
A×B 交互 | 0.038 | 显著 ✓——工艺条件必须成对写
误差 | —— | 重复给出的本底噪声
模型 R² = 0.94,调整 R² = 0.89——模型解释了九成以上波动,够硬
逐列解释:P 值 = 「如果因子其实没用,出现这么大效应」的概率——小于 0.05 就认账。R² = 模型吃掉的波动比例。F 值 = 因子方差 ÷ 误差方差,P 值就是从 F 值换算来的。
某团队 DOE 报告漂亮:三个因子全部 P<0.01,R²=0.99。按结论改工艺,量产首月良率纹丝不动。复盘发现:16 组试验是同一个班、同一批料、连着一天做完的——误差小到失真,P 值自然「全员显著」;真实产线的班次/批次波动全在模型之外。R²=0.99 的另一面,可能是「只解释了实验室那一小撮数据」。残差分析和验证试验,一个都不能省。
蚀刻工序做 2³ 全因子,线速度效应「越高越好」,团队准备把速度拉到上限。分析前顺手看了中心点:3 个中心点平均良率 96.8%,比两端都高——弯曲显著,最优在中间!补做 CCD 后确认峰值在「中速 + 高浓度」。如果当时直接拉满速度,3 组中心点(成本不到 3%)拦住了一次全产线降良率的事故。
某汽车零部件厂把十大误区压成一张 A4 自查表,贴在每个 DOE 项目的启动会上:MSA 做了吗?响应客观吗?水平跨度够吗?随机化了吗?误差估计有吗?粗筛当终审了吗?残差查了吗?验证批留了吗?八个问号,当年 DOE 项目「结论无法复现」的比例从四成降到不足一成。清单比聪明可靠。