大数跨境

模型的终点不是训练完成,而是跟工厂一起长

模型的终点不是训练完成,而是跟工厂一起长 AI驱动数字化转型
2026-08-20
1
导读:模型不是训练完就结束了。它要落进工厂里,接上工厂的数据,跟着工厂的工艺、设备、质量一起长。今天的九成五,是起点;明天工厂的数据进来,它会更懂这家厂。
——一个阀门垂直模型怎么做起来,以及它为什么值得做


一、工厂缺的不是大模型,是懂自己的模型
一个阀门厂,不需要能聊康德的大模型,需要的是回答"这台球阀为什么内漏"时,不扯皮、直接给排查方向的小模型。
我去过一家阀门制造企业实地看。技术员手机上装着各种大模型,问"球阀和闸阀的区别",回答得头头是道。可真到了车间,问一句"密封面堆焊用司太立还是镍基,工况是四百度的蒸汽",模型就含糊了。不是它不懂阀门,是它没见过这个厂的工艺卡、这台设备的维修记录、这个批次的质量数据。
通用大模型是个"什么都知道一点、什么都不精通"的博士。工厂要的,是个"只懂阀门、但把阀门吃透"的老师傅。这个矛盾,不是堆更大的模型能解决的。数据越垂直,通用模型的短板越明显,因为行业知识从来不在模型里,在工厂自己手里。


二、数据集:把行业知识从模型外搬进模型里
答案只有一条路,把人家的行业知识灌进一个能本地跑的小模型。关键在数据集,不是随手拼的问答,而是高质量、高泛化、强行业的泵阀领域知识。
这次训练的阀门垂直数据集,八千六百二十条,分两块。
确定性知识,来自本体、标准、专业词典。IDO(工业数据本体,ISO 23726-3 体系下)的阀门用例、GB/T 13927-2022《工业阀门 压力试验》、阀门选型手册,这些是可溯源的知识,每个问答对背后都有标准条文或本体结构撑着,不编造。泵阀类型、零件组成、密封原理、故障排查、制造工艺,覆盖阀门整个生命周期。
蒸馏知识,用 DeepSeek 对阀门专业主题批量生成问答对来扩量,覆盖类型原理、设计标准、制造工艺、应用场景、故障诊断五大类。
两条腿走路。确定性保质量、可溯源,蒸馏扩量、补覆盖面。中间过两道筛子,先用质量清洗剔掉乱码、过短、错误的数据,再做二次筛选,按领域深度和问题具体性打分,宁缺毋滥。最后做主题均衡,防止某一类问答独大、把模型带偏成过拟合。
配比上,泵阀六成三、工业基础三成七。阀门为主、工业打底,这是"阀门垂直"的定位,不是泛泛的工业问答。

三、基座选择:带思考的模型,评测会骗你
选基座这一步,我踩过一个坑,值得写下来。
第一版用的是 Qwen3.5-4B 带思考的版本。训练完,loss 收敛、token 准确率到了八成八,看着挺好。一评测,傻眼了:垂直模型只有四成,还不如带思考基座的五成五。
问题不在模型,在思考模式。Qwen3.5 这类带思考的模型,微调之后仍然倾向"思考式的冗长回答",先来一句"让我理解一下问题",再是"首先,从工艺角度分析",答得对,但答不到点上。评测判分的时候,这种绕圈子的回答被判成错的。带思考的基座,评测会骗你,它把模型真实的能力藏进了思考里。
换上 Qwen3.5-4B-Base,不带思考,同样训练,评测立刻正常:垂直模型九成五,Base 基座六成五,DeepSeek 八成五。垂直微调的价值一下显出来。
这条教训,做垂直模型的人都值得记:别用带思考的基座。思考是通用场景的加分项,却是垂直领域评测的干扰项。用 Base 模型,训出来的模型直接、简洁、答到点上。


四、训练配置:这次的真实参数
这台阀门垂直模型的完整训练参数:
参数
取值
基座模型
Qwen3.5-4B-Base(无思考)
训练数据
industrial_base_valve_train_v3
样本量
8620 条(泵阀 63% + 工业 37%)
LoRA rank / alpha
r=16 / α=16
LoRA dropout
0.0
目标模块
全量线性层(q/k/v/o/gate/up/down)
有效 batch size
1 × 梯度累积 4 = 4
学习率
2e-4(AdamW,cosine 衰减)
训练轮数
3 epoch
warmup
约单轮 10%(226 步)
weight_decay
0.01
max_length
2048 token
保存间隔
save_steps=200(断电容灾)
训练时长
约 12 小时(8GB 单卡)
最终 token 准确率
88.4%(最高 89.3%)
几个关键选择,展开说。
LoRA 挂到全部 q/k/v/o 注意力投影层和 gate/up/down MLP 投影层,不只 q/v,参数表达更强,能捕捉企业特有的专有名词和逻辑关联。数据量小,r=16 够用,rank 太高反而过拟合。lr 2e-4 加余弦衰减,是小数据量微调里稳妥的组合。训练轮数 3,8620 条三圈够充分吸收。
一个硬件细节值得交代:4B 模型权重 bf16 大约就是 8GB,直接放开全参的 LoRA 会放不下。实际跑的时候,要么把基座量化到 4-bit 用 QLoRA,要么开梯度检查点、把有效 batch 收紧,才挤得进一张 8GB 卡。写出来,是想说明这不是拿高端卡堆出来的,一张消费级显卡就够。
数据密度上,指令对控制在 2048 token 以内,禁宽泛问答。不写"如何维护机器"这种,写"当 XY-100 型联轴器出现 0.5 毫米径向跳动时,标准调整步骤是什么"。同一个知识点做三到五种提问泛化,防止模型只记住固定句式。


五、训练时长:一个晚上,不是一个月
训练时长,直接说数字:8620 条,3 个 epoch,十二个小时。一台 8GB 显存的机器,一个晚上跑完。不要 A100,不要集群,一张消费级显卡就够。这才是"单体智能"能落地的根本,成本低到工厂愿意为它买单。
收敛的曲线很典型:loss 从 1.98 一路降到 0.43,token 准确率从 57% 涨到 88%,峰值到过 89.3%。学习曲线有个"学会拐点",大概在 epoch 0.3,loss 破 1.0,模型开始懂阀门;再往后过一个"跃升拐点"在 epoch 1.0 附近,loss 骤降,模型加速吸收。grad_norm 全程稳定没发散,lr 顺着余弦衰减收敛。


六、评测:方法论比结果更重要
评测结果虽好,方法得说透,否则数字不可信。
评测集是阀门垂直评测集,四百七十七条,从训练集外独立切出来,含泵阀专项加泛化样本,保证模型没"见过"这些题。
判分不直接用字符匹配。参考答案和模型答案文字可能不同、语义一致,字符匹配会把"答对了但用词不一样"的垂类误判成错。这里让 DeepSeek 当裁判,做语义判分:判断学生的答案语义对不对,接受泛化表述和长度差异。
对比讲究同一个口径。基座(Qwen3.5-4B-Base)、阀门垂直 v3、DeepSeek 三个模型,都用同一个阀门评测集,都关掉思考,都由 DeepSeek 判分。同一个标准,才公平。评测分两步走:先取二十条小样本做判分校准,确认裁判器的尺度稳定,每条约五秒生成;再看全量四百七十七条,基座和垂直模型是本地模型,逐个加载进 GPU 生成答案,DeepSeek 走 API,每个答案交给判分器定对错。
结果:
模型
准确率
基座 Qwen3.5-4B-Base
65.0%
阀门垂直 v3
95.0%
DeepSeek
85.0%
阀门垂直九成五,比基座高三十个点,比 DeepSeek 还高十个点。专业垂直微调,在阀门这个领域,直接碾压通用模型,包括云端的强模型。这印证了前面那句:行业知识不在模型里,在工厂自己手里,灌进去,就赢了。
一个可以做得更严谨的地方,也摆出来:现在只用 DeepSeek 一个裁判,单模型做 judge 多多少少带点风格偏置。条件允许的话,可以上双模型交叉判分,给结果再上一道保险


七、企业数据融合:模型不是训练完,是跟着工厂长
到这里,很多方案就收尾了。但这不是终点。
模型的终点,不是训练完成,而是跟工厂一起长。
现在这个阀门垂直模型,用的是公开的行业知识,本体、标准、蒸馏,已经很懂阀门了,但还不懂"这一家"工厂。每个工厂都有自己的一套:工艺参数、设备台账、维修记录、质量数据、老师傅的经验。这些数据是工厂最值钱的东西,也是通用模型永远学不到的,问题在于它们出不了厂。
本地部署的模型,天然解决了这件事。流程是这样:先部署本地模型,工厂数据不出厂;然后企业数据进来,工艺卡、设备记录、质检、维修日志;再混进工业行业数据,现有的阀门垂直底座八千六百二十条;最后做二次微调,形成企业自有专属工业模型。模型越用越厚,跟着工厂长。
企业数据进来,不是推倒重来,是在已有的阀门垂直底座上叠加。八千六百二十条行业知识是地基,企业自己的数据是砖瓦,两者混训,既保留行业通用认知,又注入企业专属知识。懂阀门,又懂这一家阀门厂。
这就是单体智能的价值,不只是省 token:
  • 省 token:垂直小模型直接回答,不调云端大模型,不烧 token
  • 数据安全:数据不出厂,企业知识明文不出本地,守住数据红线
  • 越用越厚:模型跟着工厂长,今天调优一次,明天企业数据进来,再长一截
通用大模型是租来的,数据要送出去;企业专属模型是自己的,长在自己家里。后者才是工厂的资产,前者只是工具


八、落点
全国六千多万家中小企业,每家都有自己的一亩三分地。它们不需要一个无所不知的博士,需要一个吃透自己行业的老师傅。
模型不是训练完就结束了。它要落进工厂里,接上工厂的数据,跟着工厂的工艺、设备、质量一起长。今天的九成五,是起点;明天工厂的数据进来,它会更懂这家厂。
这不是一篇技术方案,是工厂数字化的根本。行业知识放回行业手里,模型长在工厂家里。

【声明】内容源于网络
0
0
AI驱动数字化转型
专注AI,促进智造行业数据衍生,服务智能制造企业的数字化、智能化,聚焦大模型私域部署、大模型微调、数据清洗、AI模型训练、私域知识库及agent技术延展等。行业智能,落地为先。
内容 1081
粉丝 1
AI驱动数字化转型 专注AI,促进智造行业数据衍生,服务智能制造企业的数字化、智能化,聚焦大模型私域部署、大模型微调、数据清洗、AI模型训练、私域知识库及agent技术延展等。行业智能,落地为先。
总阅读10.4k
粉丝1
内容1.1k