大数跨境

垂分大模型不是训出来的,是选出来的:PTM、CPT、SFT,四步对号入座

垂分大模型不是训出来的,是选出来的:PTM、CPT、SFT,四步对号入座 AI驱动数字化转型
2026-09-02
2
导读:一个 2000 多万参数的模型,从只会乱码,到能背出石油化工的答案,四步走了不到一个小时。它还很傻,语义是空的,但它真的完成了。更重要的是,这条路走完,看清了该在哪一层发力,也看清了不该对一个垂分小模
8G显存的笔记本显卡,2334 万参数,一个只会输出乱码的小模型,被一步步训到能说出"石油化工是以石油和天然气为原料"这句话。loss 从 8.11 一路掉到 0.52。
做完这件事,最清楚的一点是,垂分大模型其实不是训出来的,而是选出来的。
这话听着反直觉,多数人做垂分模型,第一反应是拿个基座开训,训完再说。但真要做过一遍就知道,浪费最多的不是训练本身,是方向选错之后的返工。垂分大模型的活法,第一步不是训,是选。选该用哪一件武器,选这个领域该多细,选自己的资源能做多大。这三件事想明白了,训练只是按流程走一遍。想不明白,训得越久错得越远,钱和时间都砸在错误的方向上。
下面把"怎么选"这件事讲透。不空谈概念,给可以照着做的方法和判断。制造业的朋友可以对着自己的场景,一步步对号入座。

先分清四件武器
垂分落地有四件武器,不是只有训练这一件。很多团队上来就想着微调,其实真正的杠杆可能根本不在训练上。先把这四件分开,才知道什么场景该动哪个。


PTM
PTM 是从零预训练。拿空白模型在语料上从头练,学会字、词、句子怎么排。这一件最重,数据要海量,通常以亿级 token 起步,算力要最高,只有大厂和云服务商扛得起。但它的产出反而最基础,就是"会说人话"。换句话说,PTM 解决的是语言底座,是那个"孩子认不认识字"的问题。它的坑在于,领域语料再丰富,也补不了一个从零练出来的语言能力。一个刚学会说话的模型,你往里灌再多行业词,它还是不懂行业,因为连最基本的语义都还没长全。所以 PTM 在垂分里很少单独用,要么用来学习理解模型怎么诞生,要么某个领域实在没有可用的通用基座、又要求完全自控,才轮得到它。


CPT
CPT 是在别人家的孩子身上补课。领域继续预训练,拿一个已经会说人话的基座,喂领域的专属语料,让模型认识这个行业的术语、专名、工艺关联。它不改变模型聪明不聪明,只把它往这个行业里拉深。这一件解决的是行业知识,数据需求几十万到百万 token 就够,比 PTM 少一个量级,算力中等,普通训练卡能跑。垂分落地的真正主力,往往就是它。它有一个前提,手里得真有这个行业的专属语料,没有语料,CPT 就是无米之炊。有了语料,它能把一个通用模型变成"懂行的",这是很多制造业场景最需要的那一层。


SFT
SFT 教的是干活。任务微调,拿一个有行业知识的模型,喂任务的问答数据,教会它做具体的事,对答案问、给诊断、做分类。每一类任务几十条到几百条高质量样本就够,算力最低,普通消费卡能跑。它解决的是任务能力,是把"懂行"变成"会干活"。它的坑在过拟合和格式对齐。数据太少,模型把样本答案背下来,遇到没见过的就问不出;格式不对齐部署,训练白做。所以 SFT 的样本格式,必须在动手前就定死,和部署、评测用同一套。


RAG
RAG 最轻,甚至算不上训练。把领域知识放在外部库和本体里,模型回答时先去检索,再基于检索结果生成。这一件解决的是实时、权威、可溯源的知识,防幻觉,而且不消耗任何训练算力。它适合知识频繁更新、或者必须可溯源的场景。它的价值被严重低估,很多制造业场景,真正缺的不是模型会多少,是知识准不准,而 RAG 正是补"准"最直接的手段。
四件武器各管一段。PTM 管说话,CPT 管懂行,SFT 管干活,RAG 管查得准。想清楚缺哪一段,才知道该动哪一件。这是"选"的第一层。

把场景和武器对上
武器认清了,把它和具体场景对上。制造业的真实场景,基本都能在这张表里找到位置。
制造业场景
首选武器
为什么
工艺问答、设备说明书解读
RAG + SFT
知识在文档里,要可溯源防幻觉
设备故障诊断、给处理建议
SFT + RAG
要懂行业术语,又要查实时维护记录
泵阀选型、工况匹配
RAG(本体) + SFT
选型是规则+检索的活,规则优先
工单分类、缺陷识别
SFT
有标注数据,要的是分类能力
质量分析、缺陷描述理解
CPT + SFT
先补行业语言,再对齐分析任务
行业标准、国标检索
RAG
标准要权威原文,不能靠模型背
想做一个能对话的行业助手
组合拳
CPT+SFT+RAG,本体当骨架
每个场景为什么这么选,值得拆开讲。
  • 工艺问答和说明书解读,知识全躺在文档里,答案得能溯源,让人敢信。这时候训练一个会背书的模型,不如让模型去查文档。所以 RAG 打底,再配一层 SFT 教会它用查到的内容好好说话。
  • 设备故障诊断,难在既要懂行业术语,又要查实时的维护记录。术语靠 CPT 或一个好基座补,实时记录靠 RAG 查,把两者揉到一起给建议,就是 SFT 加 RAG。
  • 泵阀选型最特殊,它本质是规则加检索的活。什么工况该选什么泵阀,是有明确规则的,不该让模型自由发挥。本体把规则和知识结构化,RAG 在里头查,SFT 只负责把结果讲成人话。规则优先,是选型类场景的铁律。
  • 工单分类和缺陷识别,这类有标注数据的活,是最典型的 SFT。给一批标注好的工单,教会模型分类,数据够、任务清楚,SFT 就够用,没必要上更重的。
  • 质量分析、缺陷描述理解,先要模型听得懂行业里的说法,再让它对齐分析任务。所以 CPT 补行业语言在前,SFT 对齐任务在后,两层都要。
  • 行业标准、国标检索,标准要权威原文,一个字都不能错,绝不能靠模型背。RAG 直查原文最稳,训练在这类场景里毫无必要。
  • 想做一个能对话的行业助手,那就是组合拳。CPT 让模型懂行,SFT 让它会干活的格式,RAG 兜实时知识,本体当骨架把整个结构撑住。
判断就一句话,缺语言走 PTM,缺行业知识但有基座走 CPT,缺任务能力走 SFT,缺实时权威知识走 RAG。一层缺什么补什么,别一上来就把四件武器全砸进去。
制造业里有个反直觉的点,值得单独说。多数垂分场景,真正缺的不是模型会多少,而是知识准不准。所以 RAG 往往是最该先上的一件,它比训练省,还防幻觉,能溯源。很多场景不是要训一个更聪明的模型,是要让现有模型查到更准的资料。这个判断如果没想明白,很容易一头扎进训练里,花了大力气,解决的反而是个不存在的问题。

颗粒度该定多细
武器定了,还得定这个领域该多细。颗粒度是垂分最容易走偏的地方,不是越细越好。
太细,语料凑不够,模型学不到东西,任务太窄,做完也没多少人用。太粗,跟通用模型没区别,垂分没意义,白花功夫。垂分吃的就是中间那层。
判断有三把尺子。第一,这个领域的边界能不能一句话说清。第二,能不能列出几个明确可评测的任务。第三,真实数据够不够撑起训练。三把尺子都过了,颗粒度才站得住。
拿制造业举例。粗到"制造业"三个字,跟通用模型没区别,边界一句话说不清,任务列不齐。细到"某一型号的阀门",边界太窄,语料太少,任务太碎,做完价值也小。甜点区在中间,比如"工业泵阀"或者"油气设备运维",边界说得清,任务列得出,数据收得齐。这个"工业泵阀"就是个不错的颗粒度,边界清晰,任务能列出选型、诊断、维护几类,语料也有得收。
颗粒度定了,后面所有工作都以它为锚。语料按它收,任务按它列,评测按它出,别中途又改。

资源和预期,决定能做多大
同样的目标,资源不同,做法和预期完全不同。这张表是选型的另一半,决定你能做多大,也决定别抱不切实际的指望。
资源
模型规模
能做什么
预期
8G 显卡
千万级参数
学习实验、领域专用件
能力弱,别指望推理
24~32G 显卡
1~4B
CPT+SFT
有基础能力
多卡或云端
7B 以上
生产级领域模型
这才谈得上通用智能
8G 显卡,是最常见也最容易误判的资源。它不是不能做 PTM,是能做的规模太小。两千万参数的模型,学得会字、词、句子,但语义和推理是命门,生成出来的东西看着通顺,其实大半是统计规律凑出来的幻觉。这样的模型只能当学习实验,或者当一个配合规则和检索用的领域专用件,别拿它去指望一个全能模型。认清这一点,做实验的人心不慌,用模型的人也不会上当。
24 到 32G 显卡,是垂分落地的甜区。能做 1 到 4B 的模型,CPT 补行业知识,SFT 对齐任务,跑出来的模型有基础能力,能当个像样的行业助手。
多卡或云端,才谈得上 7B 以上的生产级领域模型,这是真正扛得起通用智能的资源。
认清预期很重要。垂分小模型的价值不在通用智能,在领域知识和确定性任务。把它摆在该摆的位置,它就是一个好用的专用件。怕就怕资源只有 8G,却照着 70 亿参数的标准去指望,那是把预期建在不可能上。

把一次真实实验完整走一遍
光讲方法太空,走一遍真实的。这次是 PTM 到 SFT 的完整路径,我用的是 8G卡和石油化工领域,每一个数据都是真跑出来的。
语料是淘出来的。从智源 IndustryCorpus2 的石油化工子集里捞。一个数据文件就 800 多 MB、26 万行,全是对口的中文工业文本,自带质量分和行业标注。这一步比想象中省事,中文工业语料并没有想象中那么缺,智源这套就是现成的。筛掉低质文本,按行业标注意向筛出石油化工,抽了 20252 篇,凑成 96.8MB、约 3800 万字的干净语料。数据清洗是垂分里最不起眼却最要命的一环,质量分和行业标注这两列,省了无数人工看样本的功夫。
模型挑了个现成的底子。直接用 MiniMind 这套开源参考,它把分词、预训练、微调、评测的链路全打通了,从零预训练不用自己造轮子。模型配到隐藏维度 512、6 层,2334 万参数,这个规模在 8G 卡上跑得飞快,一个 epoch 十来分钟。
拿领域语料从头训 1 个 epoch,loss 从 8.11 降到 4.17。loss 在掉,但真正让人吓一跳的是生成验证。拿"石油化工是""天然气是一种"喂进去,它吐出来的句子是通的,语序是对的,领域词一个接一个往外蹦。可仔细一读就露馅,天然气是高分子材料的分子合物,阀门是用来石油化工。句子像模像样,意思全是幻觉。这就是极小模型最诚实的一面,它学会了语言的壳,但里面是空的。这一轮叫 PTM,从零预训练。它证明了极小模型能从零长出语言的雏形,也把它的天花板摆得明明白白。
PTM 结束,模型会说领域的话了,懂的还浅。拿它当底子,用更低的学习率在石油化工语料上再跑 2个 epoch,想让领域知识更厚。这里栽了个实在的坑,启动直接崩了,报错找不到权重文件。查了半天,是参考代码加载权重时默认从上一级目录找,而存的路径对不上。修法是给加载函数传一个明确的保存目录。这个坑说明,训练链路看着顺,实际每一步都有自己埋的雷,路径、版本、数据格式,哪个对不上都跑不起来,光看文档永远想不到。修好后跑了 2 个 epoch,loss 从 4.17 继续降到 3.47,生成验证里领域词明显更密集、更连贯、更"像石油化工"了。这一轮叫 CPT。领域继续预训练的价值在这一步看得最清楚,它不改变模型的聪明程度,但把它往这个行业里拉深了一大截。
知识厚了,还得教会应答。手写了 25 条石油化工问答,覆盖原料、工艺、设备、安全、产品这些基础常识。微调 10 个 epoch,loss 从 2.08 一路降到 0.52。转变最明显,它学会应答了。这一轮叫 SFT。
最后用评测说话。三个阶段用同样的提示词生成对比,演变一目了然。
提示词: 什么是石油化工
  • PTM: 乱码
  • CPT: 一下一下以油为原的物质
  • SFT: 石油化工是以石油和天然气为原料,通过燃料、化学品的产业

提示词: 催化裂化的作用
  • PTM: 乱码
  • CPT: 催化剂是由氧原原和二氧化碳
  • SFT: 催化剂在于产品收率

提示词: 炼油的主要产品
  • PTM: 化工产品碎片
  • CPT: 炼油厂的过程中产生的污染
  • SFT: 石油化工是以石油和天然气为原反应的第一体化工业
三个阶段看得清清楚楚。PTM 在问答格式下直接乱码,根本不知道"答"后面该接什么。CPT 领域词出来了,但答非所问。SFT 学会了应答格式,能把训练样本里记下的答案有模有样地背出来。评测的结论是,垂分小模型的成长有明确的先后顺序,语言在前,行业在中,任务在后,一步都不能跳。
但这里藏着一个真实局限,值得说透。SFT 让模型学会的更多是格式加记忆,不是泛化。它记住了训练集里"石油化工是以石油和天然气为原料"这个答案,遇到训练里没见过的"催化裂化",答得就不完整。25 条数据太少,模型把这些答案背了下来,这是过拟合。这不是失败,这是极小模型加极少数据的真实表现。从中能看出,SFT 让小模型学会的,首先是"怎么答"的格式,其次是"答什么"的记忆,最后才谈得上"答得对"的泛化。2000 万参数的模型,泛化这一步基本够不到。这个局限不是实验做砸了,而是把极小模型的能力边界量了个明明白白,值这个学费。
落到制造业,一步步该怎么做
把上面的方法落到制造业,是一套可以照着做的流程。
  1. 多数制造业场景,先别急着训练。对着自己的场景,用前面的判断法则,想清楚到底缺哪一段。答案往往是先上 RAG,因为缺的是准,不是聪明。这一步最难,也最容易被跳过,人总是想干点重活证明自己,但垂分里最值钱的一步恰恰是克制。
  2. 颗粒度用三把尺子量。把领域边界、任务清单、数据够不够先盘清楚。甜点区在中层,别细到某一型号,也别粗到整个行业。这个判断要写在纸面上,成为后面所有工作的锚。
  3. 资源决定能做到多大。认清自己的显卡的规模,定一个合理的预期。8G 就老老实实做专用件,别指望全能。
  4. 真要训练,走完整路径。CPT 补行业知识,SFT 对齐任务,本体当骨架,RAG 兜实时。每一步都留痕,日志、权重、生成对比都存下来,方便复盘,也是做决策的证据。
这套方法来自一次真实跑通的全流程,每一步都有完整记录可追溯。照着走,能少踩很多坑。
垂分大模型的玩法,第一步不是训,是选。选对武器,选对颗粒度,选对预期,最终训练只是走流程。
一个 2000 多万参数的模型,从只会乱码,到能背出石油化工的答案,四步走了不到一个小时。它还很傻,语义是空的,但它真的完成了。更重要的是,这条路走完,看清了该在哪一层发力,也看清了不该对一个垂分小模型抱什么指望。
下次想做垂分模型,先对号入座,再动手。

【声明】内容源于网络
0
0
AI驱动数字化转型
专注AI,促进智造行业数据衍生,服务智能制造企业的数字化、智能化,聚焦大模型私域部署、大模型微调、数据清洗、AI模型训练、私域知识库及agent技术延展等。行业智能,落地为先。
内容 1081
粉丝 1
AI驱动数字化转型 专注AI,促进智造行业数据衍生,服务智能制造企业的数字化、智能化,聚焦大模型私域部署、大模型微调、数据清洗、AI模型训练、私域知识库及agent技术延展等。行业智能,落地为先。
总阅读10.4k
粉丝1
内容1.1k