关注下方“公众号”,获取更多开源资讯
导读
工业质检最贵的成本是什么?不是模型,是换产。新品类、新缺陷一出现,闭集模型就要重新标注、重新训练,柔性制造的换型节奏根本等不起。
通用多模态大模型有开放词表能力,本是破局希望,但直接套用会撞上三堵墙:推理逻辑不符合质检规范、微小缺陷被全局编码稀释、缺乏先验时"脑补"出结构幻觉。中科院计算所等机构联合提出的 IndusAgent 给出了一条新路径:把质检从"被动看图"变成"主动取证"——给 Qwen3-VL-8B 装上四件工业质检工具,用 3000 条工业思维链轨迹对齐诊断逻辑,再用"精度门控"奖励杜绝工具滥用。结果相当有冲击力:在 MVTec-AD、MPDD、VisA、DTD、SDD 五大基准上零样本平均准确率 83.4%,比最强商用基线 GPT-4.1(77.5%)高 5.9 个百分点,比 GPT-4o(65.8%)高 17.6 个百分点;平均召回率 86.3%,大幅压缩了工业场景最怕的漏检空间。
论文信息
-
标题: IndusAgent: Reinforcing Open-Vocabulary Industrial Anomaly Detection with Agentic Tools -
作者: Rongbin Tan, Fangfang Lin, Zhenlong Yuan, Min Qiu, Kejin Cui, Mengmeng Wang, Yi Wang, Zijian Song, Zhiyuan Wang, Jiyuan Wang, Yue Wang, Shuhan Song, Huawei Cao -
机构: 中科院计算所处理器芯片全国重点实验室、圣克拉拉大学、LongCat 团队、斯坦福大学等 -
链接: https://arxiv.org/abs/2605.20682
一、为什么通用大模型做不好工业质检?
开放词表异常检测(open-vocabulary IAD)是柔性制造的核心需求:新品类、新缺陷层出不穷,理想状态是用自然语言描述缺陷就能检测,换产零训练成本。通用多模态大模型(MLLM)具备开放语义能力,理论上正是答案。但论文指出,把它们直接搬进质检现场会撞上三堵墙:
第一堵墙:领域推理错配。通用大模型的推理目标是"像人一样聊天",不是"像质检工程师一样下结论"。质检诊断有严格的流程规范——先全局观察,再对可疑区域取证,最后给结论。大模型自带的推理轨迹不符合这套规范,容易把正常的结构变异误判为缺陷。
第二堵墙:微小缺陷被全局编码稀释。微米级划痕、点蚀、低对比度纹理变化,在一张全局图的压缩编码里很容易丢失。模型"看"了整张图,却没有真正"看清"那个决定性的细节。
第三堵墙:结构幻觉。缺乏领域先验时,大模型倾向于脑补——要么把正常纹理、反光当成异常(误检),要么凭空构造出不存在的缺陷结构。质检场景里这两种错误代价都极高。
现有方案各有短板:纯视觉检测模型依赖闭集设定,换产即失效;通用 VLM 直接套用,撞上上面三堵墙;简单的工具调用则容易"为了用工具而用工具",引入噪声还拖慢推理。IndusAgent 的思路是把三者缝起来:用工业思维链对齐诊断逻辑,用主动工具调用补感知短板,用精度门控奖励杜绝工具滥用。
图片来源于原论文
二、核心设计:一个数据集、四件工具、一道门控
2.1 Indus-CoT:教模型"质检工程师怎么想"
论文构建了 Indus-CoT 数据集——约 3000 条工具融合的结构化推理轨迹,从 Real-IAD 采样图像构建,正常/异常样本大致均衡。每条轨迹严格遵循「全局观察 → 工具验证 → 最终诊断」三段式工业质检流程:先整体观察图像、圈定可疑区域;再决策调用哪件工具、观察工具返回的补充证据;最后整合全局与局部证据,输出判断、位置与缺陷类型。
两个细节保证了评估的严谨性:训练类别与所有测试基准类别完全不重叠(用精确匹配 + 语义归一化双重过滤,连 pcb1/pcb2 这类命名变体都剔除),确保测的是零样本泛化而非类别记忆。
2.2 四件质检工具:把"看不清"变成"看得清"
|
|
|
|
|---|---|---|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
四件工具覆盖了放大观察、纹理增强、先验对比、几何测量四类取证动作——这正是人类质检员"凑近看、换角度、拿样件对比、上量具"的机器化版本。
2.3 精度门控奖励:让工具调用"有用才用"
这是全文最值得细品的机制。工具调用本身有成本:调用越多,推理越慢、越容易引入噪声。怎么让模型既愿意取证、又不滥用工具?论文的答案是精度门控:
整体奖励 = 诊断正确性 ×(1 + 定位奖励 + 类型奖励 + 工具效用奖励)+ 格式合规项
其中诊断正确性是一个 0/1 乘法门:最终判断错了,定位、类型、工具调用的奖励全部归零。而工具效用项进一步设计为"置信度提升才加分、调用数量越多越扣分":工具调用后置信度上升(Δconf > 0)才给正奖励,每多调一件工具就扣一份(λ=0.3,η=0.1)。
这个设计的潜台词很清楚:工具调用必须服务于最终诊断。它从优化目标上杜绝了"为了用工具而用工具",兼顾检测精度与推理效率。
图片来源于原论文
三、训练流程:SFT 对齐逻辑,GRPO 学会决策
基于 Qwen3-VL-8B-Instruct底座,单节点 4×A100 80GB,分两阶段:
阶段一:监督微调(SFT)。用 Indus-CoT 轨迹把模型对齐到工业诊断逻辑,采用选择性掩码——只对推理过程的 token 计算损失,让模型内化"怎么想",而不是死记缺陷外观。
阶段二:精度门控强化学习(GRPO)。组相对策略优化不需要单独的价值网络,显存开销低;奖励函数就是上面那套精度门控设计,配合规则化验证防止 reward hacking。论文报告,引入 RL 后召回率进一步提升,MPDD 上 +17.4%、DTD 上 +10.4%——在背景干扰严重的数据集上增益尤其明显。
四、实验:五大基准零样本全面登顶
主结果:8B 参数反超全部商用 API 与 72B 开源模型
严格零样本设置:训练类别与测试类别完全不重叠,推理时不提供任何参考样本。主结果(节选,完整表格共 15 种方法):
|
|
|
|
|
|
|
|
|
|
|---|---|---|---|---|---|---|---|---|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
77.5 |
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 本文 | IndusAgent | 8B | 83.6 | 72.7 | 76.8 | 95.6 | 88.9 | 83.4 |
三个结论:
-
全面登顶:平均 83.4%,五个数据集全部第一,比最强基线 GPT-4.1 高 5.9 个百分点; -
参数效率极高:8B 参数量,超越 72B 开源大模型和全部商用 API,部署成本差一个数量级; -
短板变长板:原生 Qwen3-VL-8B 在 VisA、MPDD、SDD 上大面积拿 50 分(随机水平),IndusAgent 分别拉到 76.8、72.7、88.9——结构复杂、背景干扰强的数据集恰好是工具调用收益最大的场景。
召回率:工业漏检风险的硬指标
工业场景里漏检(假阴性)的成本远高于误检。论文单独对比了异常召回率:
|
|
|
|
|
|
|
|
|---|---|---|---|---|---|---|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| IndusAgent | 94.1 | 95.4 | 85.5 | 83.3 | 73.4 | 86.3 |
IndusAgent 平均召回 86.3%,比底座 Qwen3-VL-8B 高 20.5个百分点;MPDD 上更是 95.4% vs 62.3%,提升 33.1 个百分点。主动工具调用对发现细微、低对比度缺陷的贡献一目了然。
消融:每一件设计都值多少钱
|
|
|
|
|
|---|---|---|---|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 完整 IndusAgent | 83.6 | 76.8 | 95.6 |
三段结论:去掉 SFT 后性能几乎退回原点——领域推理对齐是工业落地的基础前提;去掉 RL 明显下滑——强化学习对开放词表泛化不可或缺;去掉工具集仍有可观降幅——主动取证是突破被动感知瓶颈的关键。
工具行为:模型真的"像工程师一样取证"
论文统计了推理时的工具调用分布:每张图平均只调用 0.72~1.12 次工具,成功率 98.7%~99.4%。更有意思的是场景自适应性——物体类数据集(MVTec)上裁剪工具占比 62.4%,纹理类数据集(DTD)上增强工具占比 34.7%。Agent 会根据场景自动选择最合适的取证方式,而不是无差别地把四件工具都跑一遍。门控奖励的克制效果,实锤了。
定性案例同样直观:原生 Qwen3-VL 容易被反光干扰误判、对细微缺陷漏检;IndusAgent 会主动裁剪放大可疑区域、增强纹理对比,再给出判断——推理过程可解释、可追溯。
图片来源于原论文
五、总结与思考
IndusAgent 的贡献不是又一个大模型,而是一个范式切换:工业缺陷检测从「被动单图判断」进入「主动工具验证」。几点评述:
对工业视觉团队的三条直接启示。第一,别再只堆参数——8B 模型加对的方法论,可以打赢 72B 裸模型加商用 API,这对边缘部署、产线私有化的成本结构是决定性的。第二,工业场景漏检优先于误检,评估模型时该看的硬指标是召回率而不是只看准确率,IndusAgent 在召回上的收益(+20.5 个百分点)比准确率更值得关注。第三,推理可追溯性是质检合规的底线——"为什么判它不合格"必须能拆解成工具取证的过程,这正是 Agent 范式相对黑盒推理的优势。
两个值得警惕的局限。其一,论文在严格零样本设置下评测,真实落地时产线通常会有少量标注样本,如何把少样本监督与工具调用结合,论文尚未回答。其二,工具调用增加推理时延——0.72~1.12 次调用对离线质检可接受,但高速产线在线的节拍约束下,需要更精细的"什么时候值得取证"的决策策略。
一个更宏观的信号。IndusAgent 是 Agent 范式从"对话助手"走向"专业工程师"的又一个例证:给模型配上专业工具、用领域数据对齐推理、用门控机制约束行为,这套方法论正在从代码、办公场景外溢到质检、巡检、诊断等工业场景。工具调用,正在成为 2026 年 Agent 落地的核心叙事——这也和我们本周另一篇文章里讨论的智能体浪潮互为注脚。
中奥 Coco Agent支持合作伙伴私有化部署,支持二次开发构建行业场景专用智能体。如果您有技术交流或合作意向,欢迎添加小助手联系我们~
© THE END
转载请联系本公众号获得授权
分享、点赞与在看,至少帮我拥有一个

