大数跨境

AI 软件工厂:无人工暗厂与人机协同明厂的底层逻辑

AI 软件工厂:无人工暗厂与人机协同明厂的底层逻辑 苏哲管理咨询
2026-07-22
14
导读:本文围绕 AI 驱动的智能体软件工厂,划分明厂(有人审核)、暗厂(全自动化无人审核)两套研发模式,搭建三层递进核心架构:最小单元执行循环、约束载体、规模化工厂。完整业务闭环以业务诉求、线上故障信号为输
编者摘要国内制造业类似小米美的海尔等有很多无人自动化黑灯工厂或可称之为“暗厂,映射到到当下智能体软件行业。本文围绕 AI 驱动的智能体软件工厂,划分明厂(有人审核)、暗厂(全自动化无人审核)两套研发模式,搭建三层递进核心架构:最小单元执行循环、约束载体、规模化工厂。完整业务闭环以业务诉求、线上故障信号为输入,经任务队列、智能体载体生成代码,通过自动化校验与人工审核关卡后灰度上线,监控数据回流生成新需求。 暗厂移除人工审核,短期交付效率暴涨,但会持续累积理解负债,长期造成遗留系统逻辑隐患明厂保留人机协同,前置架构评审,依托标准化代码架构对冲 AI 代码缺陷,平衡效率与系统可控性。 文章明确明暗工厂划分标准:短循环、低成本机器校验场景可做暗厂;影响架构、故障代价高的链路必须走明厂人工复核。行业正从自由无约束智能体循环,转向有限状态机结构化工作流;研发人员的核心工作从手写代码,转为搭建自动化工厂、管控风险校验关卡,人类全局架构判断无法被 AI 替代。

5 个主要问题Q&A

Q1:明厂与暗厂最核心区分标志是什么?

A:核心开关是人工代码审核关卡。暗厂完全移除人工审阅,仅靠机器校验直接上线;明厂保留人工复核,高风险节点前置人工评审。

Q2:暗厂看似效率更高,长期落地存在什么底层缺陷?

A:会不断累积理解负债,代码库规模与团队对系统认知差距持续拉大。长期运行后未人工校验的隐藏逻辑冲突集中爆发,企业级遗留系统故障风险极高。

Q3:运行载体(Harness)对 AI 智能体循环有什么不可替代作用?

A:载体为智能体提供运行沙箱、工具集、持久记忆与任务完成判定标准,约束裸大模型无目的空转,让自动化流程安全、可控、可校验。

Q4:哪些业务场景绝对不能使用暗厂全自动化模式?

A:变更影响范围大、线上故障损失高、决定数年系统架构的链路;自动化测试无法覆盖隐蔽缺陷、超长逻辑循环的开发流程,必须人工介入。

Q5:AI 软件工厂时代,工程师核心工作发生了怎样转变?

A:不再以手写代码为核心,工作重心转向搭建、运营自动化工厂;负责架构规范设计、分层校验机制搭建、把控顶层业务与架构决策,承担线上故障最终责任。

附录:软件工厂:明厂与暗厂

一、核心定义:何为软件工厂

软件工厂,本质是规模化运行的自动化工作循环。这套运行模式分两条路线:

  1. 明厂(Light Factory,开灯式工厂)
    人机协同运转循环。依托人工判断与深度把控换取交付质量,代价是迭代速度受限、故障风险更容易暴露;
  2. 暗厂(Dark Factory)
    完全剥离人工介入,交由 AI 智能体独立完成需求拆解、代码开发与上线全流程,全程无人审阅代码细节。

但一旦人类彻底脱离代码审阅环节,就会逐步丧失对系统整体的理解能力。当下研发从业者最核心的工作,是设计配套校验机制、合理划分 AI 智能体的自主操作权限。

“软件工厂” 这一概念最早可追溯至 1968 年鲍勃・贝默(Bob Bemer)发表的论文《程序生产的经济学》。半个世纪以来,行业始终憧憬一套标准化、可量化的软件生产流程 —— 如同工厂批量冲压汽车零部件一般,彻底摆脱程序员单打独斗的手工作坊式开发模式。不过长久以来,这一构想大多落地不及预期,核心痛点在于:创意与逻辑无法像实体零件一样标准化量产。

而近两年来,AI 技术的爆发彻底改写了行业现状,让我们得以重新审视这套传承数十年的构想。同时诸多细节极易被忽略,因此有必要清晰区分:哪些是当下真正全新的变革,哪些只是换了外衣的历史遗留陷阱。

HumanLayer 联合创始人 Dex Horthy 曾在 AI 工程师全球峰会发表主题演讲《仅靠自动化流程远远不够:软件工厂为何会失效》,内容极具参考价值,值得深入研读。

二、三层核心架构:循环、约束载体、工厂

整套自动化研发体系由三层概念层层嵌套构成,最小单元是工作循环(Loop),外层包裹运行载体(Harness),大量载体并行运转便形成软件工厂(Factory)

1. 工作循环(Loop)

循环是单个 AI 智能体重复执行单一任务的最小单元:收集上下文→执行操作→校验结果,循环往复直至满足终止条件。所有上层自动化体系,本质都是无数基础循环层层叠加而成。

所谓循环工程(Loop Engineering),核心思路不再是逐轮手动给智能体输入提示词,而是搭建一套自动化系统,由系统自主驱动智能体完成全流程交互。

2. 约束载体(Harness)

载体是包裹循环的约束框架:包含智能体运行沙箱、可调用工具、跨轮次持久化记忆,以及判定 “任务完成” 的校验门槛。

  • 循环代表智能体的执行行为;
  • 载体承载行为运行的完整环境。

若不给大模型配套载体约束,裸模型会无限空转;载体的价值,就是让智能体的运行可控、可用、安全。

3. 软件工厂(Factory)

软件工厂,是大量搭载载体的循环同步并行运转:需求队列持续输入任务,所有自动化产出统一经过人工校验关卡后流入生产环境,人类从顶层统筹管控整套体系。 它并非一个更强的超级大模型,而是一套由无数自动化循环搭建而成的组织架构。

行业范式正在发生根本性转变:研发工作的重心,从手写代码,升级为搭建、运营能够生成代码的自动化工厂。工作单元也从单份代码变更,转移到循环、载体、流程链路本身。

整套工厂是闭环链路:业务诉求与线上生产信号汇入任务队列,载体完成代码变更开发,自动化校验 + 人工审核关卡过滤风险,变更上线后由线上监控系统采集数据,再次转化为新的业务信号,形成无限循环。

  • 业务诉求:高管战略规划、产品经理、工程师提出的开发需求;
  • 生产信号:用户投诉、功能建议、线上故障事件;
  • 载体:从队列提取任务,完成环境调度、沙箱测试、模型调用、代码变更生成;
  • 自动化校验:CI/CD 流水线、单元测试、静态代码扫描、安全检测;
  • 审核关卡:AI 辅助代码评审 + 人工复核(区分明厂与暗厂的核心开关);
  • 上线监控:版本灰度发布、线上指标采集,数据回流生成新需求信号。

链路中代码生成、自动化测试、安全扫描等环节边际成本几乎为零,可无限规模化运行;唯一难以规模化、成本高昂的环节,就是人工审核关卡 —— 这里依赖人类主观判断,也是制约研发提速、高频迭代的核心矛盾点。

三、暗厂:无人介入的全自动化流水线

1. 概念溯源

“暗厂” 一词源自实体制造业:日本发那科自 2001 年起就落地无人工厂,车间全程机器人作业、无需开灯;2024 年小米也建成高度自动化的实体暗厂。这类工厂的共性是:产品全程无人经手、无人核验,完全由机器完成生产交付。

映射到软件领域,“暗厂” 即移除人工审核关卡,代码无需任何人阅读,仅依靠机器校验即可直接上线。这里的 “暗” 并非贬义噱头,而是直白描述流程特征:代码变更从生成到上线全程无人类审阅。

短期来看,暗厂极具吸引力:省去人工审核瓶颈后,团队交付吞吐量会肉眼可见暴涨,仿佛突破研发效率天花板。但长期落地后,隐藏的隐性成本会集中爆发,维持暗厂稳定运行远比想象中困难。

2. 暗厂的核心隐患:理解负债(Comprehension Debt)

即便自动化载体、沙箱、工具调用能力持续迭代升级,仅靠模型长期维护大型代码库仍存在底层缺陷:理解负债会持续累积

理解负债,指代码总量与人类对系统的认知程度之间不断拉大的鸿沟。暗厂不会缓解这份负债,反而会持续加剧,即便所有自动化测试全部通过,隐患也会持续沉淀。

模型擅长小型、局部代码改动,但面对存量复杂系统(遗留工程)存在无法逾越的短板:

  • 全新项目、个人小型工具类项目:短期迭代即可稳定运行,模型适配度高;
  • 运营十年以上企业级系统:需要长期持续维护,自动化全流程运行 3-6 个月后,未被人工审阅的代码会海量堆积,线上故障、逻辑冲突会集中爆发。

Dex 曾亲身落地全自动化暗厂,连续 4 个月无人审核生成代码,最终问题集中暴露,耗费大量人力逐行调试才定位根源。背后是两组相互冲突的核心指标:

  • 模型利用率(行业当前主流效率衡量标准,暗厂会最大化该指标);
  • 团队对系统的整体认知度(暗厂会持续压缩该指标)。

暗厂仅在全新干净代码场景下短期表现亮眼,测试用例持续通过,但长期风险不会突然崩盘,而是缓慢、隐蔽地逐步侵蚀系统稳定性。

四、明厂:人机协同的可控流水线

明厂沿用同一套自动化链路,仅在需要人工判断的节点保留 “人工介入通道”:AI 智能体依旧承担绝大多数开发工作,但代码上线前必须经过人工审阅;所有高风险决策节点,全程保留人工把控。

明厂并非仅在链路末尾增加审核步骤,而是将人工判断前置:在智能体启动开发循环前,人类先行把控产品需求、方案设计、系统架构。 前置人工评审具备极高收益:提前敲定方案,能大幅减少后续编码工作量;与其事后通读数千行生成代码追溯逻辑,不如提前审阅两百行方案文档。涉及长期、高成本的架构决策,必须人工前置把控,避免后期风险持续放大。

1. 明厂的底层安全底座:规范架构

明厂的安全保障并非依赖模型能力,而是依托成熟、标准化的软件架构设计,这套体系能抵消 AI 生成代码的缺陷:

  • 完善类型定义、标准方法签名,让编译器提前拦截错误,而非等到线上暴露;
  • 预留测试隔离点,精准观测代码行为、管控变更影响范围;
  • 清晰分层代码结构,方便人类、模型快速定位业务逻辑;
  • 精简调用栈、规范组件边界,缩小代码变更的故障辐射范围;
  • 依赖注入解耦模块,实现组件灵活替换。

这类架构规范并非全新技术,只是在 AI 自动化开发时代,额外承担起风险拦截的作用,帮我们对冲理解负债,重新掌握系统自主权。

依托这套架构,部分低风险短循环可完全无人值守运行:例如夜间定时任务自动修复代码规范、冗余语法问题,生成篇幅极短的代码变更,人工快速审阅即可合并。但核心链路(权限校验、计费系统、对外 API 协议等)一旦出错损失极大,必须保留人工审核,依靠人类的全局认知规避重大故障。

五、划分明暗工厂的核心准则:背压校验机制

1. 判定标准:哪些循环可以做成暗厂(全自动化)

一条自动化循环可完全脱离人工、转为暗厂,必须同时满足以下条件:

  • 校验成本极低,可高频次自动执行;
  • 校验规则难以被模型刻意绕过;
  • 校验结果即时输出,规则不会随时间失效。

类型校验、结果二元判定(通过 / 失败)、属性测试、配套标准化评审规则的 AI 审核,都符合要求。同时循环越简短,校验成本越低;Dex 总结经验规律:智能体可稳定完成 3-10 步连贯逻辑,超过 20 步极易丢失上下文、逻辑跑偏,长循环极易隐藏隐蔽缺陷,不适合无人工管控。

2. 判定标准:哪些循环必须保留明厂(人工介入)

只要变更出错代价高昂、仅靠机器无法识别隐患,就必须人工审核:

  • 自动化测试无法覆盖的隐蔽线上缺陷;
  • 变更影响范围极大、故障辐射面广;
  • 决策会影响未来数年系统整体架构。

这类场景中,人类的专业判断是无可替代的核心价值。

3. 平衡之道

两种极端模式均不可取:

  • 全部暗厂:短期效率暴涨,数月后海量技术负债集中爆发,重构成本极高;
  • 全部明厂:人工审核堆积形成严重瓶颈,交付效率大幅下滑。

研发核心高价值工作,就是针对不同业务循环,精准划分明暗模式,搭建分层校验体系。

六、工作流演进:从自由循环到结构化状态图

当下很多 AI 智能体采用自由循环模式:模型自主决定每一步调用工具、调整执行路径,直到判定任务完成。这种模式看似灵活自由,但在大型遗留系统中极易失控。行业正在重新回归有向状态图 / 有限状态机的结构化工作流。

两种模式对比

  1. 自由循环
    修复 Bug 无固定流程,模型自主判断排查方式、修改代码、执行测试,全程路径随机;
  2. 结构化状态图
    提前定义完整执行链路:复现故障→定位根因→生成修复代码→执行测试→审核上线,测试失败自动回流修复环节。AI 仅在单个节点内自主执行,无法脱离预设流程。

结构化状态图的核心价值是落地背压管控:适度约束智能体自主权限,换取强制校验节点、清晰故障定位。绝大多数 AI 智能体本质只是 “固定流程 + 局部 LLM 能力” 的组合,LangGraph、LlamaIndex 工作流、状态机、Actor 模型均是这套思路的不同实现形式。

文中提及的 “图” 特指预定义业务流程有向图DAG(非知识图谱),包含明确步骤节点与条件分支,让自动化流程可管控、可追溯。

七、人类在软件工厂中的全新定位

人类并未从研发链路中消失,只是工作重心发生转移:从底层编码执行,转向统筹外层总循环,AI 智能体负责内层执行循环。

AI 负责内层循环执行

故障排查、根因分析、代码实现、自动化测试、输出报告等落地执行工作,均可交由智能体高效完成。

人类把控外层核心决策

  • 判断解决方案是否匹配业务诉求;
  • 核验故障分析、代码实现逻辑是否合理;
  • 审批上线变更,承担线上故障的最终责任;
  • 依托类型规范、测试隔离点、标准化评审规则,低成本完成全流程监督。

简单来说,研发人员不再驻留生产线编写代码,而是负责整套自动化工厂的架构设计、风险关卡管控。模型能力、运行载体可以持续优化,但长期架构风险、业务取舍判断无法被自动化替代;人类独有的全局判断力,依旧是研发工作不可替代的核心。

实体工厂的机器人可以在黑暗中作业,但人类需要清晰可见的流程把控风险。若整套研发流水线完全进入 “暗模式”,无人工观测、无可控审核开关,便是系统风险的根源。

源作者:Addy Osmani

【声明】内容源于网络
0
0
苏哲管理咨询
为企业及组织提供AI+战略、数智化转型咨询及观点、建议等
内容 2031
粉丝 0
苏哲管理咨询 为企业及组织提供AI+战略、数智化转型咨询及观点、建议等
总阅读27.9k
粉丝0
内容2.0k