大数跨境

代码让 AI 写了,但拍板的还是人

代码让 AI 写了,但拍板的还是人 AI驱动数字化转型
2026-08-29
6
导读:判断没走,只是换了站位。AI 把代码写得越来越快,于是圈子里流行起一句话:软件工厂要来了,人该从代码里退出去。
PART 01
判断没走,只是换了站位

AI把代码写得越来越快,于是圈子里流行起一句话,软件工厂要来了,人该从代码里退出去。这话只对了一半。人确实从逐行读代码、逐个改动复核里退了出来,但没从软件这件事里退出去。判断只是换了站位,没消失。
这是个时代性变化。过去评价工程师,就看代码写得对不对,手快、眼准、记得住,就是好手。如今智能体能写实现、跑测试、看失败、改代码,但前提是你把上下文喂够。当代码本身不再是瓶颈,工程师的本事就跟着挪了,从"写得出"挪到"定得对"。定什么?定这四件事,到底解决谁的问题、系统怎么摆、怎么算能发布、上线前谁拍板。这四样全是判断,机器给不了你准话,只能人自己定。
人没退场,退的是"逐行盯代码"。真正值钱的,从"会写代码的手"变成了"能定边界的判断力"。

PART 02
判断要提前放对,不能事后救火

把智能体交给团队用,最难的不是让它学会写代码,而是让它知道你那条线在哪儿。如果判断是等它写完,人再从头核一遍,那就跟以前没什么两样,只是把审查从人换成了AI,活没省,只是换了个干活的。
正确的做法是提前放对位置。派单模板里写死几条纪律,只许碰验收标准,不许动认证、计费、迁移和已有的测试断言;改完必须开一个草稿合并请求,把跑了什么检查、剩什么风险、哪些决定必须人来拍,一次性写清。这几条看着简单,其实是把判断这个最值钱的东西,提前写进了环境里。智能体照着执行,不用人每次盯着,因为边界在动手之前就已经钉死了。
这就说到软件工厂的关键,工厂不是"AI干活、人看结果"的流水线,而是"把人该定的提前定死,把机器能定的交给机器"。判断放得越靠前,后面要人救的火就越少。
PART 03
什么时候值得上软件工厂

工厂,就是围绕软件开发的一套可重复、事件驱动的循环。它有用,但门槛比很多人以为的要高,多数项目根本用不着。一个趁手的编码工具、几个会话、把规格写清楚,就能走很远。
真正需要工厂的,是当难处变成这几件:每次运行要表现一致、智能体之间要交接、同一问题别被两个会话重复认领、证据要留得住。这四样一旦成了瓶颈,工厂的价值才会显现。判断标准就一条:你的工作是不是已经事件驱动。如果是从工单、工作群、待办清单自动触发的队列,跑在隔离环境里,还要人盯分诊、实施、测试,那才值得上,否则是自找麻烦。
多智能体并行,最怕的是无序。两个会话同时认领同一个工单,各写各的,合并时打起来了,这不是技术错误,是协调缺失。解决靠的是加锁,谁先认领,标签就锁死,别人只能等。这个机制是整个工厂里最不值钱、却最要命的一环。它把并发变成了有序,是软件工厂能跑起来的前提。

分诊机制
分诊机制也值得细说。Warp把每个进来的工单分进四个状态:可实施、待规格、要信息、先别动。这个标签同时干了三件事:它是队列(排先后),是锁(一个会话认领了别人不碰),是人的暂存区(想停一件事,不用对它永远说不,标个状态就行)。会话只捡标成就绪的,其他状态就是人给它设的边界。这套机制把分诊这个原本靠人临时判断的事,变成了能照着执行的规则。这一步,让工厂从一堆脚本变成了有秩序的系统。

PART 04
一个最小的工厂,一个提示词就够

小到不能再小的工厂,一个提示词就装得下。先读工单和仓库说明再动代码;只实现验收标准,不碰认证、计费、迁移和已有测试断言;在分支上改,改动保持可审;跑代码风格检查、测试、构建,跑不了就停下说明原因;开一个草稿合并请求,写清楚跑了什么、剩什么风险、哪些决定必须人来拍,别自己合并。
这一句是整个循环的地基。分支保护管住合并边界,人每天看工单标签决定放行哪些。看里面的门道:提示词里所有"别碰、别动、别合并",都是把人的判断边界前置;所有"写清楚、说明原因",都是让智能体给证据。边界加证据,就是人在AI写代码时代做判断的两种方式,把该定的定死,把该看的看明白。
这里有个容易忽略的细节:交接。任务在工厂、另一智能体、人工审核之间流转。交接必须带走三件事,发生了什么、还剩什么、为什么需要交接。交接丢一环,下一棒就得从头摸,整个工厂的进度就卡在这。交接做得好,是看不见的功夫,比任何单点优化都值钱。

PART 05
质量门要前置、持续,还要算信噪比

质量检查要尽早、尽量持续地推进到循环里。类型系统、自动化测试、变异测试、安全扫描、架构代码风格检查,都能用很低的成本把问题拦在前面。但要记住,检查次数不等于质量。一个工厂挂了几十道闸门,每道都跑,不一定就比三道关键的更安全。
关键是想清楚验证预算。快检查,代码风格检查、类型检查,放最前面,几乎零成本,错了立刻拦。重的检查,变异测试、浏览器测试、安全扫描,放到草稿合并请求前后。这个分配不是随意的,是要让开发循环不被拖慢,又让该查的在关键节点查到。判断一个工厂的好坏,看的就是信噪比,这些检查是每次都撞同一个假阳性,还是真在把系统变安全?是省事,还是只是更吵?
验证预算还有一笔账:成本。一次运行回来标成"有瑕疵",你只知道它没成,不知道查出这瑕疵花了多大代价。一道快速检查,没人驳回,七分钟跑完;一个要人工在中间拍板的功能,两次驳回加人工决策,五十六分钟。同一个工厂,成本差八倍。所以运行分类必须配每阶段耗时一起看,否则没法判断这工厂是高效还是虚胖。验证预算配得好,是给智能体松绑的前提。检查到位,人才放心把更多事交出去;检查虚设,只能越攥越紧。

PART 06
全绿会骗人,安全要靠分层

自动化检查最容易骗人的地方,是它以为绿了就是过了。你让智能体帮忙过一道单测,它可能改测试去满足条件,也可能改代码逻辑去蒙混,而不是真按你原本的意图来。所以刚把工厂搭起来时,全绿不代表真绿,要盯紧关键路径上的检查是不是真在做你以为它做的事。
这里有个根本问题:测试和逻辑都是智能体自己写的,它为了让绿灯亮,可以两边一起改。验证要防这种自己证明自己,办法是让验证独立于实现。独立的验证,才不是自证。
另一个隐藏风险在输入侧。工厂如果读不可信输入,一个GitHub工单、一条工作群消息,可能是敌意的,可能夹带供应链攻击。所以像Vercel这类实现,把智能体关进隔离沙箱,只给当前任务够用的密钥。就算一个运行被攻破,它手头也只有这个任务要用的那几把密钥,够不着别的。这就是给智能体戴镣铐,不是不让它干活,是让它只够得着该够的。最小权限加上隔离,是两道独立的防线,任何一道被绕过,另一道还在。防御靠分层,不靠单点。这一层防的不是攻破本身,是攻破之后的损失。真到了那一步,靠最小权限把损失锁死在小范围,不让一次失守拖垮整片。

PART 07
并行越多,记忆越要靠落盘

可以同时放几十上百个智能体跑,但人的认知带宽不跟着涨。过去聊上下文切换的成本,现在更严重。一天五个十个项目,每切一次都要重抓"刚才在干嘛"。并行越多,脑子里的模型越多,凉得越快,转头就记不全。
代码往往留住了"当时做了什么决定",留不住"为什么这么决定"。与其指望记忆和翻会话,不如让智能体把它处理问题的轨迹、踩过的坑、学到的教训落成文件。存仓库也好、留本地也好,需要时能翻回来。关键是把当时为什么这么定和代码分开存。代码回答是什么,轨迹回答为什么。后者不落到盘上,等会话一压缩,就永久丢了。认知带宽就摆在那,人不可能跟上每个会话,那就让机器替人记住该记的。
认知带宽的事,说到底人的注意力只有一条道。机器可以并行,人的注意力不能。所以工厂的设计目标,是尽量把人的注意力集中在最少的几处判断上,而不是让人跟进每个会话。谁该被盯、谁能放手,取决于风险,不取决于会话数量。把注意力花在刀刃上,是并行时代对人最要紧的事。边界画得越清楚,越能放手让它跑;边界画得越糊,越得寸步不离盯着。信任是边界给的,不是放养给的。
PART 08
判断转移的终点,是责任还在

说了这么多,底下是同一个原则,代码是手打的还是AI打的,不改变谁担责。还是有人定问题,有人定架构,有人定质量线,有人决定哪条验证信号值得信,有人判断证据够不够发布。系统真出事了,"智能体写的"不是挡箭牌。
往大了看,这条原则能解释很多现象。为什么OpenAI、Anthropic这些站在浪尖上的公司,不约而同押注FDE,前沿部署工程师?因为模型能力越通用,特定场景落地越脆弱,光有模型解决不了"最后一公里"。那一段恰恰要人到客户现场,把模糊需求翻译成技术方案,再给智能体搭确定性护栏。模型提供能力,人提供判断和边界,合起来才叫落地。95%的企业AI项目倒在最后一公里,不是模型不行,是没人把判断放对位置。
所以最好的软件工厂,不是比谁把人的参与消得最干净,而是比谁把人放得最聪明。把意图、系统怎么搭、质量线划到哪儿,放在上游让人定,把机器能给准话的部分使劲往前推,约束该紧该松,随系统赢不赢得起信任来调。技术会一直变,AI写代码的水平还会往上走,但有一件事不会变,总要有人为最后那句"行不行"负责。这个位置,机器替不了,也不该替。所以,判断没走,只是换了个更省力的站位。

【声明】内容源于网络
0
0
AI驱动数字化转型
专注AI,促进智造行业数据衍生,服务智能制造企业的数字化、智能化,聚焦大模型私域部署、大模型微调、数据清洗、AI模型训练、私域知识库及agent技术延展等。行业智能,落地为先。
内容 1081
粉丝 1
AI驱动数字化转型 专注AI,促进智造行业数据衍生,服务智能制造企业的数字化、智能化,聚焦大模型私域部署、大模型微调、数据清洗、AI模型训练、私域知识库及agent技术延展等。行业智能,落地为先。
总阅读10.4k
粉丝1
内容1.1k