大数跨境

GPT-6 爆火四天,执行在贬值,判断有断层

GPT-6 爆火四天,执行在贬值,判断有断层 静远AI出海
2026-09-07
5
导读:这几天 AI 圈里传得最多的,是一批 GPT6 做出来的作品。有人用它做出了能跑起来的游戏 Demo,有人让它把旧金山艺术宫复刻成 3D 场景,成品在网上刷了屏。事情我在 AI HOT 的每日精选里看

这几天 AI 圈里传得最多的,是一批 GPT-6 做出来的作品。有人用它做出了能跑起来的游戏 Demo,有人让它把旧金山艺术宫复刻成 3D 场景,成品在网上刷了屏。事情我在 AI HOT 的每日精选里看到,公众号数字生命卡兹克就这批案例写了篇文章,标题里放着两个词,执行能力贬值,判断力断层。我把能查到的材料对了一遍,想法记在下面。

先讲艺术宫这一个,细节最全。干活的模型叫 GPT-6 Astra,OpenAI 九月三日发布的。复刻这座建筑,网上没有现成模型,Astra 自己去搜了几百张参考图,又翻进美国国会图书馆的老扫描文件,把柱子的尺寸找了出来。大半的活在夜里干完,没人盯着,成品第二天摆出来。这座建筑是一百多年前一届世博会留下的,构造细节多,去哪找图、翻什么档案,它全程自己安排。外行看这个案例,看的是成品像不像。内行看的是中间那段,参考图信哪张,尺寸打架听谁的,材质往哪个方向调,这些小主意以前是美术师在干活时顺手拿的,这一回它自己拿了。

再看它这批案例用到的软件。名单里有建模的 Blender,有做影视特效的 Houdini,游戏开发常用的 Unity 和像素画工具 Aseprite 也在列。这几样各有各的门槛,任何一样学精都以年计,行业内不少岗位的招聘要求里写着它们。Astra 全都能自己打开自己操作,用户在对话框里把要什么说清楚就行。

Astra 发布时的成绩单也给得漂亮,官方公告里写着数学成绩破了纪录,编码追平头部模型。后面跟着一段小插曲。发布没几天,Fortune 的记者发现 OpenAI 把公告里的基准数据改了不止一次,幻觉率这个数字,先从 4.2% 改成 2%,过两天又改了回去。幻觉率指模型一本正经编造事实的比例,基准数据就是随模型一起发的那份评测成绩单。成绩单在反复涂改,用户做出来的作品倒是一件接一件往上摆。

这两件事放在一起看,比分数之争更要紧的信息只有一条,执行在贬值。

在设计、剪辑、建模这些行当里,软件手艺一直是硬通货。一个年轻人学会 Blender,从入门到能接活要一两年,接了活按张收钱。这门手艺值钱,值在操作本身有门槛,几百个功能要记,几年手感要磨。现在这段门槛正在被拆掉。你把要求说清楚,它自己开软件,自己找参考,改到自己觉得像样为止。操作那一半的价值往下掉,掉的速度多半快过多数人的职业规划。

类似的贬值出现过。三十年前打字是一门职业,打字员是正经岗位。输入法普及以后,打字成了人人都会的基本功,再没有公司单为打字设岗。不过那次贬掉的是打字这一层,稿子顺不顺、用词准不准,拿主意的仍然是人。这一次被拿走的是执行本身,而执行恰恰是练判断的地方。麻烦从这里开始。

手艺还要不要学,我的看法分两半。专门花两年磨软件操作,回报越来越薄,这一层我不劝人进。手艺里另一半,知道什么样的图算好图,什么样的模型好修,反而更值钱了,它恰好是判断。要学还值得学,把注意力放在验收上,别只放在操作上。

卡兹克用的另一个词,判断力断层。执行贬值看到案例就懂,断层在哪,我想了两天。我的答案是,判断力只能在大量的执行里喂出来。一个老美术扫一眼就知道哪张图不对,凭的是入行十年改废的几百稿,每一稿都在手上留了一点东西。判断是执行的副产品,先有量,后有眼光。

执行被模型接走以后,正在入行的年轻人可以跳过量,直接站到要下判断的位置上。上一代人的眼光拿十年执行换的,下一代人没有这十年可换,两批人中间空出一段路。掉进这段路的,是把活整个交出去、自己从此不再动手的人。这是我读到的断层。艺术宫那个案例反过来又加重了这件事,连执行里顺手拿小主意的机会,模型也一起接走了。过去判断和执行长在一起,一个人干十年活,眼光顺便就有了,没人把判断单独拎出来练。执行便宜了以后,判断头一回需要单独排课。

也别把 Astra 这批案例只当成创意行业的新闻。它展示的是一套通用姿势,接到任务,找资料、开工具、盯中间步骤,全都能自己来。设计这么干,写标书、做汇报、做市场分析也一样。再加上 OpenAI 同期那份报告的说法,AI 能在人的指导下独立完成要花好几天的明确研究任务,下一个节点定在 2028 年 3 月,目标是自动化研究员。研究任务尚且如此,日常办公任务的距离可想而知。办公室里的执行和创意行业的手艺,走在同一条降价曲线上。

我自己天天跟 Agent 流水线打交道,这个号的文章就有一条流水线参与。跑顺之前最花时间的全在验收那头,它交回来的活隔三差五要打回去,每打回去一次,我都得说清楚为什么不对。说清楚的次数多了,我对成稿的标准比以前清楚得多。这个体感跟上面的判断对得上,判断确实是验收喂出来的。

对带团队的人来说,这些变化最实际的落点是分工。建议把手里的活过一道筛,执行和判断分开看。写初稿、做图、剪片子这一侧,价格会继续往下走。定标准、验收、担责这一侧,价格会往上走。招人也可以换个考法,让候选人从零写一版方案,考的是执行,让候选人挑一份 AI 方案的毛病,考的才是判断。往后团队里更缺的是后一种人。

还有一条线划得更死。方案亏了钱,签字的人负责,这件事 AI 接不了,责任落不到它头上,判断就落不到它头上。盘岗位的时候可以问一句,这个岗位的产出里能写成标准的部分有多少,写得越清越该交给模型,写不清的那部分才是这个岗位的身价。带新人的办法也得跟着改,以前新人泡在执行里,三年泡出眼光,现在执行他碰不到了,老手就得把判断讲出声,为什么挑这家供应商,为什么砍这条预算,以前靠身体记住的东西,往后要靠嘴说出来。

拿市场部举个具体例子。让 AI 出一版活动方案,初稿十分钟就到,接下来难的是定这版方案好坏的标准。预算红线多少,目标人群是谁,跟品牌调性合不合,AI 答不了,也不该由它答。这几问答出来写下来,就是团队的第一份验收清单。判断的分量全压在这一头,而不少团队过去没把这一头当回事,以前执行慢,判断上的毛病被执行的时间盖住了。现在执行快了,判断的缺口一天就露出来。

企业侧这周就能动手的,我看是两件。一件把手里的活摊开盘点,标出执行和判断各占多少。另一件挑一个验收容易的流程先试,模型跑执行,人只管验收,跑上一个月,把挑出的毛病一条条记下来。从验收容易的活入手有个好处,错了当场看得见,代价小。

轮到个人,判断力有个笨办法可练,把 AI 当学徒带,自己站到验收的位置上。每次派活走三趟。第一趟把要求讲清楚,背景给足,什么样算合格,先写在前头。第二趟对着它交回来的东西挑毛病,预算没算渠道费,人群也写宽了,挑得越具体越好。第三趟最要紧,把每条毛病为什么算毛病说出口。说得出理由的才叫判断,只剩一句感觉不对的,判断就还没长出来。有人会问,我自己眼光也不够,挑不出毛病怎么办。把验收拆小,让它一次只交一小块,你对着成品核事实、核数字,要求逐条对过去,一样一样过。核对就是执行里剩下的那一小块,判断从这里长。

带团队的再加一步,把大家说出口的理由收拢成文,变成下一次派活的要求。判断留在个人脑子里,人一走就跟着走,写进文档的判断才留得下来。三个月跑下来,团队会多出一份越来越厚的验收标准。工具每个月在换,这份标准换了工具照样用。

最后表个态。执行会越来越便宜,这件事基本没有悬念,连基准数据都能改来改去,做出来的作品是改不掉的。判断长在自己身上,长得慢,但是实。往后拉开人和人差距的,大概率就是这块长得最慢的东西。行动从手边开始就行,明天派活,把要求先写成三句话,交回来以后,逼自己说出三条毛病和各自的理由。

这篇对你有用的话,关注「静远AI」,后面接着写 AI 落地里那些真跑通过的事。

【声明】内容源于网络
0
0
静远AI出海
AI SaaS应用开发脚手架项目Fast SaaS的作者。致力于分享各类AI工具和大型模型的使用经验,探索高效的AI应用开发方法,专注AI应用的出海与变现。
内容 429
粉丝 0
静远AI出海 AI SaaS应用开发脚手架项目Fast SaaS的作者。致力于分享各类AI工具和大型模型的使用经验,探索高效的AI应用开发方法,专注AI应用的出海与变现。
总阅读2.1k
粉丝0
内容429