大数跨境

GPT-6 Astra 炸出了一堆具身智能从业者

GPT-6 Astra 炸出了一堆具身智能从业者 知乎AI先行者
2026-09-15
9
导读:会把具身智能逼回旧石器时代吗?

9 月 3 日,OpenAI 发布了新一代模型 GPT-6 Astra。模型发布后,Astra 很快被接进机械臂和机器人,开始画画、抓取、骑车、搬东西……

如果一个几乎什么都懂、还能自己使用工具的大模型开始理解三维空间、调用机器人,那么「具身智能」还需要自己解决什么?

有人觉得这是具身智能的「原子弹爆炸」,也有人认为真正困难的机器人控制、实时反馈和物理世界交互远没有被解决。

 讨论问题:

 GPT-6 Astra 会给具身行业 

 带来哪些影响?

一批一线从业者被炸了出来。





行业同仁原子弹爆炸,眩晕瘫坐合集大赏

@YY硕

妙动科技联合创始人兼CTO



GPT-6 Astra 直接操作机械臂

GPT-6 Astra 自动数据标注

GPT-6 Astra 自动操作机械臂画画

GPT-6 Astra 设计绳驱手

GPT-6 Astra 控制仿真中的宇树机器人写字

GPT-6 Astra 给人类动作数据做手部姿态标注

GPT6-Astra 控制宇树机器人骑自行车

GPT6-Astra 控制宇树机器人胯下运球

GPT6-Astra 控制宇树机器人搬运灯架

GPT6-Astra 控制宇树机器人颠球

在写作这篇文章的时候我一边写一边和 GPT-6 Astra 语音对话来优化自己的仿真器,而我的同事们正在把 GPT-6 Astra 接到人形机器人上。相同的事情应该发生在任何公司中。

我们来做几个预测:

  • 物理和图像仿真、几何和图形生成行业大部分创业公司必须要转型发展具体业务,光提供工具的公司会很快死掉。

  • 两个月内我们应该能看到某个公司发布人形机器人带着Astra这样水平的Agent走来走去做很有用的家务。

  • 6个月内各个AI模型公司的模型的空间理解能力会逐步增强。开始会有人谈论一种新的模型Spatial-Language-Model (SLM),把原本Vision-Language-Model(VLM)的空间理解能力大幅提升。

这个发展速度下很快具身智能公司之间比较的就是系统化集成模型和硬件的能力了,单独拿出某一个模型的技术或者数据标注算法已经没有任何竞争力。






GPT-6 Astra 把具身智能的问题推回到旧石器时代早期。

@张宏毅

破壳机器人资深科学家



以下只谈科学和技术。对产品落地、融资上市的影响本文不涉及。短的结论:GPT-6 Astra 把具身智能的问题推回到旧石器时代早期。

什么意思?意思是旧石器时代早期之后新发展出的人类智能所能解决的问题,GPT-6 Astra 已经基本解决了。不仅有能力解决,而且已经比绝大多数现代人在绝大多数事情上做得更快更好。但是,GPT-6 Astra 的能力无法帮助到一个生活在旧石器时代早期的古人类。

旧石器时代早期是人类进化史上非常重要的漫长阶段,目前一般认定从距今约三百万年的人类祖先开始使用石制工具起,经过奥都万文化(Oldowan / Mode I)和阿舍利文化(Acheulean / Mode II)两代石器制造技术演进,到距今约三十万年以预制石核技术为代表的莫斯特文化(Mousterian / Mode III)出现为终结。这一时期的人类祖先还没有发展出语言和文字,通常认为需要通过手势和动作模仿,来实现共同注意、动作示范、纠错反馈等教学意图。

在旧石器时代早期遗址的考古发现中,常常出现手斧(handaxe)这一工具。手斧的形状一端适合抓握,另一端较尖锐,边缘较锋利。它在当时可能被用于切割、劈砍、挖掘、狩猎、工具制作等多种用途。

一个典型的阿舍利手斧。正面/侧面/反面。来源:维基百科

推荐一位博主,带你还原古人类的石器制造过程(https://www.bilibili.com/video/BV1wLxoenEqs)。

阿舍利手斧的制造工艺看似不难,实际需要经过相当长时间的教学、模仿和练习,才能熟练掌握。现代实验中,学习阿舍利晚期手斧制造需要几十乃至上百小时实践。在这个过程中,涉及一系列不同认知环节的学习和适应。

来源:GPT-6 的总结

其中有一些环节,比如「看懂任务」、分析石头的特征、规划手斧制造过程,属于语义层面和视觉理解层面的问题,在 GPT-6 Astra 的能力范围附近。而」可靠地敲下一片「、「速度-精度控制」、「熟练化」这些具身操作的学习,目前仍然是数字世界 AGI 和具身模型遥不可及的能力。

在 2018 年的知乎回答中,我曾经总结「机器还没有广泛地把知识抽象化的能力」作为机器智能与人类智能的最重要区别,没想到 8 年之后彻底被打脸。现在机器智能与人类智能的最重要区别,已经只剩下人类早在旧石器时代早期就具备的操作物理世界的智能。

数字世界的 AGI / ASI 已经不太遥远,但它必须结合一种早在旧石器时代早期人类就发展出的智能,才能成为物理世界的 AGI / ASI。而它们的结合将如同石器制造、文字发明、工业革命,标志着人类文明下一阶段的起点。





仿真数据公司的价值在大幅降低

@Flood Sung

北京十六号机器人科技CEO









具身的未来一定不会是傻大黑粗的 Astra

@刘斯坦

晴岚视界联创CTO



没有任何影响。

作为具身智能数据从业者,还在几个月前,我就遇到了数个美国 AI 大厂的数据单子,数据的需求对于不懂的人而言大概觉得很无厘头,但懂的人一看便知他们想训练什么模型。人家就是精准的针对三维空间理解在全世界大量求购数据。按他们这个搞法,大模型理解三维空间是迟早的事,所以 Astra 的出现我一点不奇怪。未来某个版本能输出机器人动作了,能输出未来世界的 rollout 了也请你不要激动好吗,因为人家正找我买人类数据呢。

事实上,智驾领域也早就实验过微调大模型让他直接输出轨迹坐标……能 work

微调大模型输出物体检测框坐标,也能 work

现在的大模型,内部结构高度稀疏,专家化符号化,以至于塞一些新任务他都能在避免灾难性遗忘的前提下学会。

以后大模型不但是语言的基模,也会是视觉的基模,如果我们再使使劲,搞不好会变成音频基模,触觉基模……一个一个模态的感知和理解都会被干掉。以后这些模态的感知任务直接蒸馏大模型,用大模型打标就完事了。Token 变专有模型,丝滑得很。

未来的某一天,LLM 变成了 LLM + DepthAnything + SAM + blabla,看起来多么像我们的大脑!那么多专家脑区,负责触觉的,听觉的,视觉理解,三维空间的脑区。

但大模型和人脑存在一个本质区别,基于梯度下降和反向传播的训练让大模型的「脑区」无法相对独立的不同频运作,他每次推理都是从头到尾。即便我们有所谓稀疏激活,专家 Route,也没办法真正对各个专家和「脑区」符号化。

但具身不是这么一回事。具身的关键在于机器和环境,和物体的多频率交互。长程多任务的规划需要长时间思考,极低频率的反馈,你收拾个卧室,规划几分钟都有可能。

单任务的执行如果是「肌肉记忆」,那基本不用过脑子,如果不熟悉,那就要稍微回忆几秒,如果没做过,那就得现学,所谓 ICL(In Context Learning )

而一个 WBC 的运控模型要让机器人站稳,需要极高频率的瞬时反应,反应频率高达 50Hz。你伸手去托住一个倾倒的奶茶,一定是快速扶住并调整姿势,手要对奶茶杯的物理属性和运动学特性进行高频反馈才能扶住不倒。

所以,具身的运作,是不同频率的多个脑区加上脊髓反射紧密配合才能达成。

空间理解,我专门训练一个模型,我哪怕从大模型里蒸馏,也比大模型更快,更精确,信息更丰富。而延迟可能只有大模型的百万分之一。

所以大模型再厉害,也解决不了具身的问题,具身需要的不是花一百块钱夹几个东西,画一幅画。这些都是通过不停的检查状态,不停的反馈,和目标状态比对就能做到的。你再把触觉信号加进去,告诉大模型每一步各个部位的力,我敢保证大模型也能理解,完了我们是不是可以欢呼大模型解决触觉问题了?

具身还是应该从人脑学习,一定是精巧,模块化,分层化,多频率,甚至变频,事件驱动的精密结构。从而用极低的能耗完成极复杂的任务。

具身的未来一定不会是傻大黑粗的 Astra

相反,大模型未来反而可能会变成具身应该成为的样子,简单任务和复杂任务的延迟差别达百万倍,搭配 6G 之类的技术,才有可能实现具身 AGI






不必把这些演示直接理解为「机器人技能学习已经被解决」

@fly qq

机器人行业从业者



我认为可以将其作为这样的问题来探讨:

一个精通几乎所有领域知识,能看、能说、能远程使用你的电脑的人,会给具身行业带来哪些影响?

两位顶尖的助手

我一直在深度使用国内外的各种大模型,将其用于各个方面。顶尖的大模型在知识广度、逻辑能力等方面,已经比绝大多数人都更强了,而且,会持续、快速地继续变强。而 Harness 的发展(如 codex),将模型、工具、执行环境和反馈组织起来,让模型能持续推进任务,使其从「聊天工具」开始演变成能对「数字世界」产生影响的 Agent。如果能为大模型提供合适的「工具」,Agent 从数字世界走向物理世界是必然的。

GPT-6 Astra 出来后,网上也有很多将 GPT-6 Astra 用于机器人的尝试,包括直接输入图像,输出机械臂末端空间位置进行画画、抓取物体等。甚至有从业者声称「Astra is the new VLA. VLA is dead.」

GPT‑6 Astra on robotic manipulation (https://openai.robocurve.org/gpt-6-astra/)

不过,我认为不用过度「神话」这些故事,不必把这些演示直接理解为「机器人技能学习已经被解决」。更强的视觉、空间推理和任务规划能力,确实可能让通用模型完成过去做不好的机器人任务,但在机器人自身「技能」学习层面并没有带来太多直接的提升。

前几天,我也在另一个问题下讨论了大模型与机器人原生模型对于具身智能领域的意义。短期内,基于大模型的 Physical Agent,调用机器人自身技能(可能来自于数据学习、也可能基于物理建模算法)会是机器人落地的可行路径。

具身智能会走向「把大模型装进机器人」,还是「机器人原生智能」?

但是,也不应该过度「轻视」这些故事,回到我最初的假设,如果将大模型看作是一个精通几乎所有领域知识,能看、能说、能远程使用你的电脑的人,更强大的大模型确实会对「具身」领域产生不小的影响。

我想到几个方面的影响,分别说说:

1. 对于 VLA 等具体的「具身」技术而言

没有深入具体场景,停留在「视觉」、「动作」的工作将变得没有意义:大模型已经能比较好地理解任务与空间关系(当然,当前在姿态方面可能还不够),动作只需要输出末端夹爪的空间位置指令;那么,一个视觉、语言理解能力远远弱于这些大模型的工作就会显得不够打了,只能在特定任务场景下过拟合出动作。

而深入到具体场景,已经在机器人构形、传感器、甚至是任务工艺方面做了很多积累的工作,短期内不会被大模型覆盖。

同时,面向「机器人」做所谓通用大脑的工作会陷入进退两难之境:

  • 进:模型规模、能力、算力资源难以跟大模型公司竞争;当前在具身模型本身的架构上也并没有太多区别于大语言模型的创新,被顶尖大模型降维打击是必然的。

  • 退:距离场景太远,而且一旦收缩到具体场景,针对具体场景训练特定机器人技能模型,就会面临「估值」与实际「市场规模」不匹配的困境。

2. 对 Physical Agent 的技术路径而言

由于模型具有了更好的视觉理解和代码能力,那么,通过代码来控制机器人会变成机器人落地更加可靠的路径。例如,我在上面回答中提到的,大模型直接查资料、写代码、训练控制策略完成插拔显卡等工作的ENPIRE;或者直接在仿真里通过强化学习机器人的运动策略。

大模型不一定要亲自承担实时控制。它也可以查资料、编写控制程序、设计训练方案,再通过实验反馈不断修改,最终得到能够独立运行的机器人技能。对机器人而言,这可能比每一步动作都等待大模型推理,更值得期待。

3. 对机器人控制策略学习而言

如前所述,有一些「身体」技能,由于对传感器的特殊依赖、实时性要求等原因,可能需要依赖于机器人自身的小模型进行处理。大模型不一定适合直接进行控制,但是,因为其具有了更强的视觉和理解能力,大模型有希望成为一个很好的训练监督者与策略评测者的角色,参与设计奖励、标注数据、分析失败、辅助评价。


当你的机器人训练完只会蹲着走的时候,让大模型帮你改改激励函数

4. 对于开发者而言

这可能是影响更加深远的部分,将顶尖的模型用于引导开发者了解和学习新的技术、跟开发者讨论可能的方案、编写实验测试代码等方面,将大大拓宽每一个开发者的能力边界。而且,这个助力是并行的,同时加速全球成千上万的研究者,从宏观层面,可能是对具身行业更加影响深远的。





实测,场景理解,复杂推理,长程记忆等等任务应该交给现在已经足够强大的大模型来处理。


@学徒

具身智能从业者




我更看好它对研发流程和上层任务执行的影响。至于它能不能让机器人在真实环境中更可靠地完成长任务,还需要接入硬件之后再判断,不能直接拿软件环境里的表现代替实机结论。

@戴晓天

英国约克大学副教授



自发布以来,没日没夜深度使用了几天 GPT-6,用光了四次 usage limits。总体感受还是非常正面的,不过如果把问题具体到具身智能,我更看好它对研发流程和上层任务执行的影响。至于它能不能让机器人在真实环境中更可靠地完成长任务,还需要接入硬件之后再判断,不能直接拿软件环境里的表现代替实机结论。

先说我实际用下来比较明显的几个变化,以及为什么我认为它们和具身行业有关。

长程任务能力是这次让我印象比较深的地方。我最长的一个任务跑了整整 12 个小时,探索能力也有进步,可以自己发掘代码瓶颈,试错改进。当然了,「跑了 12 小时」和「高效完成了 12 小时的有效工作」是两回事,单纯运行时间长也不能证明能力强。真正值得关注的是,在任务持续推进的过程中,它能否围绕原来的目标工作,利用中间结果调整方法,并且减少需要我重新解释上下文、指定下一步的次数。从我的使用感受来看,这方面确实有改善。

这对具身智能的潜在意义,在于真实任务通常需要连续处理多个相互依赖的步骤。比如让机器人整理工作台,实际涉及理解目标、识别物体、安排顺序、调用已有技能,以及在抓取失败或者物体位置变化后重新规划。如果大模型能够更稳定地维护任务状态、分析失败原因,并调用合适的工具或技能,就有机会承担更多上层协调工作。不过,我目前还没有测试 Astra 在机器人上的表现,这部分是基于软件使用体验的推断。代码出错可以回滚,机器人碰倒东西以后,任务条件本身就已经改变了,两者的试错成本也完全不同。

工具操作能力的提升也很明显。我自己试用了 Blender 建模和动画场景生成,这也是网上博主讨论比较多的一个方向。实际使用下来,没有别人演示得那么惊艳,但在只给定有限提示词的情况下,确实已经能做出一些初步可用的动画场景。我更在意的是,这意味着可以把一部分原本需要自己逐项操作的工作交给模型,再根据结果修改,降低从想法到初版场景的成本。

放到具身研发中,这种能力很容易让人联想到仿真场景构建:搭建房间、摆放物体、调整相机和光照,以及批量生成不同布局。如果这些步骤可以通过自然语言和脚本协同完成,小团队就有机会用更少的人力覆盖更多测试条件。但这里需要区分「看起来像一个场景」和「能够用于机器人训练或验证的场景」。物体尺寸、碰撞模型、质量、摩擦参数、关节约束和传感器配置,都可能影响仿真结果。能用 Blender 生成动画,只能说明场景制作中的一部分工作可以被自动化,后续还需要验证物理设置和任务适用性。

另外,我还用它把几个一直没时间整理的二手物品发到了 eBay,全程很少干预,很多步骤可以自主推进。这件事本身和机器人没有直接关系,但它让我更直观地感受到,模型正在具备把一个笼统目标转化为一系列工具操作的能力。具身系统同样需要这种能力,只是工具从网页和软件变成了感知、导航、抓取等模块,而且每次调用都需要满足具体的执行条件。浏览器任务做得好,对机器人上层任务编排是一个积极信号,但仍然需要检验它能否正确理解物理状态和动作后果。

Research 能力也有提升。在我的使用中,它会多次核对数据来源,能找到比较新的信息,现在我也拿它每天做美股行情日报。这只是个人使用观察,并不代表它已经解决了事实准确性问题。尤其需要注意的是,多个网页可能转述同一个来源,找到几篇说法一致的文章,不等于获得了几份独立证据。模型是否真的读懂原始材料、有没有混淆时间和适用条件,仍然需要抽查。

对应到具身研发,这部分能力可以用于整理论文、查阅设备文档、比较实现方案,以及根据报错和日志寻找可能原因。例如,一个机器人任务失败,问题可能来自感知、坐标变换、通信、规划或者控制,开发者需要在不同模块之间追踪。如果模型能够把文档、代码和运行记录结合起来,提出可验证的排查步骤,就可能节省不少调试时间。这里的价值最终要落到「能否帮助定位并修复问题」,需要让后续实验检验它提出的解释。

代码分析、网页设计和自我纠错能力的提升,也让我比较满意。网页设计终于开始考虑一些设计美学了;代码方面,我已经让它把自己 GitHub 上的一些工程整体重构了一遍,大概 80% 的情况符合预期。这个比例只是我的主观使用感受,不是严格统计的成功率,但已经足以让我愿意把更多工程任务交给它,再集中精力审查关键修改。

我认为这可能是它对具身行业最快产生实际价值的地方。机器人项目里有大量接口适配、数据处理、实验脚本、日志分析和可视化工作。这些工作单独拿出来未必复杂,组合起来却很耗时间。如果模型能够承担更多实现和维护任务,研究人员就可以更快地把一个想法接入现有系统,并完成一轮实验。对小实验室和初创团队来说,这种工程效率的提升很有吸引力,因为它直接影响同样的人力能够尝试多少方案。

不过,机器人软件的验收条件也需要跟上。一次重构即使功能测试通过,也可能改变执行时间、资源占用、消息处理顺序或者异常处理方式。对有实时性要求的系统来说,运行结果正确只是其中一部分,还要知道它是否在规定时间内完成,以及负载增加或通信异常时会怎样。因此,模型越能大规模修改代码,就越需要配套的回归测试、时间测量和实机验证,否则省下来的编码时间,可能又在集成阶段花回去。

视觉相关工作流也有进步。我引导它借助 SAM3 做了一些数据自动标注,效果还是可以的。这里更准确的说法是,它组织和调用视觉工具来完成任务的能力有所提升;标注效果中有多少来自 SAM3、有多少来自大模型的任务组织,需要分开看,不能全部归因于 Astra 自身的视觉能力。

对于具身项目,可以进一步尝试让它串联数据筛选、标注生成、格式转换和质量检查,减少人工反复操作。但自动标注要真正有用,还需要关注漏标、遮挡、类别歧义,以及连续帧之间是否一致。我的期待是让模型先完成大量重复工作,再把不确定的样本集中交给人检查。这样是否划算,可以用审核后的标注质量和实际节省的工时来衡量。

把这些体验放在一起,我目前的判断是,Astra 很可能先在具身研发的各个环节中产生价值:帮助搭建场景、整理数据、修改代码、排查问题,再逐步承担更复杂的任务编排。如果这些环节都能减少人工干预,一次实验从提出想法到获得结果的周期就有机会缩短。这种变化未必像机器人演示视频那样直观,却可能更早影响研发效率和团队的能力边界。

真正接入机器人时,我会更关注它和现有系统如何分工。一个值得尝试的方案,是让它负责目标理解、任务分解和异常分析,通过明确的接口调用已有技能;涉及运动执行、动作约束和安全停止的部分,则由能够验证的控制与安全机制承担。长程任务能力的提升值得期待,但「能持续思考很久」和「能在规定时限内可靠响应」是不同的能力,不能因为前者进步,就默认后者也已经满足要求。

下一步就是把它接入实验室的机器人,看看能有什么有趣的应用。我尤其想观察的是:环境变化以后,它能否正确更新判断;某一步失败以后,能否选择合理的恢复方式;信息不足或者超出能力范围时,能否停下来请求帮助。同时还要记录任务成功率、人工接管次数、完成时间和调用成本。只有这些结果也有改善,才能把目前的软件使用好感,进一步转化为对其具身应用能力的判断。




阅读更多

机器人做的麻婆豆腐,科技含量格外高吗?丨对谈破壳机器人许华哲、薛峥嵘
AI 公司是在拿全人类命运下注吗?大家在知乎认真吵起来了
陶哲轩邓煜等25名数学家到底反对 AI 的什么
对谈王乃岩丨离开小米,下一站之前聊聊自动驾驶与 Physical AI

🚀 AI 产品扶持计划:

知乎为 AI 产品提供定制宣发支持,了解/报名请戳:知乎「AI 新品非正式发布现场」扶持计划

🚀 知乎 AI 社群:

如果你对 AI 共识、AI 活动感兴趣,欢迎扫码加入知乎社群↓,我们将每周送上知乎 AI 周报,分享社区内的 AI 讨论与共识,并不定时送上 AI 各类活动报名。








知乎AI情报站








让一部分开发者先走起来

🚀 知乎科技账号正式登陆 X:

👉 https://x.com/ZhihuFrontier,聚焦「技术 × 观点」的跨语境对话。



🚀 知乎 AI Works 项目广场:

👉🏻 https://www.zhihu.com/project-square,上传你的 Vibe Coding 项目,在知乎遇见更多可能。

【声明】内容源于网络
0
0
知乎AI先行者
在智能之海寻找信标,航向未来。
内容 195
粉丝 0
知乎AI先行者 在智能之海寻找信标,航向未来。
总阅读2.3k
粉丝0
内容195