大数跨境

FLUX开放机器人模型,视频AI走向真实操作

FLUX开放机器人模型,视频AI走向真实操作 羽飞智能
2026-09-27
2
导读:视频模型开始接上机械臂。FLUX新模型与mimic工业实验展示了两条路线,但仿真榜单、真实部件测试和连续生产,仍是不同的考题。看懂数据前提,才能判断离稳定干活还有多远。

点击上方蓝字「羽飞智能」关注我们

AI洞察 · 第16期|2026年9月27日

生成一段机械臂抓取零件的视频,与让机械臂抓住零件,面对的是两套检验标准。前者看画面是否连贯,后者还要看物体有没有滑落、零件有没有放对、失败后能不能停下。如今,做视频模型的团队正在尝试跨过这段距离。

9月23日,Black Forest Labs在官网发布FLUX 3 Action,开放了一个70亿参数的世界动作模型。同日,mimic发布由其研究人员和宝马集团人员共同署名的工业操作研究。两份材料把一个问题摆到台前:视频中学到的知识,能为机器人操作提供多大帮助。

视频里学到的,怎样变成手上的动作

可以把这条路线理解为先积累对动作和场景变化的认识,再学习如何让具体机器完成操作。一个杯子被推到桌边,接下来可能发生什么;手指换一个位置,物体会怎样移动。视频提供连续画面,机器人数据则把画面与机器执行的动作对应起来。这个比喻帮助理解训练思路,并不表示模型掌握了可靠的物理定律。

按BFL的技术报告,FLUX 3 Action基于多模态模型,通过视频与动作的联合训练,预测未来画面及机器人动作。摄像头观察、机器人状态和文字任务成为输入,输出中包含接下来要执行的一组动作。它仍需适配目标机器及其动作定义,不能只凭下载模型就控制任意设备。

在这件事上,大量普通视频和少量机器人示范各有作用。普通视频可以提供丰富的物体、场景和变化过程;操作示范补充某台机器“看到这种情况应当怎样动”的对应关系。视觉资料不能凭空补出夹爪的实际开合范围,也不能替代机器的标定。

依据BFL模型卡与运行文档整理的流程示意;不是模型实测画面。

同一基础模型可以衍生不同控制方式。此次FLUX 3 Action研究联合预测视频与动作;mimic的工业研究则利用视频模型的内部特征生成动作,实际推理时无需把完整视频播放出来。两者共享技术方向,但不是同一套机器人产品,不能把一方的实验成绩直接贴到另一方。

榜单第一,先看考了什么

截至9月26日查阅,RoboLab公开榜单中,FLUX 3 Action的总体成功率为42.9%,排在该页面首位。这个数字来自1200次测试中的515次成功。榜单按任务难度拆开后,简单、中等和复杂任务的成绩并不相同。排名回答的是同套测试里的相对表现。

RoboLab公开榜单,2026年9月26日查阅。为仿真测试成功率,不是工厂产线合格率。

RoboLab是仿真评测平台。它把场景布置、语言指令和机器人设置组合成任务,也允许改变光照、相机位置、纹理等条件。其测试库包含120项任务,覆盖视觉识别、物体关系理解和操作步骤等能力。这类平台的价值,在于让不同模型面对可重复的题目,方便发现能力差异。

但一次测试“成功”的定义,与一条生产线的验收方法不一样。把物体移到指定位置,可以构成一道完整考题;在工厂里,位置偏差、零件表面损伤、完成时间、上游供料和下游接料,都可能影响这一轮操作是否合格。榜单不能替现场把这些条件补齐。

同样,42.9%不宜写成“机器人只能干成四成的活”,也不能因为排名第一就写成“已经可以替代熟练工”。它描述特定任务组合、指令和测试设置下的结果。更有信息量的追问,是模型在哪些任务上失误,以及这些失误是否出现在准备部署的工作中。

这也解释了为什么总分之外需要看任务分布。一个项目只做规则零件的固定位置摆放,与一个项目需要整理线束和软材料,对能力的要求不同。技术选型需要回到具体操作,不能仅凭模型总榜高低安排采购和上线。

真实零件实验,给出了另一种证据

mimic的9月23日研究使用汽车制造相关部件,在两种双臂平台上分别训练和评估。公开任务包括控制单元装配、工装插入、软部件归槽和线束布置。这里有真实机器人和真实部件,但仍应按研究实验理解。

mimic官方研究视频预览图|上:工装插入;下:线束布置。来源为9月23日研究,非本文拍摄或实测。

其中,Franka平台的软部件归槽实验使用2小时带动作标注的示范时,成功率为77.5%;增加至8小时时为95%。每个配置评估40次。这些时长只计算动作示范,不包含基础模型此前的预训练。把它概括成“训练两小时就能上岗”,会省掉关键前提。

数据为mimic研究中的单项软部件归槽实验;2小时与8小时指示范资料时长,不是机器训练耗时。

这组结果支持一个有限而具体的判断:在该实验中,已有视频模型基础的机器人,可以利用较少的任务动作数据学习操作。它没有证明所有新零件都只需要相同的数据量,也没有给出每家工厂都能照搬的成功率。文中所说的95%,应连同任务、平台和测试次数一起保留。

若把这类研究推进到生产验证,还需要把单次失败展开记录。没有夹住、放错位置和损伤零件,后果并不一样;自动重试、人工扶正和整批返工,耗时也不同。平均成功率相同的两个系统,实际使用成本可能相差很大。单看一段流畅演示,无法分辨这些差异。

截至查阅时,mimic研究页的论文下载入口仍标为待提供,现有证据主要是团队说明和演示,尚不能据此判断长期生产表现。

看得准,还得来得及重新看

机器人控制也有时间问题。物体已经移动,系统若继续执行旧计划,即使原先的判断正确,也可能错过抓取位置。规划多久、执行多久、什么时候再观察,需要一起设计。

BFL运行文档给出的DROID默认设置,是预测32个动作,以15Hz执行,执行段约2.13秒后重新规划;这段时长还不包含计算时间。新观察用于下一段计划,不会自动改写已经排队的动作。官方也提醒,同步推理可能耽误控制时点,需要在实际环境测量。

这使得“模型跑得快”有了几个不同含义。一次计算用时短,描述的是推理耗时;一段预测能覆盖较长动作,描述的是规划范围;零件更快完成搬运,还涉及机械运动及等待。三者不能互相代替。报告中的加速倍数若没有注明比较口径,很容易被误读成产线节拍提升。

例如,固定料盘上的静止零件,与持续运动的传送带,需要的更新频率可能不同。更频繁地观察有助于及时调整,同时也带来计算、通信和控制衔接的要求。这里的比较是工程分析,并非本文对FLUX在传送带上的测试结论。

“机器人会重新看一眼”也不是完整的失败处理机制。现场仍需明确什么时候继续尝试、什么时候停止、由谁接管,以及接管后怎样恢复状态。动作模型给出建议动作,应用系统负责把它放进可控的执行过程。

开放权重之后,仍有一套系统要接起来

BFL同时提供DROID和SO-101等模型包。SO-101模型卡规定了场景与手腕两路相机、状态和动作维度,以及需要随模型加载的归一化资料。这些要求表明,接口本身就是模型使用条件的一部分。

同一张图放错相机位置、关节单位不一致,或者换用另一种夹爪,都不能按普通软件“换个输入文件”的方式处理。现场工程需要核对传感器、机器人状态和动作输出之间的对应关系,再考虑任务适配。

模型卡还明确说明,模型输出本身不限制关节速度、力和工作空间;应用必须负责这些边界并保留停止手段。开放权重降低了研究和适配的入口门槛,整机保护、工位约束和异常处理仍要由部署系统承担。

硬件预算也不能仅由“70亿参数”推算。官方运行文档给出约32GB显存的BF16推理参考,同时强调实际峰值受模型版本、输入分辨率、编码器和编译设置影响。这是推理口径,不能拿来当训练预算。不同来源的显存数字若设置不同,不宜直接比较。

许可证同样需要逐项确认。模型权重、代码和所依赖组件可能使用不同条款;可下载不等于没有使用条件。本文不把开放权重写成免费、无门槛的商业部署方案,也没有在本机安装模型或连接机械臂。

变化会传到哪几类公司

这条技术路线牵动的环节很多。上游需要可用的视频、动作记录、存储和计算;中间是基础模型与动作学习;下游是机械臂、相机、夹爪、控制器与工位集成。模型能复用得越多,前期训练的价值越可能被多个任务分摊;现场差异越大,适配和验证的工作越难省略。

公开材料已经呈现出这种协作:BFL提供模型,mimic研究机器人操作,实验使用Franka与Trossen平台,NVIDIA提供所用计算生态中的一部分。BFL模型卡还列明文本编码器来自Qwen3-VL-4B-Instruct。这些是技术组件与参与关系,不代表各家都已取得新增订单或确定收益。

对硬件和集成团队,可能增加的是任务采集、接口适配、现场测试与维护工作;也可能承受模型快速迭代带来的重新验证成本。对模型团队,复用基础能力有利于扩展应用,但能否减少每个新工位的调试,仍要靠项目结果证明。这里的机会与负担往往同时出现。

对准备尝试的工厂,一个务实起点是挑出边界清楚的单项任务:部件与工装可追溯,异常可恢复,现有人工流程能够作为比较基线。验收时同时记录一次成功、返工、人工介入、零件损伤和完成时间,再比较更换部件或调整场景后的表现。

FLUX这次公开的工作,让视频模型与机器人操作之间多了一组可研究的模型和证据。接下来能否进入更多生产环节,取决于现场记录:换一批零件后能否稳定完成,出错后能否恢复,以及持续运行需要多少人工照看。

资料依据:Black Forest Labs、mimic(9月23日发布);RoboLab榜单、BFL模型卡及运行文档(9月26日查阅)。研究、仿真与官方演示按各自口径区分,本文未作产品或产线实测。



【声明】内容源于网络
0
0
羽飞智能
1234
内容 98
粉丝 0
羽飞智能 1234
总阅读27
粉丝0
内容98