大数跨境

给机器人装视觉大脑:字节跳动UniVR开源,看一眼视频就学会规划复杂任务

给机器人装视觉大脑:字节跳动UniVR开源,看一眼视频就学会规划复杂任务 努力犯错玩AI
2026-07-16
4
导读:大模型还缺一个视觉大脑现在的多模态大模型能看图识字、能问答对话,但有一个核心短板:它们推理和规划的时候,靠的

大模型还缺一个视觉大脑

现在的多模态大模型能看图识字、能问答对话,但有一个核心短板:它们推理和规划的时候,靠的是文字,不是图像。

听起来好像没什么问题,实际上差别很大。人类看到一个物理场景时,可以在脑子里直接"模拟"接下来的操作——比如看到桌上有个杯子,不需要用文字描述杯子的位置、抓取角度、用力大小,就能直接伸手去拿。这种在视觉空间里直接推理的能力,用语言模型做起来就相当费劲,因为文字是抽象符号,天然丢失了空间关系、物理动态、运动连续性的信息。你可以在纸上写"把杯子放在盘子右边",但这句话本身不包含任何视觉信息——杯子多大?盘子多远?空间够不够?

目前的方案通常走的是"看图→转成文字描述→用文字推理→再转回动作"的路线。中间多了一层文字翻译,既损失了视觉细节,又依赖大量图像-文本对来做训练。这导致两个问题:一是模型学到的"物理直觉"不够好,看不懂物体之间的力学关系和空间约束;二是遇到需要长远规划的复杂任务时,文字链条容易断裂,推理到一半就偏离了物理现实。比如让模型规划"把积木堆成三层塔",用文字推理到第三步时可能已经完全忘记了前两步的积木摆放位置。

字节跳动与北京交通大学合作开源的 UniVR-34B-Planning,要解决的就是这个问题。它让模型直接在视觉空间里推理和规划,不需要中间的文字链条。这是第一个从纯视觉演示中同时学习复杂推理、物理动力学和长期规划的框架。论文作者来自北京交通大学和字节跳动,共 10 位研究者。模型已在 HuggingFace 开源,采用 CC BY 4.0 许可。

在视觉空间里推理

UniVR 的核心思路很简单直接:给模型一段演示视频和一个指令,让模型直接生成"接下来该怎么做"的视觉序列,而不是先转成文字再推理。

比如输入一张机器人抓取物体的初始画面和"把红色绳子绑到白色礼盒上,三步完成"的指令,UniVR 不是生成文字步骤,而是直接输出一系列图像帧,每一帧展示当前状态和下一步应该做的动作。模型推理的整个过程都在视觉空间里完成,框架本身不需要任何文字推理链条。

UniVR 统一视觉推理框架

从机器人操控到空间拼图,UniVR 在多种任务上直接在视觉空间中完成推理和规划,无需文字中介

模型的基础架构是 BAAI 的 Emu3.5 34B,一个使用 VQ-VAE 统一编码文本和图像的自回归生成模型。VQ-VAE 把图像编码成离散 token,让模型可以用统一的 next-token prediction 目标来处理文字和图像。UniVR 在此基础上做了两阶段训练。第一阶段是监督微调(SFT),用 31 万条 VR-X 数据集样本做冷启动,让模型掌握视觉推理的基本模式。第二阶段是 VR-GRPO 强化学习,用 3 千条精心筛选的高难度样本优化模型的推理质量。GRPO 是一种不需要 Critic 模型的强化学习算法,在 DeepSeek-R1 等模型中已被验证有效,UniVR 将其扩展到了视觉空间。

VR-GRPO:不只看结果还要看过程

VR-GRPO 是 UniVR 的核心技术贡献。传统强化学习做视觉推理时通常只看最终结果——任务完成了吗?但 UniVR 团队发现,只看结果会让模型走"推理捷径":它可能跳过关键中间步骤,或者虽然任务完成了但过程存在物理不连贯——比如物体穿模、不合理跳跃。这在长远规划任务中是致命的。比如让机器人规划"把物品从左边的箱子搬到右边的架子上",模型可能生成一段序列,结果物品确实到了架子上,但中间帧里物品突然消失然后出现在架子上——这种物理不连贯在任务完成的奖励下不会被惩罚。

VR-GRPO 设计了两个互补的奖励信号来解决这个问题。

全局奖励:一个 VLM 评估器对生成的完整视觉序列做整体评估,判断任务是否完成、视觉质量是否合格。

步级聚焦奖励:这是 VR-GRPO 的创新点。通过对多条推理轨迹做 CLIP 特征比对,识别出模型中"最不确定"的步骤——也就是各条轨迹分歧最大的帧——然后让 VLM 重点评估这些关键步骤的正确性。

最终奖励函数为:R_reason = R_g − λ|R_g − R_s|。这个设计惩罚了全局奖励和步级聚焦奖励之间的差异,迫使模型在每个关键步骤上都保持一致性,而不是只关注最终结果。简单说就是:任务要做完,中间每一步还不能"作弊"。实验表明这种双层奖励机制对长远规划任务的推理质量提升明显。

VR-GRPO 架构

VR-GRPO 结合全局奖励和步级聚焦奖励,通过轨迹间方差分析定位最易出错的推理步骤

VR-X 基准测试成绩

为了训练和评估 UniVR,团队构建了 VR-X 基准数据集,从 16 个不同来源收集了 150 万原始样本,涵盖 6 大任务类别。

六大任务类别

VR-X 基准覆盖的任务范围非常广。视觉引导类数据来自 EgoDex、Action100M、Epic-Kitchen、VideoCraftBench 等数据集,覆盖了烹饪、手工艺、日常活动等场景。机器人操控类数据来自 AgiBot、Droid、Bridge、ZebraCoT-Robot 等,覆盖了机械臂抓取、工具使用、多步控制等操作。编辑类数据来自 ZebraCoT-Multiobject,覆盖对象操作和场景编辑。空间感知类数据来自 ThinkMorph-Navigation 和 ZebraCoT-Embodiment,覆盖导航和空间推理。视觉搜索类数据来自 VisualCoT 和 ThinkMorph-Search,覆盖目标定位和注意力引导。拼图与游戏类数据来自 VRBench、Zebra-Jigsaw、ThinkMorph-VisPuzzle,覆盖迷宫、拼图和视觉谜题。

全面超越基线

在 VR-X 测试集上,UniVR 的成绩非常突出:

       
                                           
任务类别 UniVR 34B Emu3.5 基线 提升
机器人操控 68.0 42.8 +25.2
视觉引导 59.5 38.6 +20.9
拼图游戏 62.2 43.4 +18.8
视觉搜索 64.3 46.2 +18.1
编辑 48.5 32.7 +15.8
空间感知 46.5 35.3 +11.2
整体 58.2 39.8 +18.4
       
     

机器人操控成绩 68.0 甚至逼近了 Gemini 3 Pro + Nano Banana 2 的 67.1。整体提升 25%,在 34B 参数规模下达到这个水平,说明纯视觉推理路线的潜力很大。

UniVR 架构总览

UniVR 基于 Emu3.5 架构,通过 VQ-VAE 统一视觉和文本编码,在视觉空间中完成推理

多模态能力无退化

视觉推理能力的增强没有牺牲模型的多模态理解能力——事实上各项指标还有提升:MMMU 从 0.292 升至 0.337,MM-Vet 从 28.0 升至 35.6,MME(P) 从 781.1 升至 799.3,MathVista 从 41.7 升至 44.0。这说明 VR-GRPO 训练不仅提升了视觉推理能力,还让模型对视觉内容的理解更加深入。

VR-X 训练数据集

UniVR 的两个训练阶段分别使用了 VR-X 数据集的不同子集。SFT 阶段使用约 31 万条样本,RL 阶段使用约 3 千条高难度样本,另有 1.8 千条作为测试集不对外公开。所有样本遵循统一的格式:查询图像 + 文字指令 + 视觉推理轨迹。

VR-X 数据集收集自 16 个不同的公开来源,覆盖的操作场景从日常烹饪到工业机器人操作,保证了任务多样性和难度梯度。数据集本身也在 HuggingFace 开源,供社区进一步研究使用。

模型版本与开源生态

UniVR 有两个版本面向不同场景。Planning 版(当前开源版本)专门针对长远规划任务优化,在机器人操控、工具使用、多步控制等任务上表现突出。General 版则混合了图像-文本数据进行训练,适用于通用的视觉推理任务。两个版本的 VR-GRPO 训练配方共享,差异仅在于训练数据的构成。

模型权重以 CC BY 4.0 许可发布在 HuggingFace,训练代码和推理流程在 GitHub 开源。使用 UniVR 需要准备 Emu3.5 的 VisionTokenizer,权重也需要从 HuggingFace 单独下载。运行环境建议使用 CUDA 12.4 和至少 80GB 显存的 GPU。

适用场景和硬件要求

UniVR 的 Planning 版本专门针对长远规划任务优化。最适合的应用场景包括:机器人操控(让机器人通过观看演示视频学会执行多步任务)、工具使用规划(展示工具用法后让模型规划使用流程)、多步控制任务(需要多个连续动作才能完成的任务)。输入一张参考画面和一段指令,模型就能生成完整的动作规划序列。

对比来看,UniVR 和此前的工作有本质区别。VideoWorld 从无标签视频中学习世界知识,但缺乏明确的推理和规划能力。X-Dancer 之类的舞蹈生成模型虽然也在视觉空间内生成动作序列,但仅限于舞蹈风格的动作,不具备物理推理和逻辑规划能力。UniVR 是第一个同时覆盖推理、物理动力学和长远规划的纯视觉框架。

不过 34B 参数的规模意味着推理需要较高 GPU 显存(建议 A100 80GB 或 H100),不适合消费级硬件。模型专注于视觉推理,不是通用聊天模型。UniVR 有两个版本:Planning 版针对长远规划优化,General 版混合了图像-文本数据适用于通用视觉推理。目前先开源的是 Planning 版本。许可证为 CC BY 4.0,相对宽松,但使用需署名。训练和推理代码在 GitHub 开源,需要配合 Emu3.5 的 VisionTokenizer 使用。

视觉推理的新方向

UniVR 验证了一个重要的技术判断:直接在视觉空间里做推理,可能比语言中介推理更有效。模型不需要把视觉信息翻译成文字,减少了一层信息损失。实验证明这种"视觉思维"在机器人规划和物理推理上确实优于文字链条方案。在机器人操控任务上 25 个百分点的提升,说明纯视觉推理路线的潜力很大。

UniVR 的 Planning 版本专攻长远规划,General 版本则在通用视觉推理上也有竞争力。团队选择先开源 Planning 版本,说明对长远规划能力的重视。视觉推理领域目前还处在早期探索阶段,UniVR 的 SFT + VR-GRPO 训练范式和 VR-X 基准数据集,为后续研究提供了一个可复现的起点。

从技术路线上看,UniVR 思路和此前 VideoWorld(同样是字节跳动的项目)一脉相承——都相信纯视觉信号中蕴含了足够的物理知识和推理能力,不需要依赖文本作为中介。VideoWorld 从无标签视频中学习世界模型,UniVR 则更进一步,学会了在视觉空间中做推理和规划。两条路线最终指向同一个结论:视觉本身就是一个足够丰富的推理空间,语言虽然方便但不一定是必需的。

这种思路如果被后续研究验证,可能会改变多模态模型的设计范式——不再把视觉输入转成文字再推理,而是直接在视觉空间中完成从感知到规划的完整链条。UniVR 是这条路线上的第一个可工作系统。

资源

  • • 项目主页:https://maverickren.github.io/UniVR.github.io/
  • • HuggingFace 模型:https://huggingface.co/ByteDance/UniVR-34B-Planning
  • • VR-X 数据集:https://huggingface.co/datasets/ByteDance/VR-X-SFT-RL
  • • 代码:https://github.com/MaverickRen/UniVR
                 

【声明】内容源于网络
0
0
努力犯错玩AI
为AI开发者打造HuggingFace国内镜像站,提供最新流行开源模型资讯并免费加速下载。更多内容请访问https://aifasthub.com
内容 274
粉丝 0
努力犯错玩AI 为AI开发者打造HuggingFace国内镜像站,提供最新流行开源模型资讯并免费加速下载。更多内容请访问https://aifasthub.com
总阅读1.6k
粉丝0
内容274