大数跨境

Jev开始看见世界!复旦团队开源视觉决策模型

Jev开始看见世界!复旦团队开源视觉决策模型 智猩猩AI
2026-09-28
2
导读:视觉决策快到飞起~
智猩猩AI整理
编辑:没方

现在的大模型能力已经很强,但很多时候,我们并不需要模型写一大段答案,只需要它看清楚当前发生了什么,然后快速做一个决定。


比如游戏 Agent 判断下一步往哪走,GUI Agent 判断一个弹窗该继续还是关闭,机器人看到障碍物后决定下一步动作。


如果每一次这样的“小决定”,都要让大模型先看图,再逐 Token 生成文字,最后由程序解析它到底选了什么,整个过程难免有些绕。


前段时间,TypeSafe AI 发布的 Jev 就在尝试解决这个问题。


它提出了一类被称为 System One Model 的模型:不再以生成文本为主要目标,而是根据输入信息,直接输出程序可以使用的结构化概率决策。不过,Jev 此前公开展示的重点仍然主要是文本和结构化状态。


最近,复旦大学研究者开源了 Valen(万澜),把这套思路进一步扩展到了视觉世界。



将图片、视频输入模型后,Valen 不需要先生成一段解释,可以直接在候选动作中做判断,并给出对应概率。


Valen 模型基于 Qwen3.5-0.8B / 2B 构建,模型架构如下:


Valen 架构:多模态输入和候选经过 Qwen3.5 骨干、额外的共享决策头和 softmax,得到 Choice、Noul 或 Score 输出。


官方展示的推箱子 Demo 中,2B 模型直接读取棋盘图像,用 9 次决策完成关卡,累计决策耗时仅 1.13 秒。


Valen-Preview-0923 与 Qwen3.8-27B-FP8 的 no-thinking 和 thinking 模式并排对比。

如果暂时不想折腾本地部署,也可以在线体验。

Valen 已经在 Hugging Face Space 上放出了在线 Demo,上传一张图片、输入问题,再给出几个候选答案,模型就会直接返回它的选择和对应概率。


01

让模型在看不清时学会“犹豫”


Valen 把 Jev 这种带概率的结构化决策扩展到了视觉场景。


项目方还专门做了一个图像模糊实验。在清晰图片上,Valen 的决策置信度为 91.6%;随着高斯模糊不断增强、视觉细节逐渐丢失,最强模糊条件下置信度下降到了 19.2%。


Valen-Preview-0923 action probabilities and decision confidence across nine measured levels of Gaussian image blur.


这对 Agent 很重要。现实中的自动化系统,最怕的就是在信息不够清楚时,仍继续执行动作。


如果这种 confidence 能较好地反映模型的不确定性,程序就可以围绕它设计第二层逻辑:高置信度时直接执行,置信度降低时重新截图、调用更大的模型,甚至转交人工处理。


02

使用教程


根据官方技术文档,运行环境要求为 Linux、Python 3.10+ 和 NVIDIA GPU,核心依赖包括 PyTorch 2.6.0、torchvision 0.21.0、Transformers 5.4.0 和 PEFT 0.18.1。

git clone https://github.com/Liuziyu77/Valen.git Valencd Valenbash scripts/setup/bootstrap.shsource .venv/bin/activate

依赖安装完成后,需下载模型权重。

# 下载 Qwen3.5-2B Base 模型。hf download Qwen/Qwen3.5-2B --local-dir models/Qwen3.5-2B
# 用随仓库提供的合成样本训练决策头。python -m valen.train \  --config configs/train/qwen/sft_warmup.json
# 加载训练得到的 checkpoint 进行推理。python -m valen.inference \  --checkpoint output/sft_warmup/latest \  --data data/smoke/train.jsonl \  --output output/sft_warmup/predictions.jsonl
# 用同一组合成样本检查评估流程。python -m valen.evaluate \  --checkpoint output/sft_warmup/latest \  --data data/smoke/train.jsonl \  --output output/sft_warmup/smoke_eval


当前 Valen 支持 SFT 和 RLCD 两种训练 method,stage 决定更新哪些参数,当前支持四种 stage 配置。


03

当AI开始需要“快判断”


在软件、机器人和 Agent 背后,其实存在大量高频、细碎的判断,页面是否加载完成、机械臂是否该停止、当前画面是否异常、下一步该调用哪个工具。  


这些任务不需要模型长篇解释,而需要快速、稳定、能直接被程序执行的决策。  


这类 System One 视觉决策模型,未来或许会成为 Agent 的“反射弧”。大模型负责规划、推理和长程任务,而像 Valen 这样的模型,则负责大量高频、实时的小决策。

END


关注+星标,获取AI前沿进展与开源一线动态

【声明】内容源于网络
0
0
智猩猩AI
智猩猩旗下AI技术内容账号,关注AI大模型掀起的范式革命,追踪AI大时代涌现的开源项目。
内容 2386
粉丝 0
智猩猩AI 智猩猩旗下AI技术内容账号,关注AI大模型掀起的范式革命,追踪AI大时代涌现的开源项目。
总阅读5.1k
粉丝0
内容2.4k