大数跨境

8B模型直出4K:商汤SenseNova-U1.5预览版开源,无编码器架构,文字不乱码、编辑更听话

8B模型直出4K:商汤SenseNova-U1.5预览版开源,无编码器架构,文字不乱码、编辑更听话 努力犯错玩AI
2026-08-04
1
导读:7月31日,商汤开源了 SenseNova-U1.5 预览版。这是一次有点特殊的发布:模型只有 8B 参数,

7月31日,商汤开源了 SenseNova-U1.5 预览版。这是一次有点特殊的发布:模型只有 8B 参数,却宣称原生直出 4K 图像;架构上完全去掉视觉编码器和 VAE,走的是 NEO-unify 统一路线;最让人意外的是文字渲染和图像编辑的提升幅度,官方一口气放出了十几组生成和编辑案例,从复古汽水广告到武康路旅行手账,从海浪组成的汉字到钠离子电池海报改标题。

预览版不是完整版。官方在文档开头就写明了:这是一个提前体验版本,更完善的生产版本会在近期正式发布。但预览版已经能看出 U1.5 的方向,而且权重和训练代码都开源了。

SenseNova-U1.5 技术概览
SenseNova-U1.5 技术概览

无编码器的原生统一架构

先搞清楚 U1.5 和主流文生图模型最根本的差别。现在市面上的多模态模型,大多是"视觉编码器 + 语言模型 + 解码器"的拼接结构:图片要先经过编码器转成 token,模型理解后再通过解码器生成图片。商汤的 NEO-unify 架构把这些中间层全去掉了,没有独立的视觉编码器(VE),也没有 VAE,语言和视觉信息直接在同一个表征空间里处理。

这个架构在四月底的 U1 系列上首次亮相,当时就引发过一轮讨论——海外开发者社区关注的点正是"完全去掉 VE 和 VAE 的统一架构"。U1.5 是这个路线的第二代产品,8B 参数、MoT 骨干,权重和预训练脚本一起放出。

U1.5 在这个基础上加了新的 patch 编码和解码层。它的解码不再是每个图像块独立重建,而是用 ConvDecoder 把视觉 token 重排成二维特征网格,经过多级 Pixel Shuffle 上采样,中间用 3×3 卷积让相邻块互相融合。这样处理的好处是,高分辨率下不容易出现网格纹理和接缝——这是很多生成模型放大到 4K 时最头疼的问题。

官方还强调了一个细节:生成和编辑的训练数据里只有少量简单 JSON 格式的 prompt,复杂的结构化指令主要出现在理解数据里。但模型依然能很好地把理解能力迁移到生成任务上,处理长指令和复杂布局。这说明统一架构里,理解学到的能力可以直接复用给生成,不需要为每种 prompt 格式单独训练。

三处关键升级

U1.5 相比 U1 的进步,官方归纳成三个转变。

从 patch 独立预测到联合重建。 U1 的 MLP 解码头是逐块重建 RGB patch,高分辨率下 token 边界容易暴露成网格和接缝。U1.5 换成渐进式空间重建,相邻 patch 在解码过程中就能交互,网格伪影在预训练阶段就被压下去,下游微调也不容易复发。

从指令遵循到视觉保留。 U1 用的公开编辑数据集有不少噪声监督和低质量样本。U1.5 对编辑语料做了大规模清洗、过滤和合成,同时改善中英文数据平衡,扩大单图参考和多图参考的覆盖。结果是模型在听懂指令的同时,能更好地保持主体身份和结构不变——改的是局部,不乱动全局。

从格式暴露到跨任务泛化。 训练时模型很少见到复杂 JSON prompt,但实际使用中它对结构化长指令的泛化很好。官方认为这验证了原生统一建模的价值:理解和生成能力在一个模型里互相促进。

上手指南:本地直跑 4K

U1.5 预览版的部署很直接。权重在 Hugging Face 的 sensenova/SenseNova-U1.5-8B-MoT-Preview,8B 参数,16 个 safetensors 分片,代码在 OpenSenseNova/SenseNova-U1 仓库,许可证是 Apache 2.0。


   
   
   
   
    
   
   
   
   git clone https://github.com/OpenSenseNova/SenseNova-U1.git
cd
 SenseNova-U1
uv sync
source
 .venv/bin/activate

# 文生图,直接输出 4K

python examples/t2i/inference.py \
  --model_path sensenova/SenseNova-U1.5-8B-MoT-Preview \
  --prompt "A cinematic mountain lake at sunrise, realistic photography." \
  --width 2048 --height 2048 \
  --device_map auto \
  --output output.png

# 图像编辑

python examples/editing/inference.py \
  --model_path sensenova/SenseNova-U1.5-8B-MoT-Preview \
  --image input.png \
  --prompt "Change the jacket to cobalt blue. Preserve the face, pose, background, lighting, and framing." \
  --output edited.png

官方给出的参考配置是 cfg_scale=4.0、timestep_shift=3.0、num_steps=50,环境要求 Python 3.11、PyTorch 2.8、CUDA 12.8。训练代码也一并开源了,预训练脚本在 training/shell/train_u1/U1.5_8B.sh。推理命令里默认带 device_map auto,模型会自动分配到可用显存上。

官方还推荐了两条进阶路径。一是 SenseNova Image PE Skill:给一个短创意简报,Agent 自动把它扩写成结构化的 Render JSON prompt,再交给模型生成。二是参考图检索加 Caption 脚本:找一张设计完成度高的参考图,用脚本把它的版式、配色、字体、光照拆解成可编辑的 prompt,然后替换主题和文案重新生成。两条路径都不属于模型本身的能力,但对追求稳定出图很有帮助。

文字不乱码、信息图直出

文字渲染是 U1.5 这次提升最明显的部分。中英文都做了专门的数据优化,官方展示的几个案例都是文字密集场景。

第一个是复古可乐广告。画面里五排超大黄色英文标题"VINTAGE / CARBONATED / DREAMS! / UNCAP / THE PAST."、瓶身上的 RETRO-COLA 标签、桶身上的 DRINK 字样,每一处文字都清晰可读,还贴合瓶身的曲面透视。这类"品牌文字进画面"的需求,过去是文生图模型的翻车重灾区。

官方为这个案例给出的 prompt 长达数百字,把场景、人物、服装、道具、光线、字体逐项写死:复古泳池派对的夏夜氛围、深靛蓝夜空配暖黄灯光、穿格纹泳装的女性坐在装满冰块的黄色金属冰桶里、右手握玻璃瓶可乐且"必须完整呈现五根手指"、五行超大英文标题左对齐排布、连"不要出现第三只手"这种细节都单独强调。模型能严格照做,说明它对长指令的拆解能力确实到了商用级别。

复古可乐广告:英文文字渲染
复古可乐广告:英文文字渲染

第二个是武康路旅行手账。整张图是小红书风格的拼贴手账,中文主标题"武康路"用毛笔手写体,副标题、便签、路线图、话题标签全是中文,水彩插画配手写批注。密集的中文小字没有出现乱码和错字。

武康路旅行手账:中文文字渲染
武康路旅行手账:中文文字渲染

第三个是银盐摄影科普信息图。一张 16:9 的工程线描图解,包含横向时间轴、相机爆炸拆解图、八个知识模块,全部是中文标注,还特别要求"底部绝不出现标签胶囊按钮"这种负向约束。模型完整执行了这条复杂指令,版式工整,文字清晰。

银盐摄影科普信息图:复杂版式
银盐摄影科普信息图:复杂版式

编辑更听话:区域可控

U1.5 的编辑能力是另一大亮点,官方展示的案例覆盖了多种编辑方式:参考图风格迁移、多图参考合成、主体参考生成封面、局部文字替换、字形编辑、区域标记编辑。几个案例里能看出一个共同点:模型在执行局部改动时,对"哪些要变、哪些不能动"分得很清楚。

最直观的是区域标记编辑。一张活动海报,红框圈出"05月06日 10:00-17:00",指令是改成"06月18日 09:00-18:00",保持绿色字体、粗体样式和两行排版,最后移除红框。模型直接执行了。

区域标记编辑:日期替换
区域标记编辑:日期替换

另一个案例是字形编辑。原图是海浪翻涌轨迹和白色船只拼出的巨大"迎"字,要求改成"命"字,新字仍由自然翻涌的海浪、泡沫水纹和船只航行轨迹组成,最后一竖设计成原有白色船只的纵向航行形态。这种"把汉字融进自然景物"的精细编辑,对布局理解和局部重绘能力要求很高,官方文档里也用这个案例说明 U1.5 不是简单贴字,而是让文字真正成为画面的一部分。

海浪字形编辑:迎改命
海浪字形编辑:迎改命

编辑之外,官方还提供了两条提升效果的路径。一个是 SenseNova Image PE Skill:把一句简短的创意简报交给 Agent,它自动扩写成结构化的 Render JSON 提示词,再交给模型出图,适合"只有一句话需求但想要完整设计"的场景。另一个是参考图检索加 Caption 脚本:用脚本把一张成熟参考图的版式网格、视觉焦点、文字层级、配色、材质、光照逐项拆解成可编辑的提示词,然后替换主题和文案重新生成,适合"想复刻某张设计的感觉但内容要换"的场景。这两条路径都是模型之外的预处理工具,官方明确说明不算模型自带能力,但实际出图时很实用。

精选对比:提升有多大

官方放出的评测数据,U1.5 相比 U1 的提升是全面的。

在 Qwen-Image Bench 上,U1 的英文综合分是 48.28,U1.5 预览版提升到 49.93;中文从 45.99 提升到 50.25,涨了 4 分多。如果叠加官方的 Prompt Enhance 预处理,英文综合分能到 55.17,中文 55.22,已经超过 GPT Image 1(英文 54.24)和 Qwen Image 2512(51.32),逼近 GPT Image 2 的 65 分。注意 Qwen Image 2 那行是官方自测数据,GPT Image 2 依然是榜单最强的闭源模型。

图像编辑的进步同样明显。ImgEdit-Bench 综合分从 U1 的 3.90 涨到 4.37,与 FireRed-Image-Edit(4.56)基本同档。WeEdit 平均分从 6.497 涨到 6.852,超过 FireRed(5.873)、Nano-Banana(6.287)、Qwen-Image-2(5.601),也超过 GPT-Image-1.5(6.817),但和 Nano-Banana-Pro(8.843)还有距离。GEdit 的中英文指令遵循分都涨到 8 分以上。

这些数据全部来自官方文档,属于厂商自测,参考时心里有数就行。

局限与适用场景

官方坦承了五条已知局限:短或欠指定的 prompt 可能生成意外文字;密集或长文本仍有错误,特别是小字和中英混排;复杂布局的精确计数、对齐和层级遵循还不完整;小脸、手、肢体和细粒度物体细节不稳定;多轮、多参考的复杂编辑会出现漂移。

结合这些,适合的场景很明确:广告海报和电商主视觉,品牌文字直接进画面,一张图省掉后期排版;信息图和科普图解,特别是中英文密集的版式;小红书等平台的内容封面,参考主体生成和风格迁移都能用;需要局部改字、改日期、改颜色的批量编辑需求。

不适合的场景也要说清楚:追求 GPT Image 2 那种顶尖写实和创意生成,U1.5 还有差距;对精确到像素的版式还原要求极高、容不得一点文字错误的场景,建议人工检查;复杂多轮编辑项目,最好分步执行而不是一次下完指令。

总结:统一架构的开源标杆

SenseNova-U1.5 预览版的价值,在于它用 8B 参数证明了原生统一架构的潜力:没有编码器和 VAE,却能在 4K 直出、文字渲染、图像编辑几个方向上同时进步。这个体量能跑出接近闭源旗舰的文字和编辑效果,对本地部署和二次开发是实打实的利好,Apache 2.0 许可也给了商用和微调足够的空间。

回顾 U1 系列走过的路:四月底 U1 开源确立无编码器路线,五月中发布技术报告,六月的信息图系列和交错图文模型补齐了应用场景,七月 WAIC 上 U1 Pro 亮相,月底 U1.5 预览版把 4K 直出和精细编辑带到了开源社区。每一步都踩在"统一架构"这条主线上,进度相当密集。

当然,预览版的定位决定了它还不是终点。生产版本即将发布,官方也明确说了会继续 Scale 更大体量的模型。对想低成本尝试 4K 生成和精细编辑的团队来说,现在这个开源预览版已经值得上手了——毕竟能本地直跑、能看代码、能自己微调的 4K 图像模型,开源阵营里并不多见。

【声明】内容源于网络
0
0
努力犯错玩AI
为AI开发者打造HuggingFace国内镜像站,提供最新流行开源模型资讯并免费加速下载。更多内容请访问https://aifasthub.com
内容 286
粉丝 0
努力犯错玩AI 为AI开发者打造HuggingFace国内镜像站,提供最新流行开源模型资讯并免费加速下载。更多内容请访问https://aifasthub.com
总阅读2.4k
粉丝0
内容286