大数跨境

讲真,我没看出这图是AI做的,更没想到是国产AI做的

讲真,我没看出这图是AI做的,更没想到是国产AI做的 量子位
2026-09-22
6
导读:商汤SenseNova U1 Pro正式版

观察以下两张图片,您是否能分辨出哪张是AI生成,哪张是真实拍摄?

事实上,两者均为AI生成。即使放大细节,也难以察觉传统AI生图的瑕疵:

这两款作品并非出自Midjourney或Image 2.5等海外模型,而是来自国产AI——商汤科技旗下的SenseNova U1 Pro(以下简称U1 Pro)。该模型此前曾在WAIC(世界人工智能大会)上大放异彩。

目前,U1 Pro正式版已上线商汤小浣熊平台,API也已面向企业客户开放。在AI生图领域,单次生成的质量固然重要,但能否进行多轮修改以达到商用标准,同样是业界关注的核心痛点。为此,我们对U1 Pro进行了深度实测。

支持生图后深度精修与复杂场景生成

在实测前,先简述操作路径。在商汤小浣熊平台,点击输入框下方的“一图读懂”即可选择U1 Pro模型:

目前该平台主要支持复杂单图生成,企业客户可通过API或SenseNova Studio体验多轮修改等进阶功能。因此,本次深度实测将在SenseNova Studio平台展开(支持2K至4K清晰度):

生活照风格重构与局部精修

首轮实测聚焦生活照的风格重构。上传一张实拍人物照片:

图注:此为实拍参考图

输入特定Prompt后,仅用数分钟,写实照片便完成了风格转换:

结果表明,U1 Pro精准理解了Prompt意图,在无畸变的前提下将画面转化为纸质艺术风格。随后,我们进一步提升难度,测试其局部修改能力,要求仅更改人物内搭T恤的颜色:

只修改人物深色外套里面的黑色圆领T恤,将T恤改为白色。 修改范围严格限定在敞开外套之间、颈部下方至腰部上方可见的内搭T恤纸片,包括圆领边缘。

该场景的难点在于T恤、皮带与裤子均为黑色,且胸部有遮挡,AI极易混淆边界。但U1 Pro精准锁定了T恤区域,展现了出色的图像整体把控与语义理解能力。

多图融合生成微缩场景

除单图处理外,U1 Pro对多张参考图的融合能力同样出色。以下面四张参考图为例:

目标是将其融合为一张“猫咪经营的微缩咖啡店”宣传海报,具体Prompt如下:

将四张参考图组合成一张横版4:3的微缩咖啡店宣传海报,主题是虚构店铺“街角补给站”。请明确区分四张图的作用。
图1:只参考店面的建筑轮廓、门窗数量、门窗相对位置和遮阳棚形状,把它制作成摆在桌面上的1:12微缩店铺模型。原图招牌文字统一替换为“街角补给站”,不要改成另一种建筑。
图2:参考这只猫的毛色、额头花纹、脸部轮廓和胸口特征,制作成店铺里的微缩猫店长。让猫坐在门口一张小凳子上,系一条深蓝色围裙,身体比例自然,不做成人类身体。
图3:参考杯子的形状、把手、颜色和表面图案,把它缩小后放在店外的小桌上。杯子与桌椅符合微缩场景的相对比例,不修改产品结构,不额外增加杯子。
图4:只参考海报的版面分区和文字层级,不复制其中的物品、配色或示例文字。店铺使用涂漆木材、透明亚克力窗、织物遮阳棚和细小金属门把手,呈现真实手工模型的质感。所有主体采用一致的透视与左上方柔和光线,有合理接触阴影,不能像四张图片直接拼贴。
海报必须完整、准确地出现以下文字:店名“街角补给站”;主标题“今天,先喝一杯再出发”;产品信息“桂花拿铁 28元”;营业信息“营业时间 08:00—20:00”。店名可以出现在实体招牌上,其余信息放在海报文字区。整体温暖、有生活感,信息在手机正常阅读尺寸下清楚可辨。

生成的成果显示,猫咪、杯子、店铺门面等元素均保持了原图特征,且完美契合微缩场景的物理比例与光影逻辑。这证明U1 Pro能够高效提取多张参考图的关键特征,并在保证无畸变的前提下,严格按照指令完成复杂合成。

多轮连续局部修改

在实际商业应用中,设计稿往往需要反复修改。我们测试了U1 Pro在连续修改时的稳定性。首先,修改前文“猫咪咖啡店海报”中的商品价格:

编辑这张海报,只把“桂花拿铁 28元”改为“桂花拿铁 26元”。保持产品名称、原有字体风格、字号、文字颜色和所在位置,尽量只改价格中的必要字符。店铺、猫咪、杯子、招牌、主标题、营业时间、背景、光影和其他文字保持原样,不重新设计整张海报。

价格已成功替换为“26元”,且字体与背景完美融合。继续修改主标题文案:

把主标题“今天,先喝一杯再出发”替换为“今天的好心情,从这一杯开始”。新标题仍放在原主标题区域,可以在这个区域内合理换行并小幅调整字号,保持原来的字体风格、颜色和视觉层级。不要遮挡店铺、猫咪、杯子或其他信息。

随后,再次修改杯中咖啡的颜色:

只把桌上咖啡杯的杯身底色改为深墨绿色。保留杯子原来的形状、把手结构、表面图案、大小、位置、材质和光照关系。

经过连续三轮的局部修改,画面其他元素均未发生任何改变。U1 Pro真正做到了精准修改,证明其具备极强的上下文保持与抗干扰能力。

生成多格连续动作图集

在进阶测试中,我们要求U1 Pro基于单张猫咪图片,生成包含八格连续动作的图集,类似于定格动画的分镜:

根据上传的猫咪参考图,生成一张横版16:9的连续动作图集,严格分成4列×2行,共8格。每格都是同样尺寸的正方形,格间使用等宽窄白边。主角是一只以参考照片中的猫为原型的手工毛毡猫...八格按从左到右、从上到下的顺序,连续表现同一只猫在办公桌前结束工作的过程。镜头固定为能同时看见桌面和地面的正侧面中远景。所有格子只有同一只猫,不增加角色,不更换围巾或花纹。每格推进一个明确动作,不要生成八张彼此无关的姿势图。

结果令人惊艳,猫咪的细节在8个动作格中保持了高度一致,动作连贯且符合物理逻辑。将此类图集转化为GIF,即可直接应用于AI视频生成的前期分镜制作,大幅提升了工作流效率:

自动检索生成复杂信息图表

最后一项测试聚焦于复杂信息的可视化。在不提供任何参考图的情况下,我们输入Prompt,要求U1 Pro自行联网检索资料并生成科普海报:

为面向普通读者的科普账号制作一张竖版3:4中文海报,标题为“月亮为什么会变脸?” 请先实际查阅NASA的Moon Phases与Moon Facts等官方资料。将核实后的内容组织成一张完整海报。视觉采用“纸上月亮博物馆”...将解释压缩为适合手机阅读的三条短句。完成后检查月相名称、顺序、亮面方向和解释文字是否一致,再输出海报。

U1 Pro不仅能自主检索并核实专业信息,还能将文字与视觉设计深度融合,输出了一张排版严谨、信息准确的科普长图,展现了其在知识密集型内容创作上的潜力。

具备可交付性的商用级生图工具

回顾上述实测,U1 Pro在多轮连续修改中展现出的稳定性,直击了当前AI生图工具的核心痛点——“牵一发而动全身”。能够经得起反复修改且不破坏原有细节,意味着该模型已具备真正的可交付性。

在商业落地方面,U1 Pro同样表现优异。针对电商场景,它能基于白底商品图,生成光影自然、背景丰富的商品详情页场景图,同时严格保留商品细节:

对于媒体与运营场景,仅需简单指令,U1 Pro即可自动检索信息并生成复杂的新闻海报:

请围绕“第83届威尼斯国际电影节”自主检索并制作一张竖版3:4中文新闻信息海报。所有事实、日期、文案和视觉编排均由你根据检索结果完成。

正如商汤科技所构建的完整创作管线:从需求理解、信息搜索、素材处理,到生成编辑与检查修正,U1 Pro正致力于让用户能够从一组零散素材,直接推演出符合明确商业用途的最终成果。

在“惊艳”频出的AI生图时代,真正稀缺的是能够稳定修改、直至完美交付的工具。U1 Pro无疑交出了一份令人满意的答卷。

艺术表现力与作品赏析

除了强大的功能性,U1 Pro在艺术表现力上同样具备极高水准。以下是通过该模型生成的Gallery作品展示:

SenseNova U1 Pro小浣熊体验地址:https://office.xiaohuanxiong.com/

【声明】内容源于网络
0
0
量子位
各类跨境出海行业相关资讯
内容 16473
粉丝 1
量子位 各类跨境出海行业相关资讯
总阅读448.7k
粉丝1
内容16.5k