一张寻狗启事上的潦草涂鸦,身体是一团乱线,眼睛圆睁。输入 ChatGPT Images 2.5 后,生成的图像毛发蓬乱、神情警觉,虽非分毫不差,却精准捕捉了原画那种狼狈的神韵。
对比 AI 生成的图像与实际照片,可见其对模糊信息的理解能力已显著提升。
ChatGPT Images 2.5 根据寻狗启事猜测的狗狗长相
狗狗实际长这样
透过 AI 对不准确草图的理解,更能洞察其技术演进。今日,OpenAI 正式发布 ChatGPT Images 2.5,重点强化图像保真度、精准编辑能力及多轮修改的一致性,生成延迟较 2.0 版本最高降低 50%。
本次更新的核心在于:当用户仅提供草图、人物照片或抽象审美需求时,AI 能在多大程度上保留用户的原始意图?
懂你意思:从草图到成稿
部分视觉构想难以用语言精确描述。Images 2.5 新增的 Sketch 功能为用户提供了一块数字画布。只需在对话中输入"@Sketch",即可直接绘制轮廓并辅以文字说明,将位置、大小和形状直观地呈现在画面中,无需繁琐的文字堆砌。
这一功能降低了创作门槛。即便只是简单的线条勾勒,AI 也能补全细节。例如,一幅由倾斜楼房和悬空小人组成的简易草图,仅标注了片名和大致情绪,AI 便能提供五种不同的艺术方向供选择。
若选择“心理惊悚”风格,画面会降低饱和度,以灰雾填充楼宇间隙,凸显人物的孤立感;若选择“复古海报”风格,天空将被染红,并添加纸张折痕与磨损边缘,营造旧电影印刷质感。
尽管风格迥异,两幅作品均准确还原了草图的构图逻辑。此外,在静物测试中,几根代表桌子的棕线和表示葡萄的彩色圆圈,被 AI 转化为具有木纹、陶瓷釉面及自然光照的写实照片。
对于“心中有画面却难以下笔描述”的用户,新功能提供了更直接的表达路径。
换个镜头:多视角叙事与一致性
在角色一致性方面,Images 2.5 展现了强大的多视角生成能力。以《泰坦尼克号》船头场景为例,模型生成了包括侧面、背面、俯拍、低机位及远景在内的 8 个不同视角。
随着机位变化,人物在画面中的比例随之调整,但 Rose 的深色外衣、浅色丝巾,Jack 的发型以及海面上的夕阳等视觉线索保持连贯。近景刻画表情,远景交代环境关系,形成了一组具备镜头语言的故事板。
另一组 Vlog 故事板测试中,短发女孩的一天被拆解为 16 个画面。从起床、整理行装到海边活动,围巾、发型和外衣在不同场景中始终保持一致,穿插的风景与物件特写进一步丰富了叙事节奏。
此类生成结果已能辅助前期构思,帮助创作者判断行程顺序与镜头节奏。结合 Seedance 2.5,未来有望实现从静态分镜到动态场景的完整制作流程。
这挺艺术:风格化编辑与审美把控
Images 2.5 对复杂艺术风格的解析与执行能力亦有突破。在一张普通旅行自拍中,模型保留了人物面部与环境的摄影质感,同时在衣物上叠加了彩色蜡笔纹理,并在周围添加了手绘花朵、爱心及注释,实现了真实与趣味的平衡。
针对韩剧《台风商社》场景的改编测试中,通过长提示词对几何简化、配色限制及留白进行明确约束,模型成功生成了扁平化矢量插画,去除了繁杂纹理,保留了核心的图形平衡与艺术张力。
对比 ChatGPT Image 2 与 2.5 生成的同一场景水彩图,后者在保留留白的同时,增加了岸边植被细节与笔触密度,使画面更加饱满且呼应完整。这表明,细节的多少并非衡量审美的唯一标准,关键在于如何分配场景保留与艺术留白的权重。
更具趣味性的测试是将日常照片重制为早期 Source 引擎风格的游戏截图。汉堡面包呈现出明显的多边形棱角,石阶上的猫与背景建筑获得了老游戏的低多边形材质感,甚至自动生成了左下角的生命值界面。
尽管生成的是二维图片,但模型实际上重构了物体的轮廓、表面纹理及光照逻辑。需注意的是,局部编辑可能存在选区溢出的情况,涉及人物细节、文字等关键区域时,仍需人工逐项核查。
综合来看,ChatGPT Images 2.5 的核心价值在于提升了用户的参与度。草图可以粗糙,指令可以具体,用户不再是被动的接收者,而是能够更早介入构图决策、明确主体保留范围,并针对性地修正不满意之处。让用户参与到创作过程中,共同打磨画面,是此次更新最令人瞩目的进步。

