2026年4月21日深夜,OpenAI没有发布会,没有预热倒计时,没有CEO上台演讲。
悄悄上线了一个新模型。
然后,12小时之内,它在全球最权威的AI图像评测榜——Image Arena——上,以领先第二名 +242分 的差距,横扫了每一个分类的第一名。
+242分。这是该榜单自创立以来,有史以来最大的领先幅度。
而它刚刚干掉的那个第二名,正是谷歌两个月前刚刚宣布"彻底改变AI生图"的 Nano Banana 2。
AI生图的战局,一夜之间变了。
先说背景:谷歌 Nano Banana 2 有多强
要理解这次OpenAI做了什么,必须先知道它在PK谁。
今年2月26日,谷歌宣布推出 Nano Banana 2,技术上称为 Gemini 3.1 Flash Image,这是融合了 Nano Banana Pro 高画质与 Flash 模型极速生成能力的最新一代图像模型。
那次发布的数据相当惊人——
自2025年8月 Nano Banana 原版在图像生成评测平台 LMArena 首次亮相以来,该模型在四天内吸引了1300万名新用户,并在2025年10月中旬前生成了超过50亿张图像。谷歌Nano Banana掀起了一场病毒式传播,尤其在印度等市场,用照片生成玩偶风格图像成了全球刷屏的爆款玩法。
Nano Banana 2在此基础上做了全面升级:
-
• 支持512px到4K的分辨率范围,以及多种宽高比 -
• 融合了谷歌的实时知识库和网页搜索,能更精准地描绘特定的真实地点、物体和最新信息 -
• 精准文字渲染与多语言内容生成 -
• 在内部用户偏好评测中,Nano Banana 2在整体视觉质量、信息图清晰度和事实准确性方面超越了OpenAI的GPT-Image 1.5、字节跳动的Seedream 5.0 Light以及xAI的Grok图像生成
更重要的是,谷歌把它接入了整个生态:
Nano Banana 2在 Gemini 应用、谷歌搜索、AI Studio、Vertex AI 以及谷歌广告平台中全面上线,还成为视频剪辑工具 Flow 的默认生图模型,供所有Flow用户免费使用。
这是一个覆盖13亿用户的谷歌生态,加上行业领先的生图能力。Nano Banana 2在2月横空出世之后,确实一度让外界觉得:AI生图,谷歌领先了。
然后,两个月后,OpenAI出手了。
ChatGPT Images 2.0 究竟做了什么
4月21日,OpenAI发布 ChatGPT Images 2.0,底层模型名称 gpt-image-2。
Sam Altman在直播中说了一句话:
“这就像从GPT-3一跃跳到GPT-5,是一次巨大的飞跃。”
这不是谦虚,也不是夸张,而是——他可能还低估了。
gpt-image-2在Image Arena排行榜上获得了1512分,领先第二名Nano Banana 2整整242分。
最核心的突破:这是第一个"会思考再画图"的AI
gpt-image-2是业内第一款真正意义上的"代理型"图像生成模型——在生成图像之前,它会主动研究、规划和推理图像结构,这正是OpenAI将其称为"O系列推理能力"的原因。
换句话说,以前所有的AI生图都是这样工作的:
你输入 → 它立刻开始画
而现在,ChatGPT Images 2.0的工作流是:
你输入 → 它先思考:构图怎么排?文字怎么放?细节是否矛盾?需不需要联网确认信息?→ 思考完毕后,再开始画
这一步"思考"的加入,从根本上改变了生图的成功率。Thinking模式在生成图像之前,会消耗额外计算资源来规划构图、检查约束条件,OpenAI称之为模型在"思考任务简报";在实际使用中,这大幅减少了因对象数量错误或图表标签混乱而反复修改提示词的次数。
五个真实的技术突破
① 文字渲染:终于能用了
用两年前的AI模型生成墨西哥餐厅菜单,会出现"enchuitia"、“churiros”、“burrto”、"margartas"这类自创词。现在,ChatGPT Images 2.0生成的菜单直接可以在真实餐厅使用,顾客完全不会发现任何问题。
这不是一个小改进,这是三年来AI生图行业最顽固的缺陷,第一次被真正解决。
OpenAI表示,Images 2.0能够准确渲染精细元素——包括小号文字、图标、UI组件、高密度构图和细微的风格约束。
② 多语言渲染:中文、日文、韩文不再乱码
Images 2.0被称为"多语言模型",在非拉丁字母渲染方面取得了重大进展,现在支持对日语、韩语、中文、印地语和孟加拉语进行高保真文字生成。
而且文字不只是翻译正确,更是"以流畅自然的语言渲染",确保标签和说明感觉像是原生融入设计的,而非事后贴上去的。
对做中文内容、跨境电商、多语言营销的人来说,这一个突破就值回升级的代价。
③ 批量连贯生图:角色不再换脸
Thinking模式支持从单个提示词生成最多8张连贯图像,且这些图像在整个批次中保持"角色与物体的连续性"。
以前做一套漫画或故事板,必须一张一张生成,再祈祷每张里的角色长同一张脸。现在,一句话描述,AI帮你生成一套风格一致的完整序列。
④ 联网搜索:知识不再过时
Thinking模式可以搜索网络获取实时信息,并在生成之前对输出内容进行自我检查。
模型知识截止到2025年12月,这已经比之前大幅提升。而对于截止日期之后的信息,Thinking模式的实时搜索能够即时补充。
⑤ 2K分辨率与超宽比例支持
新模型支持最高2K分辨率,并涵盖从3:1超宽到1:3超高的多种宽高比。
真正的核心差异:两种完全不同的设计哲学
读到这里你可能会好奇:谷歌 Nano Banana 2 也有 Thinking 模式,也支持多语言,也联网搜索——那两者到底差在哪?
ChatGPT Images 2.0与谷歌Nano Banana Pro拥有同样的核心能力:模型会在生成之前进行"思考",根据所选模式消耗更多或更少的推理时间,甚至可以在此过程中搜索网页。
但两者在实际表现上存在明显区别。
从 VentureBeat 记者的真实测试来看:
ChatGPT Images 2.0是目前仅有的两个(另一个是Nano Banana 2)能够相对准确再现阿兹特克、玛雅和印加帝国版图并配有完整可读图例的图像模型。而在界面截图复现、用户界面渲染以及多图批量一致性方面,Images 2.0的表现似乎超越了谷歌最新图像模型的能力。
专业评测的结论是:需要复杂设计逻辑或文字精确渲染任务时,GPT Image 2.0是唯一专业可用的选择。
但两者各有所长,这个要说清楚——
ChatGPT Images 2.0更胜一筹的场景:
-
• 图像中含有大量文字(菜单、信息图、海报) -
• UI界面截图和产品原型 -
• 多语言内容创作 -
• 需要API接入工作流的开发者 -
• 批量连贯叙事(漫画、故事板)
谷歌 Nano Banana 2 依然有优势的场景:
-
• 深度嵌入谷歌生态(Gmail、Google Photos、Google Ads) -
• 通过连接Google Photos,Gemini能自动理解你的个人偏好,只需说"设计我的梦想家园",无需上传照片或写冗长描述,即可生成高度个性化的图像 -
• 4K超高分辨率输出 -
• 与 Google Search、Lens 原生集成的搜索场景
设计行业正在面对的真正冲击
这次发布最值得关注的,不是"谁赢了谁",而是OpenAI对这个产品的定位说法:
“图像是一种语言,不是装饰。好的图像和好的句子做的是同一件事——选择、排列、揭示。”
这句话意味着什么?
意味着ChatGPT Images 2.0的目标,不是给你看好看的图,而是给你直接能用的图。
OpenAI将其定位为"视觉思维伙伴"——一个专为处理营销、教育、设计和软件开发工作流中生产就绪资产而构建的系统。
对设计师来说,这话值得反复咀嚼。
以前,AI生图的使用场景是"帮我找灵感"或"生成一张参考图",最终成品仍然需要设计师用PS、Illustrator、Figma打磨。
现在,Images 2.0的thinking能力允许它搜索网络、对上传材料进行视觉解读,并在生成之前对图像结构进行推理。这使得它能够直接创建多尺寸营销资产,以及多格格漫画条。
TechCrunch的记者测试发现:生成出来的菜单,“可以直接在餐厅里用,顾客完全察觉不出异常”。
这不再是"参考图",这已经是"可交付物"。
对于不同角色的从业者,冲击程度并不相同——
初级图形设计师: 压力最大。以前需要花半天做的信息图、社交媒体封面、活动海报,现在一句话就能生成可用版本。如果你的核心价值停留在"会操作软件"这个层面,那确实需要认真考虑下一步。
品牌设计师和创意总监: 影响有限,甚至是利好。AI解决的是"执行"层面的工作,战略判断、品牌定位、创意方向这些依然需要人。更重要的是,AI能快速生成大量方案,反而让审美判断和创意决策的价值更突出了。
广告和营销团队: 直接受益。多语言内容本地化、多尺寸资产批量生成、A/B测试素材的快速迭代——这些以前要外包设计公司、排期很长的工作,现在能极大压缩时间和成本。
开发者和独立产品: 最大赢家之一。gpt-image-2通过Image API和Responses API向开发者开放,支持 chatgpt-image-latest 作为ChatGPT同级的别名调用,1024×1024分辨率下定价为低质量
使用权限和费用:哪些人能用到什么
把这件事说清楚,因为很多人搞混了。
Instant 模式(即时模式)
全部免费账号可用。核心的图像质量提升、文字渲染改进、多语言支持,全部包含在内。没有Plus也能体验。每天有限额,适合轻度尝鲜。
Thinking 模式(思考模式)
需要 ChatGPT Plus(
API开发者
ChatGPT和Codex用户可以从4月22日起在网页端直接使用,gpt-image-2 API将在2026年5月初向开发者正式开放。
关于DALL-E退场
DALL-E 2和DALL-E 3将于2026年5月12日正式停用,gpt-image-2取而代之,成为ChatGPT和OpenAI API的默认图像模型。任何现有调用DALL-E 3端点的代码都需要在5月12日截止日期前完成迁移。
还有一件事:AI生图的真实难题,还没解决
说了这么多亮点,有一件事需要说清楚,这才是负责任的态度。
OpenAI并没有公开Images 2.0的模型架构。
OpenAI在本周的新闻发布会上拒绝回答关于ChatGPT Images 2.0底层模型架构的问题。只告诉外界它是"通用模型"或"用于图像的GPT"。
这意味着:独立评测者目前还无法全面测试模型的特定失败场景。Image Arena的高分是真实的,但对于极端测试案例的表现,需要时间积累更多数据。
另一个真实局限:
Thinking模式是被限制访问的——最大的质量提升需要Plus或Pro订阅。免费用户只有Instant模式。
最后要提醒的是,Text rendering(文字渲染)虽然是这次最被强调的突破,但在超高密度中文排版、特殊字体、极小号字这些极端场景下,建议自己实测后再下结论。AI公司的发布展示通常是最优情况,真实使用场景千变万化。
现在怎么用
直接打开 chat.openai.com 或手机ChatGPT应用。
在对话框描述想要的图,发送即可。系统自动使用Images 2.0的Instant模式。
如果你是Plus用户,在生成时可以选择Thinking模式,复杂任务推荐使用。
一个立刻能用的提示词模板:
描述时包含这几个要素,效果明显更好:
-
• 用途:“用于小红书封面” -
• 主体:“一杯手冲咖啡,窗边,午后光线” -
• 如果有文字,直接写出想要的文字内容,不要含糊 -
• 尺寸:“竖图,9:16” -
• 风格关键词:“胶片感,暖色调”
跟Midjourney最大的区别在于:这里不需要学参数语法,说人话就行,然后在对话中继续修改。这才是它真正的杀手锏——把生图变成了一次对话,而不是一次押注。
最后
两个月前,谷歌 Nano Banana 2 的发布让业界觉得,AI生图的标杆已经到了一个新高度。
两个月后,OpenAI用一次悄无声息的更新,拿回了主动权。
这场竞争没有终局,下一个版本可能又会把天花板抬高。
但这一刻,有一件事已经很清楚:
AI生图正在从"生成工具"变成"视觉推理引擎"。它不再只是接受你的指令,它开始先理解,再创作。
这对设计行业意味着什么,每个人都需要自己想清楚。
本文所有数据和技术细节均来自OpenAI官方发布公告(2026年4月21日)、谷歌官方博客(2026年2月26日)、TechCrunch、VentureBeat、Neowin、MacRumors、The Decoder、DataCamp、BuildFastWithAI等媒体报道。Image Arena排行榜数据来自Arena.ai,截至本文发布时间(2026年4月23日)。

