大数跨境

实测 GPT-6 和 GPT-5.6 复刻科研插图,终于能 1:1 变成可编辑图了

实测 GPT-6 和 GPT-5.6 复刻科研插图,终于能 1:1 变成可编辑图了 AI前沿速递
2026-09-08
3
导读:最近经常能刷到 GPT-6 控制 Adobe Illustrator 之类的软件复刻各种插画的视频。有些案

 

最近经常能刷到 GPT-6 控制 Adobe Illustrator 之类的软件复刻各种插画的视频。

有些案例做得确实挺夸张。它会先理解原图,再在 Illustrator 里把形状、线条、文字这些元素重新画出来,最后得到的还是可以继续编辑的文件。

我刷了几次之后就有点心痒:这个能力如果用来复刻论文里的科研架构图,会是什么效果?

GPT-5.6 其实已经能做这件事

我之前就做过一次这件事情:30 分钟快速出图:用 ChatGPT + draw.io 制作可编辑的论文插图

当时先用科研架构图生成 Skill,根据模块描述和风格参考图调用 Image 2 生图,再用连接 Drawio 的 Skill 把图片重新绘制成可编辑版本,最终大约能还原 90%。

所以这次 GPT-6 出来以后,我想看它能不能把这个过程做得更直接一些。

这次的参考图仍然用科研架构图 Skill 生成。但是进入复刻环节后,我把 Skill 和其他插件全部去掉,让 GPT-5.6 Sol Ultra 和 GPT-6 Astra(中挡) 都只看这张图,直接在 PPT 里重新绘制。

两边的任务完全一样,后面就只比较模型本身对科研架构图的理解、复刻和可编辑绘制能力。

GPT-5.6 Sol Ultra
GPT-6 Astra 中

先准备一张测试用的科研架构图

图越复杂,对模型的布局理解和细节控制要求也越高。 所以,科研架构图本身很适合拿来测试这种能力。

这类图通常结构比较复杂,既有明确的模块划分,也有大量需要准确对齐和连接的元素。

我先用科研架构图 Skill 生成了一张母图。

参考图(不可编辑)

这张图整体层级比较多,模块之间的关系也比较密集,包含文字、公式、形状和插图等多种元素。非常考验模型对不同对象的处理能力。

GPT-5.6 与 GPT-6 复刻结果对比

先把两张张完整图放在一起。

GPT-5.6 Sol Ultra 复刻结果
GPT-6 Astra 复刻结果

从完整页面看,GPT-5.6 和 GPT-6 都识别出了原图的两阶段结构和主要模块,不过完成度差得比较明显。下面分别看几个部分。

PPT 可编辑性

科研环境中最重要的是可编辑性,方便后续修改。所以我们先从 PPT 可编辑性的角度出发。

下面两个视频演示了两个结果在 PPT 中的可编辑效果。

  1. 1. GPT-5.6 Sol Ultra:


  2. 2. GPT-6 Astra:

两代模型都能输出可编辑的 PPT,不过这里有一个细节值得单独说一下。

可以注意到,我在 GPT-5.6 的展示里并没有直接全选。

是因为,GPT-5.6 Sol Ultra 拆分出来的可编辑对象太太太太多了,多到我只是全选了一下,WPS 就直接卡了两分钟。

这些对象里有不少其实没必要单独拆分。这样做虽然提高了可编辑程度,但同时也增加了文件复杂度,实际操作体验反而变差了。

GPT-6 Astra 在这方面改善了很多,对象拆分更克制,不过类似的问题依然存在,只是程度轻了不少。

复刻程度

单看整体架构,两版 PPT 和原图已经非常接近。

但把三张图放大对比后,局部差距就比较明显了。两版都还存在形状重叠、文字溢出等问题,其中 GPT-6 对位置、间距和细节的控制明显更严谨。

复杂对象尤其能拉开差距。以图中的立体特征块为例,GPT-5.6 对立体结构的理解和还原比较粗糙,GPT-6 则基本保留了原图的形态和空间关系。

插图与不可拆分元素

这一点是值得单独拿出来说一说的。前面提到过,这次的参考图里同时包含了多种类型的对象,刚才的视频里也能看到,两代模型对这些对象的处理方式差别很大

GPT-5.6 基本采用了重新绘制的方式,所以飞机图片和热力图最后都变成了近似版本。虽然位置和用途基本对得上,但视觉内容已经和原图有明显区别

GPT-6 Astra 的处理更贴切一些,它对自己的能力边界判断得更清楚。飞机照片和热力图这类内容直接保留原图,再单独重绘周围的框体、文字和连接线。

还有一个细节也很明显,就是 GPT-6 的截图非常精准。如果之前用过 GPT-5.6 做 PPT,应该很容易体会到这个差别。

GPT-5.6 在这方面一直比较弱,对图片该截取哪一部分、截多大、怎么控制比例,经常判断得不够准确,所以生成的 PPT 里比较容易出现插图溢出、内容截断、比例失衡这些问题。

比如下面这张:

GPT-5.6 Sol 绘制的 PPT

总结

这次测试下来,GPT-5.6 Sol Ultra 和 GPT-6 Astra 都已经能够把复杂科研架构图重新绘制成可编辑的 PPT,两者的差距主要出现在完成度和处理方式上。

GPT-5.6 能把整体结构搭出来,但对象拆分过细,字体、局部排版、复杂图形和插图处理都比较粗糙,后续还需要不少手动调整

GPT-6 Astra 在版式还原、复杂对象、截图精度和对象拆分上都明显更成熟,生成后的架构图也更接近直接可用的状态

我把这次测试里用到的流程整理成了一份《GPT-6 + WPS 可编辑科研插图绘制教程》,包含:参考图绘制 Skill 安装包使用提示词,以及后续把参考图复刻成可编辑 PPT 时用到的稳定提示词

如果想自己上手尝试的话,可以在公众号后台回复:「B870」,免费获取完整教程。

 

想要更多AI使用技巧?回复关键词


B685:创新点设计与可证伪性检验Skill安装包:paper-novelty-design

B754drawio绘图软件、skill、插件安装包和使用

B778ChatGPT + Origin 绘制可编辑实验图教程

B795可编辑 PPT 生成系统安装包和使用手册

B804:LaTex 自动排版 skill:Adapt-journal-latex
B805:设置 arxiv 每日最新论文推送教程

B814:ChatGPT 5.6 安装包、使用教程视频

            科研小白需安装的 11 个 SKills 

            科研写作与绘图 Skills 汇总
B819:WorkBuddy 安装配置教程 + nature skill 全功能汇总和调用提示词
B827:Codex + Zotero 论文阅读笔记 skill

往期文章推荐:

ChatGPT 接管 Origin 后,科研绘图真的变简单了

一个开源 AI Agent Skill:让论文英文润色贴合原意,并检查结论是否越界

告别排版噩梦:用 AI 一键把论文稿件变成期刊 LaTeX 投稿项目

每天刷 arXiv 太累了:用 Zotero + AI 自动筛选论文,中文摘要每日定时推送邮箱

参考文献核验,Reference Checker Skill 帮你逐条检查引用问题

爆火的 6 个开源 SCI 绘图 Skills 实测:功能有何区别,科研绘图该怎么选?

把 ChatGPT(Codex)变成科研执行助手:配置、插件、Skill 和工作流

系统管理文献!Codex+Zotero,一个skill把 Zotero 里的论文和阅读笔记串起来

20分钟,写出一篇接近投稿标准的文献综述?我用这个 Skill 跑了一遍

一个专门服务于论文写作的去 AI 味 Skill:academic-humanizer

【声明】内容源于网络
0
0
AI前沿速递
AI前沿速递 聚焦人工智能最新科研成果与技术动态,专注前沿论文解读、行业资讯分享与高校招生信息推送,助力AI爱好者和从业者把握学界风向标。每日更新技术干货与深度内容,让全球优秀研究被更多人看见。关注我们,探索AI无限可能!
内容 1995
粉丝 0
AI前沿速递 AI前沿速递 聚焦人工智能最新科研成果与技术动态,专注前沿论文解读、行业资讯分享与高校招生信息推送,助力AI爱好者和从业者把握学界风向标。每日更新技术干货与深度内容,让全球优秀研究被更多人看见。关注我们,探索AI无限可能!
总阅读21.5k
粉丝0
内容2.0k