大数跨境

AI画了70万张图,终于学会什么叫"画对"了

AI画了70万张图,终于学会什么叫"画对"了 AIGC 深一度
2026-07-26
8

PAPER · 论文解读

2026.07

AI画流程图?箭头反了、文字乱码是常态

让AI画出 “结构正确”

的科学方法论图


SciForma · 结构保真 · M-DPO · 北大×浙大×MSRA

SciForma: Structure-Faithful Generation of Scientific Diagrams

CVAIGC

📦 4 PARTS + CONCLUSION

👉 滑动

PART 01

痛点剖析

科学图表为何这么难

 

PART 02

三轴解构

C/A/T结构化评估体系

 

PART 03

M-DPO

多维合取偏好优化

 

PART 04

实验验证

全面超越GPT-Image-1.5

 

PART ///

写在最后

局限与未来方向

核心发现

将图表质量分解为三个独立可验证的轴,用合取偏好优化取代标量奖励,9B模型首次逼近商业级结构保真度

在学术论文中,一张方法流程图的价值不言而喻——它是读者理解研究逻辑的 第一扇窗 。然而,让AI自动生成这类图表,一直是个令人头疼的难题:箭头方向画反、公式文字乱码、模块位置错乱……一个错误就足以让整张图失去意义。

来自 北京大学、浙江大学与微软亚洲研究院 的团队在最新论文中提出了 SciForma ——一个专为科学方法流程图设计的结构保真生成框架。其核心思想是: 不要把图表质量当成一个笼统的分数,而要拆解为组件、箭头、文字三个独立维度分别优化 。基于这一思路训练的 SciForma-9B,在自建基准测试 SciFormaBench-2K 上超越了所有开源模型甚至 GPT-Image-1.5。

— 图1:SciForma 生成的多样化科学方法流程图,覆盖多个学科领域

01

PART


科学图表生成的困境

THE CHALLENGE OF SCIENTIFIC DIAGRAM GENERATION

科学方法流程图与自然图像有本质区别。自然图像追求的是 视觉合理性 ——好看就行;而流程图追求的是 结构保真度 ——每个模块、每条箭头、每段文字都必须精确无误。一个箭头的方向画反,一张图就完全失去了意义。

这种 “不可补偿性” 是问题的核心:你在组件画得再漂亮,如果箭头全错了,整张图依然不及格。论文将这一特性形式化为:

结构保真度是合取性的——单一维度的正确无法弥补另一维度的失败

现有的训练方法为何无法解决这个问题?论文指出两个关键瓶颈:


SFT 的天花板

监督微调能学到“看起来像流程图”的布局分布,但无法保证每个结构元素都正确。它优化的是整体似然,而非逐元素的精确性。


标量奖励的盲区

现有的后训练方法(如 DPO、GRPO、GDRO)将所有维度压缩为 单一标量信号 。这意味着模型在某个维度进步时,可能悄悄在另一个维度退步——而总分数看起来没变。正如论文所述,一个箭头系统性出错但组件正确的模型,其聚合奖励会被 C 和 T 项主导,几乎没有学习压力去修复关键的箭头缺陷。

这一洞察与强化学习领域的经典问题呼应—— 奖励劫持(reward hacking) 。Rafailov 等人提出的 DPO 开创了基于偏好的对齐范式,Shao 等人的 GRPO 将其扩展到在线 RL,但在结构化生成场景下,这些方法都面临“维度坍缩”的根本性挑战。

02

PART


三轴解构:C/A/T 评估体系

STRUCTURAL INVENTORY: COMPONENT · ARROW · TEXT

SciForma 的关键洞察来自一个观察:科学图表的质量不是一个模糊的整体属性,而是可以分解为 三个独立可验证的结构原语 。这一思路借鉴了 UML 活动图和 BPMN 流程建模标准中共享的结构语法。

C · 组件

实体身份与空间布局,模块是否完整、位置是否正确

A · 箭头

信息拓扑关系,连接方向是否正确、有无缺失或幻觉

T · 文字

文本标注,标签是否可读、公式是否准确、有无乱码

论文进一步构建了 SciFormaBench-2K ——一个包含 2000 个样本的评估基准,每个样本都配有经过人工验证的结构清单(structural inventory)。评估时,VLM 逐轴检查输出与清单的匹配度,错误按严重程度分为 关键错误 (权重 1.0,如组件完全缺失)和 中等错误 (权重 0.5,如组件存在但内部结构错误)。

这一分解的价值不仅在于评估,更在于 它为训练提供了精确的诊断信号 。论文通过 Pearson 相关性分析证实,C、A、T 三轴在统计上近乎正交(C-A 相关系数 r < 0.02),这意味着它们确实捕获了不同的失败模式,而非同一问题的不同表述。

表1:图表生成基准对比

基准 范式 元素验证 轴向独立 难度分层
ProImage-Bench 评分量表
GENFIG1 VLM评分
SciFlow-Bench 图匹配
AIBench 层级VQA
SciFormaBench-2K 清单核验

可以看到,现有基准要么依赖整体打分(ProImage-Bench),要么只支持单一维度的细粒度评估(SciFlow-Bench 只做图匹配,AIBench 只做 VQA)。SciFormaBench-2K 是唯一同时支持 元素级验证、轴向独立评分、难度分层 的评估方案。

— 图2:SciFormaData-700K 数据集构建流程。从 59.3 万篇 arXiv 论文中提取 72.6 万张方法图

在数据层面,团队构建了 SciFormaData-700K ——从 59.3 万篇 arXiv 论文的 LaTeX 源文件中提取了 72.6 万张方法流程图。数据集包含 65.6 万组生成配对和 7 万组编辑三元组,每张图都配有沿 C/A/T 三轴分解的结构化描述(平均 547 token),并按拓扑复杂度分为 Low / Medium / High 三档。

03

PART


M-DPO:多维合取偏好优化

MULTI-DIMENSIONAL CONJUNCTIVE PREFERENCE OPTIMIZATION

M-DPO 是本文最核心的方法论贡献。它要解决的根本问题是: 如何在偏好优化中保持三个结构维度的独立信号,同时强制它们同时正确 

传统 DPO(Rafailov et al., 2023)使用全局的赢-输对:一个样本要么整体赢、要么整体输。但两张被拒绝的图可能因为完全不同的原因失败——一张缺箭头,另一张文字乱码。把它们当作等价的负例, 模糊了具体的失败轴向 ,无法提供有针对性的修正信号。

— 图3:M-DPO 算法概述。通过维度锚定的偏好对构建,为每个结构轴计算独立的边际信号

核心设计一:维度锚定的偏好对构建

对每个 prompt,模型生成 K=12 个候选样本,并沿 C/A/T 三轴分别打分。整体最优的候选被选为 共享赢家 y⁺ ,而在每个轴 d 上表现最差(但其他轴仍具竞争力)的候选被选为 轴向输家 y⁻_d 。这样,每个 (y⁺, y⁻_d) 对都隔离了单一维度的失败,为模型提供精确的对比信号。

核心设计二:合取偏好目标函数

M-DPO 的损失函数源自多路 Bradley-Terry 模型,其形式为:

L_M-DPO = log(1 + Σ exp(-β·Δ_d))

其中 Δ_d 为轴向隐式奖励差值,β 为 KL 散度惩罚系数

这个损失函数有一个优雅的数学性质: 只有当所有轴向的 Δ_d > 0 时,损失才趋近于零 。它是硬 AND 约束的光滑松弛——当 D=1 时退化为标准 DPO。

更精妙的是其 自适应梯度重加权 机制。对损失函数求导可得每个轴的有效梯度权重 w_d,它是一个关于性能缺陷的 softmax 分布:当模型在某个轴上仍然偏好输家(Δ_d < 0)时,该轴获得最大的梯度权重;当所有轴都已满足时,所有 w_d → 0,损失消失,训练自然停止。

✦ 与 InfoNCE 的联系

论文证明 M-DPO 等价于一个 InfoNCE 损失,其中负样本不是随机采样的干扰项,而是刻意挖掘的结构化失败模式。这使得每个梯度方向都具有最大的信息量。

SFT 两阶段

结构适应 + 联合生成编辑 → SciForma-Base

M-DPO

多维合取偏好优化 → SciForma-9B

迭代精炼

VLM定位缺陷 → 局部修复 → 验证回滚

SciForma 完整训练与推理管线

— 图4:SciForma 框架总览。(a) 训练管线 (b) SFT数据格式与M-DPO优化 (c) 迭代精炼闭环

04

PART


实验验证与关键发现

EXPERIMENTS AND KEY FINDINGS

SciFormaBench-2K 主实验

论文在 SciFormaBench-2K 上对比了 13 个模型,涵盖商业闭源系统(GPT-Image-2、Nano Banana Pro、GPT-Image-1.5、Wan 2.7)、开源扩散模型(FLUX 系列、Qwen-Image、Z-Image)和全模态模型(Bagel 7B、SenseNova-U1)。结果令人瞩目:

表2:SciFormaBench-2K 主实验结果(部分)

模型 平均 C A T
GPT-Image-2 85.62 83.34 89.61 83.53
SciForma-9B + Edit 72.40 76.70 69.91 70.14
SciForma-9B 69.51 74.49 66.46 67.00
GPT-Image-1.5 68.96 75.70 62.50 68.20
Wan 2.7-Image 64.71 71.90 60.30 61.10
FLUX.2-dev 32B 48.81 62.50 38.60 44.60

关键发现:

1

SciForma-9B(69.51)超越 GPT-Image-1.5(68.96),这是开源模型首次在科学图表生成任务上超过商业闭源系统

2

加上迭代精炼后,SciForma-9B + Edit 达到 72.40,在 Arrow 轴获得最大增益(+2.89)

3

M-DPO 的最大增益出现在 SFT 最弱的两个轴:Arrow +1.82、Text +3.16,完美验证了自适应聚焦机制

M-DPO 打破 SFT 天花板

消融实验揭示了 M-DPO 的核心价值。图 5 展示了从同一 SFT 检查点出发的两条训练轨迹:继续 SFT 3 万步 vs. M-DPO 4000 步。M-DPO 以七分之一的训练步数取得了更大的平均增益(+1.92 vs. +0.37),且在 Text 轴(+3.16 vs. +0.46)和 Arrow 轴(+1.82 vs. +0.01)上的优势尤为显著。

— 图5:训练轨迹对比。红色:M-DPO(更大增益、更少步数);蓝色:继续SFT(在弱势轴上几乎停滞)

继续 SFT 只是在已经较强的轴上“锦上添花”,而 M-DPO 精准地瞄准了残余的结构错误。论文还对比了 GDRO 和 GRPO——这两种方法都将多维信号压缩为标量,结果 GDRO 只是在轴之间重新分配误差,GRPO 甚至导致整体性能下降(-1.29)。

AIBench 与用户研究

在独立的 AIBench 评估中(基于 VQA 验证图表是否有效传达研究逻辑),SciForma-9B 得分 70.29, 甚至超过了人类手绘原图(70.09) ,在拓扑结构维度(Topology)上的领先优势最大(+6.19)。这意味着 AI 生成的图表在传达研究逻辑的清晰度上,已经可以媲美甚至超越研究者亲手绘制的版本。

— 图6:用户研究。36名研究生在结构、文字、视觉质量和总体偏好四个维度上的胜率对比

用户研究进一步验证了自动指标与人类判断的一致性。36 名 AI 方向的研究生在 30 个样本上进行配对偏好评估,结果显示 SciForma-9B 在所有指标上均优于 Wan 2.7-Image,并与 Nano Banana Pro 形成竞争。更重要的是,SciFormaBench-2K 自动评分与用户偏好之间的 Pearson 相关系数达到 r = 0.76,证实了评估体系的可靠性。


— 图7:定性对比。SciForma-9B vs. 商业模型(Wan2.7-Image、GPT-Image-1.5),在结构完整性和文字渲染上的优势清晰可见

— 图8:迭代精炼过程可视化。每轮修正扭曲的形状、错位的箭头和不准确的文字,严格验证-回滚机制确保全局一致性

///

LAST


写在最后

LIMITATIONS AND FUTURE DIRECTIONS

SciForma 的贡献不仅在于一个模型或一个数据集,更在于它提出了一种 结构化评估驱动结构化训练 的范式。当你把“质量”从一个笼统的标量拆解为可独立验证的维度,并用合取目标强制每个维度同时正确时,模型就能学会在最短板上集中火力——这比简单地增加训练步数或模型参数高效得多。

当然,论文也坦诚地讨论了局限性:1024px 分辨率限制了密集图表的精细渲染;评估管线依赖商业 VLM(GPT-5.4);在 Agent 化使用中,结构清单是自动生成的而非人工验证的,可能存在偏差。未来方向包括更高分辨率训练、开源 VLM 评估器,以及人在回路的 Agent 框架。

论文信息:SciForma: Structure-Faithful Generation of Scientific Diagrams
作者:Yuxuan Luo(北大)、Peng Zhang(浙大)、Xinjie Zhang、Xun Guo、Zhouhui Lian(北大)、Yan Lu(MSRA)
代码:github.com/microsoft/SciForma
arXiv:2607.18091v1

如果你觉得今天这篇有收获,欢迎点赞、在看、转发三连,我们下篇见。

既然看到这里了,如果觉得有用,随手点个赞、在看、转发三连吧。

点赞
在看
转发

THANKS FOR READING


【声明】内容源于网络
0
0
AIGC 深一度
专注AIGC领域,关注微软 OpenAI、百度文心一言、讯飞星火 DeepSeek等大语言模型(LLM)的发展和应用落地,聚焦LLM的市场研究和AIGC,欢迎关注 个人网站 https://www.chenbaiqi.com
内容 588
粉丝 0
AIGC 深一度 专注AIGC领域,关注微软 OpenAI、百度文心一言、讯飞星火 DeepSeek等大语言模型(LLM)的发展和应用落地,聚焦LLM的市场研究和AIGC,欢迎关注 个人网站 https://www.chenbaiqi.com
总阅读6.7k
粉丝0
内容588