PAPER · 论文解读 2026.07
AI画流程图?箭头反了、文字乱码是常态
让AI画出 “结构正确”
的科学方法论图
SciForma · 结构保真 · M-DPO · 北大×浙大×MSRA
SciForma: Structure-Faithful Generation of Scientific Diagrams
📦 4 PARTS + CONCLUSION
👉 滑动
PART 01
痛点剖析
科学图表为何这么难
PART 02
三轴解构
C/A/T结构化评估体系
PART 03
M-DPO
多维合取偏好优化
PART 04
实验验证
全面超越GPT-Image-1.5
PART ///
写在最后
局限与未来方向
核心发现
将图表质量分解为三个独立可验证的轴,用合取偏好优化取代标量奖励,9B模型首次逼近商业级结构保真度
在学术论文中,一张方法流程图的价值不言而喻——它是读者理解研究逻辑的 第一扇窗 。然而,让AI自动生成这类图表,一直是个令人头疼的难题:箭头方向画反、公式文字乱码、模块位置错乱……一个错误就足以让整张图失去意义。
来自 北京大学、浙江大学与微软亚洲研究院 的团队在最新论文中提出了 SciForma ——一个专为科学方法流程图设计的结构保真生成框架。其核心思想是: 不要把图表质量当成一个笼统的分数,而要拆解为组件、箭头、文字三个独立维度分别优化 。基于这一思路训练的 SciForma-9B,在自建基准测试 SciFormaBench-2K 上超越了所有开源模型甚至 GPT-Image-1.5。
— 图1:SciForma 生成的多样化科学方法流程图,覆盖多个学科领域
01
PART
科学图表生成的困境
THE CHALLENGE OF SCIENTIFIC DIAGRAM GENERATION
科学方法流程图与自然图像有本质区别。自然图像追求的是 视觉合理性 ——好看就行;而流程图追求的是 结构保真度 ——每个模块、每条箭头、每段文字都必须精确无误。一个箭头的方向画反,一张图就完全失去了意义。
这种 “不可补偿性” 是问题的核心:你在组件画得再漂亮,如果箭头全错了,整张图依然不及格。论文将这一特性形式化为:
结构保真度是合取性的——单一维度的正确无法弥补另一维度的失败
现有的训练方法为何无法解决这个问题?论文指出两个关键瓶颈:
SFT 的天花板
监督微调能学到“看起来像流程图”的布局分布,但无法保证每个结构元素都正确。它优化的是整体似然,而非逐元素的精确性。
标量奖励的盲区
现有的后训练方法(如 DPO、GRPO、GDRO)将所有维度压缩为 单一标量信号 。这意味着模型在某个维度进步时,可能悄悄在另一个维度退步——而总分数看起来没变。正如论文所述,一个箭头系统性出错但组件正确的模型,其聚合奖励会被 C 和 T 项主导,几乎没有学习压力去修复关键的箭头缺陷。
这一洞察与强化学习领域的经典问题呼应—— 奖励劫持(reward hacking) 。Rafailov 等人提出的 DPO 开创了基于偏好的对齐范式,Shao 等人的 GRPO 将其扩展到在线 RL,但在结构化生成场景下,这些方法都面临“维度坍缩”的根本性挑战。
02
PART
三轴解构:C/A/T 评估体系
STRUCTURAL INVENTORY: COMPONENT · ARROW · TEXT
SciForma 的关键洞察来自一个观察:科学图表的质量不是一个模糊的整体属性,而是可以分解为 三个独立可验证的结构原语 。这一思路借鉴了 UML 活动图和 BPMN 流程建模标准中共享的结构语法。
C · 组件
实体身份与空间布局,模块是否完整、位置是否正确
A · 箭头
信息拓扑关系,连接方向是否正确、有无缺失或幻觉
T · 文字
文本标注,标签是否可读、公式是否准确、有无乱码
论文进一步构建了 SciFormaBench-2K ——一个包含 2000 个样本的评估基准,每个样本都配有经过人工验证的结构清单(structural inventory)。评估时,VLM 逐轴检查输出与清单的匹配度,错误按严重程度分为 关键错误 (权重 1.0,如组件完全缺失)和 中等错误 (权重 0.5,如组件存在但内部结构错误)。
这一分解的价值不仅在于评估,更在于 它为训练提供了精确的诊断信号 。论文通过 Pearson 相关性分析证实,C、A、T 三轴在统计上近乎正交(C-A 相关系数 r < 0.02),这意味着它们确实捕获了不同的失败模式,而非同一问题的不同表述。
表1:图表生成基准对比
| 基准 | 范式 | 元素验证 | 轴向独立 | 难度分层 |
|---|---|---|---|---|
| ProImage-Bench | 评分量表 | ✗ | ✗ | ✗ |
| GENFIG1 | VLM评分 | ✗ | ✗ | ✗ |
| SciFlow-Bench | 图匹配 | ✓ | ✗ | ✗ |
| AIBench | 层级VQA | ✗ | ✓ | ✗ |
| SciFormaBench-2K | 清单核验 | ✓ | ✓ | ✓ |
可以看到,现有基准要么依赖整体打分(ProImage-Bench),要么只支持单一维度的细粒度评估(SciFlow-Bench 只做图匹配,AIBench 只做 VQA)。SciFormaBench-2K 是唯一同时支持 元素级验证、轴向独立评分、难度分层 的评估方案。
— 图2:SciFormaData-700K 数据集构建流程。从 59.3 万篇 arXiv 论文中提取 72.6 万张方法图
在数据层面,团队构建了 SciFormaData-700K ——从 59.3 万篇 arXiv 论文的 LaTeX 源文件中提取了 72.6 万张方法流程图。数据集包含 65.6 万组生成配对和 7 万组编辑三元组,每张图都配有沿 C/A/T 三轴分解的结构化描述(平均 547 token),并按拓扑复杂度分为 Low / Medium / High 三档。
03
PART
M-DPO:多维合取偏好优化
MULTI-DIMENSIONAL CONJUNCTIVE PREFERENCE OPTIMIZATION
M-DPO 是本文最核心的方法论贡献。它要解决的根本问题是: 如何在偏好优化中保持三个结构维度的独立信号,同时强制它们同时正确 ?
传统 DPO(Rafailov et al., 2023)使用全局的赢-输对:一个样本要么整体赢、要么整体输。但两张被拒绝的图可能因为完全不同的原因失败——一张缺箭头,另一张文字乱码。把它们当作等价的负例, 模糊了具体的失败轴向 ,无法提供有针对性的修正信号。
— 图3:M-DPO 算法概述。通过维度锚定的偏好对构建,为每个结构轴计算独立的边际信号
核心设计一:维度锚定的偏好对构建
对每个 prompt,模型生成 K=12 个候选样本,并沿 C/A/T 三轴分别打分。整体最优的候选被选为 共享赢家 y⁺ ,而在每个轴 d 上表现最差(但其他轴仍具竞争力)的候选被选为 轴向输家 y⁻_d 。这样,每个 (y⁺, y⁻_d) 对都隔离了单一维度的失败,为模型提供精确的对比信号。
核心设计二:合取偏好目标函数
M-DPO 的损失函数源自多路 Bradley-Terry 模型,其形式为:
L_M-DPO = log(1 + Σ exp(-β·Δ_d))
其中 Δ_d 为轴向隐式奖励差值,β 为 KL 散度惩罚系数
这个损失函数有一个优雅的数学性质: 只有当所有轴向的 Δ_d > 0 时,损失才趋近于零 。它是硬 AND 约束的光滑松弛——当 D=1 时退化为标准 DPO。
更精妙的是其 自适应梯度重加权 机制。对损失函数求导可得每个轴的有效梯度权重 w_d,它是一个关于性能缺陷的 softmax 分布:当模型在某个轴上仍然偏好输家(Δ_d < 0)时,该轴获得最大的梯度权重;当所有轴都已满足时,所有 w_d → 0,损失消失,训练自然停止。
✦ 与 InfoNCE 的联系
论文证明 M-DPO 等价于一个 InfoNCE 损失,其中负样本不是随机采样的干扰项,而是刻意挖掘的结构化失败模式。这使得每个梯度方向都具有最大的信息量。
SFT 两阶段
结构适应 + 联合生成编辑 → SciForma-Base
M-DPO
多维合取偏好优化 → SciForma-9B
迭代精炼
VLM定位缺陷 → 局部修复 → 验证回滚
SciForma 完整训练与推理管线
— 图4:SciForma 框架总览。(a) 训练管线 (b) SFT数据格式与M-DPO优化 (c) 迭代精炼闭环
04
PART
实验验证与关键发现
EXPERIMENTS AND KEY FINDINGS
SciFormaBench-2K 主实验
论文在 SciFormaBench-2K 上对比了 13 个模型,涵盖商业闭源系统(GPT-Image-2、Nano Banana Pro、GPT-Image-1.5、Wan 2.7)、开源扩散模型(FLUX 系列、Qwen-Image、Z-Image)和全模态模型(Bagel 7B、SenseNova-U1)。结果令人瞩目:
表2:SciFormaBench-2K 主实验结果(部分)
| 模型 | 平均 | C | A | T |
|---|---|---|---|---|
| GPT-Image-2 | 85.62 | 83.34 | 89.61 | 83.53 |
| SciForma-9B + Edit | 72.40 | 76.70 | 69.91 | 70.14 |
| SciForma-9B | 69.51 | 74.49 | 66.46 | 67.00 |
| GPT-Image-1.5 | 68.96 | 75.70 | 62.50 | 68.20 |
| Wan 2.7-Image | 64.71 | 71.90 | 60.30 | 61.10 |
| FLUX.2-dev 32B | 48.81 | 62.50 | 38.60 | 44.60 |
关键发现:
SciForma-9B(69.51)超越 GPT-Image-1.5(68.96),这是开源模型首次在科学图表生成任务上超过商业闭源系统
加上迭代精炼后,SciForma-9B + Edit 达到 72.40,在 Arrow 轴获得最大增益(+2.89)
M-DPO 的最大增益出现在 SFT 最弱的两个轴:Arrow +1.82、Text +3.16,完美验证了自适应聚焦机制
M-DPO 打破 SFT 天花板
消融实验揭示了 M-DPO 的核心价值。图 5 展示了从同一 SFT 检查点出发的两条训练轨迹:继续 SFT 3 万步 vs. M-DPO 4000 步。M-DPO 以七分之一的训练步数取得了更大的平均增益(+1.92 vs. +0.37),且在 Text 轴(+3.16 vs. +0.46)和 Arrow 轴(+1.82 vs. +0.01)上的优势尤为显著。
— 图5:训练轨迹对比。红色:M-DPO(更大增益、更少步数);蓝色:继续SFT(在弱势轴上几乎停滞)
继续 SFT 只是在已经较强的轴上“锦上添花”,而 M-DPO 精准地瞄准了残余的结构错误。论文还对比了 GDRO 和 GRPO——这两种方法都将多维信号压缩为标量,结果 GDRO 只是在轴之间重新分配误差,GRPO 甚至导致整体性能下降(-1.29)。
AIBench 与用户研究
在独立的 AIBench 评估中(基于 VQA 验证图表是否有效传达研究逻辑),SciForma-9B 得分 70.29, 甚至超过了人类手绘原图(70.09) ,在拓扑结构维度(Topology)上的领先优势最大(+6.19)。这意味着 AI 生成的图表在传达研究逻辑的清晰度上,已经可以媲美甚至超越研究者亲手绘制的版本。
— 图6:用户研究。36名研究生在结构、文字、视觉质量和总体偏好四个维度上的胜率对比
用户研究进一步验证了自动指标与人类判断的一致性。36 名 AI 方向的研究生在 30 个样本上进行配对偏好评估,结果显示 SciForma-9B 在所有指标上均优于 Wan 2.7-Image,并与 Nano Banana Pro 形成竞争。更重要的是,SciFormaBench-2K 自动评分与用户偏好之间的 Pearson 相关系数达到 r = 0.76,证实了评估体系的可靠性。
— 图7:定性对比。SciForma-9B vs. 商业模型(Wan2.7-Image、GPT-Image-1.5),在结构完整性和文字渲染上的优势清晰可见
— 图8:迭代精炼过程可视化。每轮修正扭曲的形状、错位的箭头和不准确的文字,严格验证-回滚机制确保全局一致性
///
LAST
写在最后
LIMITATIONS AND FUTURE DIRECTIONS
SciForma 的贡献不仅在于一个模型或一个数据集,更在于它提出了一种 结构化评估驱动结构化训练 的范式。当你把“质量”从一个笼统的标量拆解为可独立验证的维度,并用合取目标强制每个维度同时正确时,模型就能学会在最短板上集中火力——这比简单地增加训练步数或模型参数高效得多。
当然,论文也坦诚地讨论了局限性:1024px 分辨率限制了密集图表的精细渲染;评估管线依赖商业 VLM(GPT-5.4);在 Agent 化使用中,结构清单是自动生成的而非人工验证的,可能存在偏差。未来方向包括更高分辨率训练、开源 VLM 评估器,以及人在回路的 Agent 框架。
论文信息:SciForma: Structure-Faithful Generation of Scientific Diagrams
作者:Yuxuan Luo(北大)、Peng Zhang(浙大)、Xinjie Zhang、Xun Guo、Zhouhui Lian(北大)、Yan Lu(MSRA)
代码:github.com/microsoft/SciForma
arXiv:2607.18091v1
如果你觉得今天这篇有收获,欢迎点赞、在看、转发三连,我们下篇见。
既然看到这里了,如果觉得有用,随手点个赞、在看、转发三连吧。
THANKS FOR READING









