一次生成不够准,就让模型看一眼结果、算一次误差,再主动纠偏。
在参考图像驱动的生成任务中,我们已经越来越擅长告诉模型「想要什么」:给它一张人脸,它可以生成同一人物的新照片;给它一幅姿态骨架,它可以让人物摆出指定动作;给它一张深度图,它也能复现相应的空间结构。
但「给出条件」并不等于「严格执行」。
人物的身份特征可能在生成过程中悄悄漂移,手脚关节可能偏离骨架,前景与背景的深度边界也可能变得模糊。更关键的是,绝大多数现有方法在条件送入模型之后,生成过程便一路向前:模型不会主动检查结果与参考图是否一致,更谈不上根据误差进行修正。
这其实是一个典型的「开环」系统。
来自上海交通大学、上海创智学院和电子科技大学的研究团队换了一个视角:如果把预训练生成模型看成一个待控制的对象,那么,能否像控制温度、速度或机械臂那样,用反馈机制不断缩小生成结果与目标之间的偏差?
在 ECCV 2026 论文《From Open Loop to Closed Loop: A Test-Time Iterative Optimization Framework for Reference-Consistent Image Generation》中,研究者给出的答案是肯定的。他们提出一种无需训练、模型无关的测试时迭代优化框架,并用经典的 PID 控制器,让图像生成第一次拥有了明确的「生成—检测—纠偏」闭环。
实验覆盖身份保持、姿态控制与深度控制三类任务。与计算量匹配的 best-of-N 开环基线相比,该方法将人脸相似度相对提升最高 25.36%,并将姿态和深度误差最高分别降低 27.71% 和 28.50%。
相关信息
-
论文:https://arxiv.org/abs/2607.04691
-
项目:https://github.com/zzdrill/From-Open-Loop-to-Closed-Loop
-
作者:Baixuan Zhao、Xinyu Zhang、Huayu Zheng、Shuaicheng Liu、Xiongkuo Min、Guangtao Zhai、Xiaohong Liu
介绍
论文提出的开环与闭环生成框架如下图所示:
参考条件给了,模型为什么还是会「跑偏」?
以身份保持生成(ID-preserving generation)为例。用户输入一张参考人像和一句文本描述,希望模型在改变服装、背景或动作的同时,保留人物身份。IP-Adapter、InstantID、PhotoMaker、PuLID 等方法通常会先把参考图编码成身份特征,再将这些特征注入扩散模型。
问题在于,这些特征一旦送入,后续生成基本就是单向的。
系统知道自己收到了什么条件,却不知道最终执行得怎么样。即使生成的人脸已经偏离参考身份,模型也没有一个显式模块去观察结果、计算偏差并发出修正信号。姿态和深度控制也存在同样的问题:条件图只是输入,不是模型必须持续追踪的目标。
从控制论的角度看,现有流程可以写成:
参考条件 → 编码器 → 生成模型 → 输出图像
这条链路没有反馈,因此属于开环控制。它的效果高度依赖生成模型一次性理解并执行条件的能力,也容易受到随机种子、复杂提示词和模型自身偏差的影响。
论文的核心洞察并不复杂:既然一次生成可能有误差,就不要把第一次结果当作终点,而应把它当作一次可测量的系统响应。
给生成模型装上「传感器」和「控制器」
研究团队将参考一致性生成重新定义为一个离散时间下的动态跟踪问题。整个系统包含五个部分:参考图像、编码器、控制器、受控对象和传感器。
-
目标状态:从参考图像中提取出的身份、姿态或深度特征; -
受控对象:带有可控适配器的预训练生成模型; -
传感器:从当前生成结果中重新测量身份、姿态或深度状态; -
跟踪误差:目标状态与当前测量状态之间的差值; -
控制器:根据当前及历史误差,更新下一轮输入给模型的控制信号。
于是,原本的一次前向生成被改写为一个循环:
生成图像 → 测量输出 → 计算误差 → 更新控制信号 → 再次生成
值得注意的是,同一个预训练特征提取器可以扮演双重角色:面对参考图时,它是编码器,负责定义目标;面对生成图时,它又是传感器,负责报告系统当前到达的位置。生成模型本身则被当作黑盒,权重、结构和原有推理流程都不需要修改。
这使得该方法更像一个包裹在现有管线外部的轻量「控制外壳」,而不是一套需要重新训练的新生成模型。
为什么偏偏是 PID?
PID 是工业控制中最经典的算法之一。它不要求提前知道被控对象的精确数学模型,只需要观察误差,就能据此调整控制量。这一点与复杂、黑盒、高维的生成模型天然契合。
PID 的三个字母分别代表:
-
P(比例项):根据当前误差立即纠偏; -
I(积分项):累积历史误差,消除长期残留偏差; -
D(微分项):关注误差变化趋势,抑制过冲并加快稳定。
不过,经典 PID 不能直接照搬到图像生成上。
传统动态系统往往具有内部状态,而图像生成模型在这里更接近一个「无记忆」系统:每次输出主要取决于当前控制输入和文本提示。当误差逐渐接近零时,传统 PID 的控制信号也会随之减弱;但对生成任务而言,如果失去持续的参考条件,目标人物或结构本身也可能消失。
为此,论文提出了改进版 PID,将参考图提取出的目标状态始终保留为基础控制信号,再让 P、I、D 三项只负责学习残差补偿:
其中, 是参考图对应的目标状态, 是第 轮生成结果与目标之间的误差, 则是下一轮送入生成模型的控制条件。
直观地说,目标状态负责告诉模型「不要忘记要生成谁、什么姿态或什么结构」,PID 残差则负责告诉它「上一轮具体偏到了哪里,下一轮应该往哪个方向改」。
一套框架,覆盖三类参考一致性任务
这套闭环框架的通用性,来自对「状态」和「传感器」的灵活定义。
在身份保持生成中,系统把人脸识别网络输出的身份嵌入作为状态。参考人脸与生成人脸的嵌入差值,就是控制器需要消除的误差。
在姿态控制中,状态变成二维人体关键点或姿态图。传感器从生成图像中重新估计姿态,再计算各个关节与目标位置的空间偏差。
在深度控制中,状态则是逐像素的深度图。系统比较目标深度与生成图像估计深度之间的差异,并据此修正下一轮空间控制信号。
换句话说,框架本身没有绑定某一种生成任务。只要某个参考条件可以被编码、生成结果可以被可靠地重新测量,并且二者位于可比较的状态空间中,就有机会被纳入同一套闭环逻辑。
实验:闭环纠偏比重复采样更有效
为了排除「多生成几次自然更容易得到好结果」这一因素,论文采用了计算量匹配的比较:身份保持任务对比 best-of-20 开环采样,姿态和深度任务对比 best-of-15。结果表明,利用反馈有方向地修正控制信号,明显优于无反馈地反复“抽卡”。
身份保持
在身份保持任务中,该框架接入 PuLID、PhotoMaker v2、InstantID 和 IP-Adapter 后均带来提升。其中,PuLID 在 CelebA300 上的人脸相似度由 0.560 提升至 0.702,相对增幅达到 **25.36%**;语义匹配、感知质量和结构多样性则整体保持稳定。递归生成实验也显示,闭环反馈能有效减缓多轮生成中的身份漂移。
姿态控制
在 ControlNet 上,闭环优化将姿态误差降低 **27.71%**。从可视化结果看,它能够有效修正关节错位与复杂肢体动作。
深度控制
在深度控制任务中,闭环优化将 ControlNet 的误差降低 **28.50%**,尤其能够改善模糊或错误的前景—背景深度边界。
PID 参数敏感性
消融实验进一步表明,P 项负责主要纠偏,I 项改善最终对齐,D 项帮助加速收敛;完整 PID 取得最佳综合表现。三类任务通常在前 1—5 轮快速改善,随后进入稳定微调,同时对随机种子的波动也明显减小。
代价与边界:闭环不是免费的
这项工作的优势是低侵入、无需训练和可插拔,但代价也很明确。
首先,每一轮闭环迭代都包含一次完整的扩散去噪,整体延迟随迭代轮数近似线性增长。在 RTX 4090 上,身份保持任务每轮平均约 4.2 秒,姿态控制每轮约 11.6 秒;若分别执行 20 轮和 15 轮,总耗时并不低。
其次,当前 PID 系数仍需要按任务手动设置。论文中身份、姿态和深度任务采用不同参数,后续若能引入自适应控制,有望进一步降低调参成本。
最后,闭环效果取决于传感器是否可靠。如果人脸编码器、姿态估计器或深度模型自身存在偏差,控制器可能会追逐一个不准确的测量目标。如何应对传感器噪声,也将决定这套框架能否扩展到更复杂、更开放的场景。
从「一次预测」到「持续纠偏」
这篇论文最值得关注的,或许不只是把 PID 用到了图像生成中,而是它对可控生成提出了一种不同的系统观。
过去,我们往往把重点放在如何设计更强的条件编码器、更复杂的适配器,或者如何在训练阶段加入一致性约束。它们试图让模型在一次前向过程中做得更准。而这项工作提出:即使模型本身保持不变,也可以在推理时通过外部反馈,把一次性的条件注入变成一个持续追踪目标的过程。
对生成式 AI 来说,这是一种从「给出指令,然后等待结果」到「观察结果,根据偏差继续行动」的变化。
当模型开始学会回头看,生成也就不再只是一次随机采样,而更像一个能够测量、控制和逐步收敛的动态过程。经典控制理论由此获得了一个新的落点,而参考一致性图像生成,也从开环迈向了闭环。
感谢你看到这里,添加小助手 AIGC_Tech 加入官方 AIGC读者交流群,下方扫码加入 AIGC Studio 星球,获取前沿AI应用、AIGC实践教程、大厂面试经验、AI学习路线以及IT类入门到精通学习资料等,欢迎一起交流学习💗~

