大数跨境

ASU 魏华:大模型智能体正在重蹈强化学习的覆辙,如何跨越「仿真到现实」的鸿沟? | IJCAI 2026

ASU 魏华:大模型智能体正在重蹈强化学习的覆辙,如何跨越「仿真到现实」的鸿沟? | IJCAI 2026 AI科技评论
2026-08-20
8
导读:当大语言模型化身为智能体走向真实世界,它们面临的困境,与十年前在十字路口指挥交通的强化学习模型如出一辙。
当大语言模型化身为智能体走向真实世界,它们面临的困境,与十年前在十字路口指挥交通的强化学习模型如出一辙。
 作者岑峰 幸丽娟

    编辑丨岑峰

在通往 AGI 的浪潮中,基础模型智能体正以前所未有的速度接管各类任务。业界曾普遍认为,凭借海量预训练知识,智能体能无缝适应各种真实场景。然而现实表明,一旦将英文语境下表现完美的智能体切换至中文或低资源语言环境,其错误率往往断崖式上升。

这种环境切换引发的“智力降级”,真的是大模型时代特有的新问题吗?在 2026 年德国不莱梅 IJCAI 大会的 Early Career Spotlight 环节,亚利桑那州立大学(ASU)助理教授魏华给出了极具启发性的视角:今天大模型智能体面临的脆弱性,本质上与传统强化学习(RL)在物理世界中遭遇的“仿真到现实(Sim-to-Real)”差距如出一辙。

魏华教授早年曾在腾讯 AI Lab 担任研究员,长期深耕强化学习与真实世界决策研究。早在 2017 年,其团队便通过一系列 KDD 论文证明,强化学习不仅能复现传统的“绿波”优化解,甚至能找到更优的调度策略。

但随着研究从实验室走向杭州等真实复杂路网,魏华发现完美的模拟器并不存在。天气、摄像头视角乃至奖励函数的定义,在真实世界中均存在致命偏差。实验室中的完美结果一旦部署至真实街头,面对大雨、大雾及穿行行人,AI 决策往往会瞬间崩溃。

在此次 IJCAI 演讲中,魏华巧妙地将“交通信号灯”与“大语言模型”相连。他指出,无论是机器人、强化学习还是当今的大模型智能体,只要涉及决策与执行,就必然面临动态差距、观察差距和奖励差距。

更为重要的是,他提出既然问题本质相同,完全可以将机器人领域成熟的“域随机化(Domain Randomization)”等技术,直接“平移”到大模型智能体中。最新实验证明,通过对智能体的提示词、动作和奖励空间进行随机化扰动,一个仅 30 亿参数(3B)的模型,在应对跨语言等“仿真到现实”难题时,表现甚至能击败 320 亿参数(32B)的大型模型。

此外,魏华强调了“不确定性量化”与“人类在环(Human-in-the-loop)”的终极价值:智能体可以无限扩展,但不能增加人类的监督负担。机器必须知晓自己“何时不知道”,并精准地向人类求助。

以下是魏华教授的演讲分享,演讲题目为《Towards Reliable Agents》。AI 科技评论根据其英文演讲内容进行了深度编辑与精简:

Towards Reliable Agents(迈向可靠智能体)

演讲者:亚利桑那州立大学助理教授 魏华(Hua Wei)

大家好。我是亚利桑那州立大学计算与人工智能学院的助理教授魏华。非常荣幸来到 IJCAI 讲台,分享我过去研究的反思、不同视角的尝试以及对未来工作的展望。

我们团队的核心命题始终是:能否为现实世界的复杂决策,构建真正可靠的智能体(Agents)?

01

完美的模拟器,与混乱的物理世界

回到 2017 年,从我最初研究的“交通信号控制强化学习”说起。我们希望通过协调城市每一个交通信号灯,让车辆更顺畅通行,并将其部署到物理世界中。

这一时期,我们 focused 于多智能体系统和“仿真到现实(sim-to-real)”迁移研究。以交通信号控制为例,智能体的“状态”是路口排队车辆数,“动作”是切换红绿灯,“奖励”则是最小化所有车辆的通行时间

在 2018 年和 2019 年的 KDD 论文中[1,2],我们证明了强化学习确实能学到与传统运筹优化相同的最优解,如著名的“绿波”效应,且能更好地适应非匀速的真实车流。

然而,当试图把在模拟器里训练成熟的算法部署到现实(如中国杭州的真实复杂路网)时,问题随之出现。模拟器中汽车行为高度规律,但现实世界每个交通参与者都有独立目的,路况瞬息万变,根本不存在能完美拟合真实物理世界的模拟器。

这就是“仿真到现实(Sim-to-Real)”差距。基于此认知,我们深入研究 Sim-to-Real 迁移问题,目标是让模型在模拟环境与真实世界的表现无限趋近,使差距接近于零。

在研究中[3],我们将这种复杂的现实鸿沟系统性拆解为五个子维度:观察差距(Observation Gaps)、状态差距(State Gaps)、动作差距(Action Gaps)、动态差距(Dynamics Gaps)以及奖励差距(Reward Gaps)。

例如动态差距:模拟器中变绿灯假设所有车顺利通过;但在真实雨雾雪天,车辆行驶缓慢,同样绿灯时长可能只有两辆车通过,剩余车辆被堵在路口。这意味着相同的状态和动作,在虚实两个世界会导致完全不同的下一个状态。

随着时间推移,这种偏差会像滚雪球般增大。在 AAAI 2024 的工作[4]中,我们尝试将天气等背景信息作为条件输入来缩小差距,但仍无法做到完美。

还有观察差距:训练中摄像头视野清晰;但在雾天、雪天或黑夜,传感器捕捉画面大打折扣[5]。模型如何保证在完美视觉下训练的策略,在恶劣天气或夜间依然鲁棒?

以及奖励差距:模拟器里唯一目标是最小化汽车通行时间。但在真实世界,还需考虑行人安全和通行效率。一旦引入真实约束,原本设定的完美奖励函数会发生剧变,目标函数的错位会导致智能体做出危险决策。

02

大模型智能体,正在重蹈覆辙

刚才谈论的是传统强化学习,但我们惊讶地发现:如今备受追捧的基础模型智能体,正面临完全相同的挑战,只是人们换了一套术语。

以大模型的多语言能力为例,用英语提问表现完美无瑕;若切换到中文、德语甚至低资源语言,错误率便断崖式上升。在自然语言处理(NLP)领域,这被称为多语言泛化难题。

但在上周的 KDD 大会上[6],我们提出:基础模型智能体中的可靠性问题,本质上就是一个标准的“仿真到现实”问题。

如果把每种语言看作一种“模态”,模型的训练数据主要是一种模态(英语语境,相当于“模拟器”),而测试环境是另一种模态(其他语言,相当于“复杂的真实世界”)。这就完美对应了前述的“观察差距”。

既然问题本质相通,我们完全可以从成熟的强化学习或机器人领域“借用”破局思路。

03

用“域随机化”为大模型降维解局

在机器人控制中,为弥补模拟器与现实差距,常用一种叫“域随机化(Domain Randomization)”的技术:在训练时人为对输入文本、标题、描述甚至动作和奖励空间进行随机化扰动,以提升模型在真实世界中的鲁棒性。

我们将这一理念直接引入大语言模型智能体中。在测试大模型时,对其输入文本、提示词、参数描述甚至面临的动作与奖励空间,进行大规模“随机化重写与扰动”[7,8]。结果令人振奋:一个仅仅 30 亿(3B)参数的小模型,在经过域随机化处理后,其应对跨环境差距的表现几乎接近完美,甚至击败了规模大十倍的 320 亿(32B)参数的最佳模型。

这说明,机器人领域历经检验的“抗干扰”哲学,在今天的大模型智能体时代依然是利器。动作、奖励、转换等维度的差距,是所有决策智能体共通的顽疾。

04

随机化与“不确定性量化”的安全底线

最后,谈谈我个人目前极其兴奋的研究方向:不确定性量化(Uncertainty Quantification)。在试图弥合虚实鸿沟的所有方案中,我们必须承认一个现实:可能永远无法做到完美的闭环。

面对充满未知的真实世界,若要保证智能体不出致命错误,最终极的防线始终是“人类在环(Human-in-the-loop)”。机器必须知道自己“什么时候不确定”,知道何时自主决断,何时呼叫人类支援,在关键时刻将决策权交给人类。

为此,我们为大模型定义了四个层级的不确定性量化[9]

1. 答案本身是否值得信任?

2. 模型的推理逻辑是否脆弱?

3. 能否精确定位是哪一步推理犯了错?

4. 该智能体的认知是否与其他模型/系统对齐?

总结而言,“仿真到现实”的差距广泛存在于机器人学、强化学习、真实世界以及基础模型智能体等大多数决策场景中。我们呼吁上述领域学者建立一套共通的底层词汇与评估标准,以便测试并共享相同技术。

在未来,智能体可以无限制扩大规模、接管更多任务,但人类的监督负担绝不能随之呈指数级加重。让机器学会在不确定时求助,把最关键的问题留给人类,才是 AI 走向真实世界的最优解。

以上是我的演讲。如果你们对这一话题感兴趣,欢迎进一步交流。

Hua Wei, Guanjie Zheng, Huaxiu Yao and Zhenhui Li. IntelliLight: A ReinforcementLearning Approach for Intelligent Traffic Light Control. In Proceedings of the 24th ACMSIGKDD International Conference on Knowledge Discovery and Data Mining (KDD2018).

[2] Hua Wei, Chacha Chen, Guanjie Zheng, Kan Wu, Vikash V. Gayah, Kai Xu andZhenhui Li. PressLight: Learning Max Pressure Control to Coordinate Traffic Signals inArterial Network. In Proceedings of the 25th ACM SIGKDD International Conference on Knowledge Discovery and Data Mining (KDD 2019).

[3] Longchao Da, Justin Turnau, Thirulogasankar Pranav Kutralingam, AlvaroVelasquez, Paulo Shakarian, Hua Wei. A Survey of Sim-to-Real Methods in RL:Progress,ProspectsandChallengeswithFoundationModels.https://arxiv.org/abs/2502.13187

[4] Longchao Da, Minchiuan Gao, Hao Mei, Hua Wei. 2024. Prompt to transfer:Sim-to-real Transfer for Traffic Signal Control with Prompt Learning. In Proceedings of the Thirty-Eighth AAAl Conference on Artificial Intelligence (AAAl'24).

[5] Tiejin Chen, Prithvi Parag Shirke, Bharatesh Chakravarthi, Arpitsinh RohitkumarVaghela, Longchao Da, Duo Lu, Yezhou Yang, Hua Wei. SynTraC: A Synthetic Datasetfor Traffic Signal Control from Traffic Monitoring Cameras. In Proceedings of 27th IEEE International Conference on Intelligent Transportation Systems (ITSC'24).

[6] Xiaoou Liu, Tiejin Chen, Weibo Li, Xiyang Hu, Hua Wei. The Sim-to-Real Gap ofFoundation Model Agents: A Unified MDP Perspective. In the Proceedings of the 32nd

SIGKDD Conference on Knowledge Discovery and Data Mining (KDD'26).

[7] Xiaolin Zhou, Aojie Yuan, Zheng Luo, Zipeng Ling, Xixiao Pan, Yicheng GaoHaiyue Zhang, Jiate Li, Shuli Jiang, Prince Zizhuang Wang, Zixuan Zhu, Jinbo Liu,Ryan A Rossi, Hua Wei, Xiyang Hu. When Simulation Lies: A Sim-to-Real BenchmarkDomain-RandomizedRLTool-UseandRecipeforAgents

https://arxiv.org/abs/2605.11928

[8] Xiaoou Liu, Longchao Da, Hanyang Chen, Yuan Ling, Hua Wei. AndroidReality:How Far Are Mobile Agents from the Real World? https://arxiv.org/abs/2608.07775

[9] Xiaoou Liu, Tiejin Chen, Longchao Da, Chacha Chen, Zhen Lin, Hua Wei.

Uncertainty Quantification and Confidence Calibration in Large Language Models: ASurvey. In the Proceedings of the 31st ACM SIGKDD International Conference on

Knowledge Discovery and Data Mining (KDD'25).

上车,带你看遍全球 AI 顶会精华

可独家畅览:

专家演讲 PPT

大会报告全文

热门论文解读

学术新星访谈

//

推荐阅读

IJCAI 研究卓越奖得主 Nick Jennings:一个智能体的聪明,不如一群智能体的相遇|IJCAI 2026


IJCAI-ECAI 2026 开幕:吴佳俊斩获「计算机与思想奖」,SMOTE 算法获首届时间检验奖

未经「AI 科技评论」授权,严禁以任何方式在网页、论坛、社区进行转载!

公众号转载请先在「AI 科技评论」后台留言取得授权,转载时需标注来源并插入本公众号名片。

【声明】内容源于网络
0
0
AI科技评论
聚焦AI前沿研究,关注AI工程落地。
内容 8902
粉丝 0
AI科技评论 聚焦AI前沿研究,关注AI工程落地。
总阅读213.7k
粉丝0
内容8.9k