大数跨境

北大校友倪天炜博士加入谷歌DeepMind,研究Agent自进化!

北大校友倪天炜博士加入谷歌DeepMind,研究Agent自进化! 智猩猩AI
2026-09-30
21
导读:曾获 NeurIPS Oral~
智猩猩AI整理
编辑:没方

最近,倪天炜在X上宣布,他已经加入 Google DeepMind 担任研究科学家。


在官宣帖中,倪天炜提到,博士期间自己的研究主要围绕 History-Dependent Reinforcement Learning(历史依赖强化学习) 展开,重点关注记忆、表示和适应性。


这几个关键词,也几乎串起了他过去几年的整个研究轨迹。


倪天炜本科就读于北京大学计算机科学专业,随后前往卡内基梅隆大学,获得机器学习硕士学位。


之后,他进入蒙特利尔大学攻读博士,同时加入 Mila,师从 Pierre-Luc Bacon。


博士期间,倪天炜还与普林斯顿大学的 Benjamin Eysenbach、麦吉尔大学的 Aditya Mahajan 等研究者合作,并曾在 Amazon 实习。



他博士早期的工作主要关注 POMDP(部分可观测马尔可夫决策过程)。2022 年 ICML 的工作 《Recurrent Model-Free RL Can Be a Strong Baseline for Many POMDPs 》中,他系统研究了循环神经网络在部分可观测环境中的表现,发现结构相对简单的 recurrent model-free RL,也能成为不少 POMDP 任务中的强基线。


随后,他开始进一步拆解“历史信息到底该怎么用”。


2023 年 NeurIPS Oral 论文《When Do Transformers Shine in RL? Decoupling Memory from Credit Assignment》。重点区分了强化学习中的记忆(memory)与信用分配(credit assignment)问题,研究 Transformer 在什么类型的长时序任务中真正具有优势。



2024 年 ICLR 的工作则进一步转向状态与历史表示学习,尝试统一理解 MDP 和 POMDP 中的表示问题,并研究自预测表示在不同环境中的作用。



博士后期,他的研究进一步扩展到智能体如何利用新的经验持续适应。


其中一条研究线转向 offline-to-online RL。从“稳定性—可塑性”的视角研究策略在线微调过程中如何既保留已有能力,又根据新经验继续学习。


2026 年,他又进一步提出 Adaptive Policy Prior 的思路,主张重新思考传统 Offline RL 的目标:与其从静态数据中训练一个部署后不再变化的策略,不如学习一个能够作为后续在线学习起点、并随着新经验继续适应的策略先验。



从记忆、表示,到适应性,倪天炜的研究也逐渐从传统强化学习走向更复杂的智能体问题。


如今,他也将在 Google DeepMind 继续围绕强化学习、持续学习,以及 LLM Agent 的自进化展开研究。

END


关注+星标,获取AI前沿进展与开源一线动态

【声明】内容源于网络
0
0
智猩猩AI
智猩猩旗下AI技术内容账号,关注AI大模型掀起的范式革命,追踪AI大时代涌现的开源项目。
内容 2391
粉丝 0
智猩猩AI 智猩猩旗下AI技术内容账号,关注AI大模型掀起的范式革命,追踪AI大时代涌现的开源项目。
总阅读5.4k
粉丝0
内容2.4k