大数跨境

自然·人文与社会科学通讯:大语言模型正在重写复杂系统仿真的规则

自然·人文与社会科学通讯:大语言模型正在重写复杂系统仿真的规则 集智俱乐部
2026-07-16
6
导读:系统梳理LLM赋能智能体仿真的研究进展

导语


如何让复杂系统中的“智能体”真正像人一样思考、交流、协作与适应,而不仅仅是执行预设规则?随着大语言模型(LLMs)的快速发展,基于智能体的建模与仿真(ABMS)正从规则驱动走向语言驱动,为社会、经济、城市、网络等复杂系统的模拟带来了新的可能。本文系统梳理了LLM赋能智能体仿真的研究进展,围绕智能体能力构建、仿真系统设计、典型应用场景及评估方法展开分析,并总结了规模化、多智能体协作、鲁棒性、伦理治理等关键挑战,展望了构建更真实、更可解释、更可控复杂系统模拟平台的发展方向。


关键词:大语言模型(Large Language Models, LLMs)、基于智能体的建模与仿真(Agent-based Modeling and Simulation, ABMS)、LLM赋能智能体(LLM-empowered agents)、复杂系统(Complex Systems)、社会仿真(Social Simulation)

赵思语丨作者
赵思怡丨审校


论文题目:Large Language Models Empowered Agent-based Modeling and Simulation: A Survey and Perspectives

论文链接:https://www.nature.com/articles/s41599-024-03611-3

发表时间:2024年9月27日

论文来源:Nature :humanities and social sciences communications





从“规则驱动”到“语言驱动”:

复杂系统仿真的新入口




如果要理解一个城市的交通拥堵、一场舆论风暴的扩散、一个市场价格的波动,或者一次疫情在社区中的传播,研究者很难只靠单个公式给出完整解释。因为这些现象不是由某一个中心控制者直接决定的,而是由大量个体在环境中不断行动、交流、适应之后共同产生的结果。基于智能体的建模与仿真(Agent-based Modeling and Simulation)正是为这类问题而生。它把复杂系统拆解为一个个“智能体”(agents),让每个智能体拥有自己的属性、状态、行为规则和决策方式,再让它们在某个环境中相互作用,由此观察宏观层面的涌现现象。

过去的智能体仿真主要依赖预设规则、符号方程、随机模型或机器学习模型。它们在交通流、行人运动、生态系统、市场交易等场景中都发挥过重要作用,但也有一个共同局限:智能体往往像“写死的规则机器”,能够对特定刺激作出反应,却很难像人一样理解语境、解释意图、调整目标,更难在陌生环境中迁移经验。论文指出,传统仿真中的“反应式架构”(reactive architectures)虽然高效,却难以处理需要长期规划、深层推理和复杂策略的任务;而面向真实世界的仿真又常常需要同时描述系统如何运行、解释模式为何出现、预测未来状态并探索假设情景,现有方法很难兼顾准确性、可解释性、适应性和可靠性。

这正是大语言模型进入这一领域的原因。LLM并不只是会生成文本,它们在理解自然语言、进行推理、拆解任务、调用工具、与其他智能体交流方面表现出新的可能性。对于仿真来说,这意味着智能体不再只能根据固定规则“触发动作”,而是可以通过语言理解环境,通过记忆连接过去经验,通过规划安排未来行动,并通过对话与其他智能体协同或竞争。换句话说,语言正在成为连接“环境—智能体—行动”的新接口。

图1:大语言模型智能体如何满足基于智能体建模与仿真的能力需求。左侧是仿真系统对智能体的要求,包括社会能力、自主性、反应性和主动性;右侧是LLM Agent的能力,包括感知、推理、决策、自我演化,以及通过接口、内部机制和动作与环境交互。




更类人的智能体:

感知、推理、演化与异质性




真实仿真需要智能体具备四类能力:自主性(autonomy)社会能力(social ability)反应性(reactivity)主动性(pro-activeness)自主性意味着智能体不能时时依赖人工干预,而应能根据目标和环境独立运行;社会能力意味着它们能够与其他智能体或人类交流合作或竞争;反应性意味着智能体能够感知环境变化并及时调整;主动性则意味着它们还能围绕目标主动探索、规划和执行。这些要求对应到现实场景中非常具体:行人在城市中移动不仅沿最短路径,还会避开拥挤、受天气和同伴影响;消费者选商品不只看价格,还受偏好、预算和信息不完整影响;社交网络用户转发信息,也与情绪、立场和群体压力有关。因此论文特别强调“有限理性”(bounded rationality)——人类并不总是做出完全理性的最优选择,而是在知识有限、信息不完整的情况下做出“足够可接受”的决定,一个更真实的仿真也需要容纳这种不完美。

大语言模型的价值正在于,它可以为智能体提供更接近人类的认知复杂性。论文将LLM用于仿真的核心能力概括为四个方面。感知(perception):在传统仿真中,环境往往被编码为变量和状态表;而在LLM Agent中,环境可以通过自然语言描述、规则文本甚至多模态输入传递给模型,智能体能够从第一视角理解情境。推理与决策(reasoning and decision making):LLM Agent可以在有限指令下自主规划,动态调整策略,甚至形成新目标,使仿真从“执行脚本”走向“在环境中生活”。自适应学习与演化(adaptive learning and evolution):LLM Agent可以通过上下文学习、记忆模块和新数据吸收,在长期仿真中表现出类似学习曲线的变化。异质性与个性化(heterogeneity and personalizing):通过角色提示、背景设定和偏好描述,不同智能体可以呈现差异化行为,提供了一种比传统参数校准更灵活的异质性建模方式。




搭建LLM仿真系统:

环境、行动与评估




构建LLM Agent仿真面临四个关键环节。环境与接口是第一步。已有研究中的环境大致分为虚拟环境和真实环境。虚拟环境包括游戏、沙盒世界、虚拟公司或推荐系统;真实环境则包括真实网站、城市空间和经济市场。例如Generative Agents构建了名为Smallville的沙盒世界,让多个LLM Agent安排日常生活、建立关系并组织群体活动;WebAgent则让智能体在真实网页上执行浏览和操作任务。接口方面,多数工作仍以文本为主要媒介——即使环境本身是复杂的沙盒或网页,也需要被转写为文本描述再由LLM理解,而智能体之间的交流也主要通过文本完成,使对话、协商和信息传播具有更强可解释性。

动作模拟依赖三个重要机制:规划(planning)让智能体把复杂任务拆解为子任务,例如在游戏中将“挖到钻石”分解为收集资源、制作工具、寻找矿洞等步骤;记忆(memory)让智能体保存过去经验,不必每次都从零开始;反思(reflection)则让智能体根据反馈修正策略。这三者共同构成LLM Agent从静态知识库走向动态认知体的关键。评估同样不可或缺:微观层面关注单个智能体的行为是否真实,宏观层面关注群体涌现现象是否接近真实数据。LLM的一大优势是能生成自然语言解释,研究者可直接询问智能体为何采取某个行动,获得比传统黑箱模型更可读的行为说明。不过论文也提醒,偏见、公平性和有害输出检测同样是评估的一部分。

图2:LLM Agent基于智能体建模与仿真的主要应用域。论文将已有场景划分为社会域、物理域、网络域,以及融合多个系统的混合域。




四大领域的应用图景:

从社交网络到城市仿真




论文将LLM智能体仿真划分为四个应用领域。

社会域最为丰富,包含社会网络与经济学两个重要分支。

图3.社会科学中LLM智能体仿真任务分类(社交网络 / 合作机制 / 个体行为)

在社会网络动力学方面,S³系统用LLM Agent模拟社交网络中的情绪、态度和互动,在性别歧视、核能等议题上复现了真实社会动态。在合作仿真方面,CHATDEV把LLM Agent组织成虚拟软件公司,设置CEO、程序员、设计师等角色完成软件开发;MetaGPT也通过产品经理、架构师、工程师等角色模拟标准化开发流程;AgentVerse则更进一步,实现了智能体的自适应生成,能够根据任务动态调整团队构成。在个体行为层面,Humanoid Agents融入了基本需求、情感和关系亲近度等认知要素,使智能体决策更贴近真实人类。

经济系统仿真从个体到市场分为三个层次。个体层面,研究者用LLM复现行为经济学实验,观察其是否呈现公平偏好、利他倾向等人类特征;交互层面,研究集中在博弈论环境,考察合作与策略选择;系统层面则包括消费市场和宏观经济系统。有研究让数百个智能体模拟劳动与消费行为,成功涌现出菲利普斯曲线(Phillips curve)和奥肯定律(Okun’s law)等宏观经济规律,这是传统方法难以做到的。

物理域关注人类移动、导航、交通和无线网络。在导航任务中,LM-Nav、LLM-Planner等工作让语言模型参与具身智能体规划。交通仿真中,研究者将LLM Agent接入CARLA驾驶模拟器,引入记忆模块和安全准则,使驾驶行为更接近真实人类。

网络域对应数字空间行为,如网页浏览和推荐系统交互。WebAgent可根据自然语言指令拆解网页任务并与真实网站交互;RecAgent和Agent4Rec让LLM扮演用户与推荐系统互动,为推荐算法评估提供新测试方式。

混合域同时包含物理空间、社会行为和网络信息。Generative Agents中的Smallville虚拟小镇让智能体自发组织社交活动;WarAgent用LLM代表国家模拟国际冲突决策;UGI则将数字孪生城市与城市大模型CityGPT结合,为城市中的移动、导航、社交和经济活动仿真提供平台。这类混合域仿真更复杂,也更接近LLM Agent真正可能发挥价值的方向。

图4.展示经济系统仿真的三个层次:个体行为、交互行为和经济系统级行为。




五个开放问题:

规模、基准、平台、鲁棒性与伦理




尽管前景广阔,论文并没有把LLM Agent仿真描述为成熟技术,而是集中讨论了五个开放问题。规模化效率:多智能体仿真通常希望同时模拟大量角色并让它们通信和协商,但大规模LLM社会的计算成本极高。已有研究尝试通过模型压缩、批量提示和共享消息池降低成本,其中批量提示可提升推理效率数倍,但全流程加速仍是难题。

基准:当前不少基准评估LLM Agent的规划、推理或工具使用能力,但专门用于评估“仿真质量”的基准仍不足——一个好的仿真基准不应只问智能体是否完成任务,还应评估个体行为是否真实、群体模式是否涌现、解释是否合理、偏见是否可控。

开放平台:城市生成智能等工作已开始尝试开放平台,但整体而言,LLM驱动的基于智能体仿真仍缺少通用、可复现、可扩展的平台生态,研究容易停留在各自构建的小型原型系统中,难以比较和积累。

鲁棒性:LLM本身受对抗提示和分布外输入影响,而LLM Agent往往还具备工具调用能力并处于多智能体传播场景中,一旦某个智能体受攻击,影响可能在智能体社会中扩散。更复杂的是,多智能体仿真会出现从众、同质性等类人群体行为——这既是仿真价值所在,也可能成为被攻击者利用的弱点。

伦理风险:当给ChatGPT分配某些人格设定时,可能产生更高毒性输出,涉及歧视性刻板印象和冒犯性语言。LLM Agent在信息传播中可能表现出人类式偏见并在多智能体设置中进一步放大。这意味着用LLM模拟人类社会不是中性技术实践,研究者必须重视人类价值对齐、偏见测量、角色刻板化问题和模型可解释性。




结语




这篇综述的核心贡献不在于提出某一个新的算法,而在于把一个正在快速形成的研究方向系统地组织起来:大语言模型正在重塑基于智能体的建模与仿真范式。过去,智能体更多是规则和方程的执行者;现在,LLM Agent有可能成为能够感知、推理、交流、记忆、反思并持续适应环境的仿真主体。但这也意味着,越是像人的系统,越需要严肃评估——它们可能更会交流,也可能更会传播偏见;能够生成解释,但解释本身是否可靠仍需验证。未来关键问题不只是让更多Agent在更大环境中运行,而是让这种运行可验证、可解释、可复现、可约束。LLM Agent仿真真正打开的,不是“虚拟社会游戏”,而是一种研究复杂系统的新实验室——让我们有机会在可控环境中观察个体如何形成群体、局部互动如何涌现宏观规律。



AI+Social Science读书会


集智俱乐部联合美国东北大学博士后研究员杨凯程、密歇根大学安娜堡分校博士候选人裴嘉欣,宾夕法尼亚大学沃顿商学院人力资本分析研究组博士后研究员吴雨桐、即将入职芝加哥大学心理学系的助理教授白雪纯子,共同发起AI+Social Science读书会读书会已完结,现在报名可加入社群并解锁回放视频权限。

详情请见:
AI+Social Science:大模型怎样重塑社会科学 | 计算社会科学读书会第三季启动



推荐阅读
1. 天津大学薛霄团队:从仿真到解释:计算实验框架下的社会模拟器演化
2. 从社会学实验到行为仿真:理解基于Agent的观点动力学建模思维
3. 《AI×SCIENCE十大前沿观察》6:AI 仿真与系统模拟
4. 9900分可兑换“涌现”文化衫,报名任意读书会送299积分!
5. 集智学园精品课程免费开放,解锁系统科学与 AI 新世界

6. 高考分数只是张入场券,你的科研冒险在这里启航!

7. 加入集智字幕组:成为复杂科学知识社区的“织网人”


#速递

点击“阅读原文”,报名读书会

【声明】内容源于网络
0
0
集智俱乐部
关注复杂科学与人工智能的前沿进展、书籍资料、工具文献、交叉前沿等,同时也发布集智俱乐部、集智学园举办的各类讲座、课程等活动相关信息。
内容 4713
粉丝 0
集智俱乐部 关注复杂科学与人工智能的前沿进展、书籍资料、工具文献、交叉前沿等,同时也发布集智俱乐部、集智学园举办的各类讲座、课程等活动相关信息。
总阅读3.1k
粉丝0
内容4.7k