大数跨境

大模型会“扮演人”,但真的懂人吗?一套新框架,给 AI 的“人味”做体检

大模型会“扮演人”,但真的懂人吗?一套新框架,给 AI 的“人味”做体检 微软亚洲研究院
2026-07-08
4
导读:系统评估大模型在人类偏好、行为一致性与群体多样性上的模拟能力

(本文阅读时间:8 分钟)

当 AI 扮演用户时,往往能迅速给出看似合理的回答:模仿影迷选片、模拟网友讨论,甚至基于历史足迹预测下一站去向。

随着大模型能力提升,智能 NPC、用户模拟器及社会仿真应用日益逼真。然而核心问题随之而来:AI 生成的行为,真的像人吗?

它是否真正理解了个体的偏好、思维与长期习惯?在多轮交互后能否保持“同一个人”的一致性?当模拟成千上万用户时,能否呈现出真实社会般丰富多样的人群分布?

近期,微软亚洲研究院提出了一套面向大模型类人行为的计算评测框架。研究发现,大模型虽能生成部分合理的个体行为,但距离稳定、可信且丰富的人类行为模拟仍有差距。相关论文已被ICML 2026接收。

论文信息已整理至文末,欢迎点击相关链接了解更多技术详情。

一个会聊天的 AI,未必会“生活”

传统图灵测试关注人类能否在短时对话中分辨机器与人。这类测试虽有价值,却存在天然局限:几分钟的聊天仅能展现 AI 行为的一个切面。模型或许能在单轮对话中表现自然,却难以在数十轮选择、回答或行动中持续保持人格、偏好和逻辑的一致。

更重要的是,真实世界中的许多行为并无唯一正确答案。同一用户在相似情境下的重复选择也可能不同:可能在两部感兴趣的电影间做出不同抉择,或以不同措辞回答同一问题。此时,评估关键不再是“答对了吗”,而是 AI 生成的行为是否符合该用户可能呈现的偏好与行为分布。

用真实世界行为,给 AI 做一次“人味体检”

研究员未采用人工编写的考题,而是直接从真实世界的公开行为数据中寻找答案。研究覆盖三类典型场景:

  • 在线购物:用户在电商平台中的连续购买与浏览偏好;
  • 开放问答:用户在开放社区中的回答、观点与表达方式;
  • 城市出行:用户在基于位置服务平台上留下的时空签到轨迹。

在每个场景中,研究员先利用用户历史行为构建画像,再让大模型模拟该用户后续的多轮行为,最后将 AI 模拟结果与真实用户行为进行对比。

整个框架由四部分组成:真实行为数据、LLM 模拟器、用户行为编码器和评测器。真实行为数据提供被模拟用户的历史轨迹及用于对照的真实后续行为;LLM 模拟器根据用户画像和当前情境生成后续选择;用户行为编码器从大量真实数据中学习“什么样的连续行为属于同一个人”,将行为序列映射为表征偏好、风格与模式的高维向量;评测器则在此基础上,从多维度判断 AI 行为的类人性。

该框架核心设计不依赖特定任务形式,只要具备足够的真实用户行为数据,即可扩展至评论撰写、日记创作、饮食选择等更多开放式场景。与单纯评估“一条回答像不像人”不同,这套框架旨在从个体到群体、从即时行为到长期轨迹,全面评估 AI 的类人程度。

图 1:整体评测框架图

判断 AI 是否“像人”,不能只看一个维度

研究员将“类人性”拆解为三个核心原则:理性(Rationality)一致性(Consistency)多样性(Diversity)

理性:这一刻,它像不像这个用户?

理性并非指“绝对正确”,而是指 AI 行为是否符合该用户的历史偏好与模式。例如,若用户过去持续购买温馨爱情片和圣诞题材电影,AI 后续突然推荐科幻惊悚片或无关音乐视频,便偏离了其兴趣轨迹。

研究从两个角度衡量这一点:

  • 可区分性(Distinguishability):AI 生成的行为是否容易被识别为机器行为;
  • 可预测性(Predictability):AI 后续生成的行为是否与该用户已有画像相匹配。

换言之,AI 不仅要“说得通”,更要“像这个人会做出的选择”。

一致性:前后还是不是同一个人?

人类行为虽会变化,但通常存在稳定的底层模式:长期兴趣、表达风格、知识边界、思维习惯以及出行消费规律。

若 AI 刚到达一处餐厅,十几秒后又“瞬移”至二十公里外的办公室,这种行为即便单独看合理,置于连续轨迹中也显不可信。因此,研究进一步衡量 AI 生成行为序列的前后两部分,是否仍像同一个用户。

多样性:一群 AI,真的像一群人吗?

这是对社会模拟至关重要却易被忽略的一点。模型能为单个用户生成合理答案,不代表能模拟真实人群。若不同 AI 用户最终表现出相似偏好、表达和推理路径,那么看似庞大的模拟社会,本质上只是同一种人格的重复复制。

因此,研究从群体层面比较真实用户和 AI 用户的行为分布:真实用户群体中的每一种偏好、风格和行为模式,能否在 AI 模拟群体中找到相近的对应者?

更大的模型更像人,但仍未达到真实人类水平

本研究评估了 Phi、Mistral、Qwen2.5、Qwen3、Llama-3.1 和 GPT-4o 等 14 个主流模型版本。

总体上,模型规模越大,类人行为模拟能力越强。GPT-4o 综合表现领先,Llama-3.1 和 Qwen 系列紧随其后。但“最好”并不意味着“足够像人”。在在线购物、开放问答和城市出行三个场景中,表现最佳的模型与真实用户相比,综合得分仍分别存在约 10%、17% 和 10% 的差距。其中,开放式问答是最具挑战的场景。

这是因为,在候选集内选商品或地点,模型只需在有限空间中决策;而在开放问答中,模型不仅要模仿语言风格,还需复现用户的知识范围、价值判断、推理习惯和世界观。“写得通顺”远不等于“这个人真的会这么想”。

表 1:三类场景下的主实验结果。Cons、Dist、Pred、Div 和 Avg 分别表示一致性、可区分性、可预测性、多样性及四项指标平均得分。该研究评估的所有模型均为指令微调版本。对于真实用户,研究员直接使用其真实行为而非 LLMs 生成的模拟行为来计算各项指标。

AI 会不会把千万个用户,模拟成“同一种人”?

在群体层面的可视化分析中,研究员发现了一个值得关注的现象:分布坍缩

较小模型在模拟不同用户时,往往生成较为集中的行为模式。不同 AI 用户看似拥有不同画像,最终却可能给出高度相似的偏好、观点和回答。随着模型规模增大,这种现象有所缓解:模拟用户在行为空间中的分布变得更广,更接近真实用户群体。但即便是更强的大模型,依然无法完全覆盖真实人群的丰富性。

图 2:真实用户与模拟用户的嵌入分布可视化

这对于社会仿真、用户模拟和产品测试尤为重要。如果 AI 用户群体缺少真实多样性,基于这些模拟人群得出的结论可能会高估某些偏好、忽视少数群体,甚至导向错误的产品与社会判断。

从答对问题,走向拟合人类行为分布

本篇论文的核心意义不仅在于提出一套新的评测指标,更尝试重新审视一个长期被简化的问题:评估 AI 是否像人,不能只看短对话或通过试题的能力,更要看其在真实、开放、长期的行为过程中,能否表现出稳定、合理且多样的人类特征。这对未来的数字人、智能 NPC、个性化助手、用户模拟器和社会仿真系统而言,是一项基础能力。

当然,类人行为模拟的目标并非让 AI 在所有场景中伪装成人,而是帮助科研人员更清晰地理解,当 AI 被用于模拟、预测或服务人类时,其能力边界究竟在哪里。

从“像人说话”,到“像人行动”,再到“像一群不同的人共同生活”——大模型距离真正可信的人类行为模拟,仍在路上。

A Computational Framework for Evaluating Human-likeness in LLMs'Open-ended Human Behaviors (ICML 2026)

论文链接:
https://icml.cc/virtual/2026/poster/65092

#大模型评估 #类人行为 #ICML #行为数据

【声明】内容源于网络
0
0
微软亚洲研究院
1234
内容 217
粉丝 0
微软亚洲研究院 1234
总阅读7.4k
粉丝0
内容217