当前,GPT-5.5 已能撰写专业论文,DeepSeek-V4-Pro 可生成复杂代码,具身机器人亦能完成基础物理操作,语言智能与工具智能均已形成独立赛道。然而,将 AI 置于家庭聚餐、团队会议或医患对话等社交场景中,其表现往往生硬且不合时宜。
这并非知识储备不足,而是“读懂人心”的社会心智能力尚未跟上。从“任务执行”迈向“社会协作”,补齐这一短板至关重要。
7 月 24 日,中国科学院计算技术研究所智能算法安全全国重点实验室“知境”团队正式发布知境社会心智大模型技术体系。该体系旨在为现有大模型注入“情商”与可信任感,使其在关键社会场景中真正靠得住、信得过。
先体检再开方:SoMBench 构建社会心智评测基准
知境团队首要工作是建立精细化的“体检表”——SoMBench。该基准将抽象的“懂人”能力拆解为3 大一级维度、17 个二级维度及 71 项细粒度任务,覆盖从基础信念推断到高阶情绪理解、从社会规范到关系建模的全谱系。
基于 3481 道经人类专家严格评审的实例,SoMBench 绘制出详尽的社会心智“能力地图”。其核心价值不仅在于评分,更在于精准定位错误模式:通过多题型交叉验证及受控改写等手段,系统能识别模型是推理链断裂还是依赖表面模式,从而为后续训练提供明确靶点。
测试数据显示,20 个顶级大模型在 SoMBench 上的最强正确率仅为 72.08%,无一突破 90% 天花板,印证了社会心智仍是 AI 领域的“无人区”。
社会心智之所以艰难,是因为 AI 需在同一场景中同步处理角色关系、隐含意图、情绪变化及未言之语等多层复杂推理,这对普通大模型构成了巨大挑战。
Zing 训练体系:让目标随能力动态进化
针对诊断出的短板,知境团队摒弃了单纯堆砌数据与算力的传统路径,设计了一套自适应进化的训练系统 Zing。
FLARE 数据飞轮:针对性合成新样本
Zing 引入 FLARE 机制,将评测作为导航仪。当模型暴露认知缺陷时,系统会定位具体维度并合成全新的训练样本。这些样本在语义和场景上与原题不同,但直指同一能力弱点,确保模型“哪里弱练哪里,且每次都是新题”,避免过拟合。
两阶段训练策略:从通识打底到专项强化
第一阶段通用打底:利用多教师蒸馏构建冷启动数据,结合 Mixed-Reward GRPO 强化学习框架。奖励目标随模型能力动态调整,而非固定不变。
第二阶段专项强化:针对情绪理解、意图推断等薄弱环节,先通过监督微调注入领域知识,再利用困难样本持续校准,确保在增强专项能力的同时不丢失通用推理能力。
OPD 在线蒸馏:探索与守界并重
为解决强化学习中“学新忘旧”的风险,Zing 采用OPD(On-Policy Distillation)技术。通过在在线轨迹上引入教师模型的 token 级分布约束,让 GRPO 负责“向前探索”,OPD 负责“守住边界”,实现能力进化与稳定性之间的平衡。
实测数据:小参数模型展现大心智
在五项国际权威社会心智评测基准中,Zing 系列模型表现优异。
△ 知境·Zing 在 5 项社会心智能力评测中的性能对比
Zing-27B:多模态综合能力超越 GPT-5.5
Zing-27B 五项综合均值为79.80,超越 GPT-5.5 的 78.44。尤其在 HiToM(递归信念追踪)和 EmoBench(情绪理解)上优势显著,成为首个在该基准上超越 GPT-5.5 的百亿参数级公开模型。
Zing-32B:文本模型比肩 DeepSeek-V4-Pro
Zing-32B 综合均值达76.32,略超 DeepSeek-V4-Pro。其在 EmoBench 上领先 6.25 个百分点,证明了专项社会心智训练在情感理解维度的结构化优势。
Zing-8B/14B:小模型实现大跨越
8B 与 14B 模型在 HiToM 基准上分别达到 78.08 和 80.00,超越同尺寸基座模型近 12 和 8 个百分点,甚至优于参数量数十倍的大模型。结果表明,社会心智能力的提升源于训练方法的结构化设计,而非单纯的参数堆砌。
△ 知境·Zing 在高阶信念推理评测中的性能对比
Actio 架构:将“懂人心”转化为工程能力
为解决部署时的稳定性问题,知境推出Actio显式心智状态部署架构。该架构以 Harness 为核心,根据任务需求选择性激活四类支撑模块:
- PRISM:76 项分层心理与社交技能按需路由;
- Starling Memory:显式记录并版本化更新“谁、何时、相信什么”;
- SAGE:跨任务可复用的推理经验库;
- Gated RAG:社会文化知识按需检索与验证。
△ 知境·Actio 系统总览
Actio 如同经验丰富的社工,知道何时调用何种能力,避免信息过载,确保 AI 在真实场景中不仅“会想”更能“做对”。
应用前景:从实验室走向真实世界
具身智能:赋予机器人“心眼”
知境的小参数模型为端侧部署提供了可能,未来可应用于家庭看护、儿童陪伴及协作机器人等场景,让机器人在行动之余懂得察言观色、适时互动。
复杂决策推演:重大选择的预演沙盘
在政策沟通、危机管理及组织变革等场景中,该技术可帮助决策者提前推演各方反应及连锁后果,辅助制定更周全的策略。
人机共生:构建统一心智协议
面向多智能体长期协作,知境框架可提供统一的心智状态表达与共享协议,消除认知错位,实现人类、机器人与 AI Agent 的高效协同。
结语:社会智能成为 AGI 新赛道
知境团队通过 SoMBench 评测、Zing 自适应训练及 Actio 部署架构,成功将社会心智从模糊的“情商”概念转化为可测量、可训练、可工程的独立能力。
尽管跨任务迁移与长期交互稳定性仍需进一步验证,但“懂人心”已正式从玄学走向系统工程。在语言智能之后,社会智能正成为通用人工智能(AGI)发展的下一个核心赛道。
知境团队 中国科学院计算技术研究所智能算法安全全国重点实验室
GitHub:https://github.com/Zhijing-AI/Zing(评测基准、模型权重等后续将陆续开源)
项目技术报告:https://zhijing-ai.github.io/Zing/Zing_TechReport.pdf

