导语
“三个臭皮匠,顶个诸葛亮”,这种行为科学中的群体智慧在很早就已经被发现。人们认为普通人独立判断的聚合结果可以逼近真相,但集体讨论的效果并不稳定,交流既能提升判断精度,也会诱发羊群偏差。已有研究发现,小群体审议的共识甚至优于大规模独立人群,可背后作用机制一直不明。这项 Nature Communications研究开展三项共 1140 人次线上群体审议实验,区分出两种共识生成路径:汇总个体原始猜测,或是搁置初始答案、协同拆解问题做近似推演,后者被命名为集体费米估算。研究证实,协同拆解问题正是审议式群体智慧的核心。同时团队研发文本语义与大模型自动化识别工具,为优化群体研讨提供实证依据与技术方案。
关键词:群体智慧、集体费米估算(Collective Fermi Estimation)、集体推理、群体审议

论文题目:Collective problem decomposition improves the wisdom of deliberative crowds
论文链接:https://doi.org/10.1038/s41467-026-76365-y
发表时间:2026年8月5日
论文来源:Nature Communications
为什么集体推理时灵时不灵
为什么集体推理时灵时不灵
一百多年前,高尔顿在集市上观察到,数百名普通人对牛体重的猜测取平均,结果几乎与真实重量完全吻合。此后大量研究证实,大量普通人独立判断的聚合结果,甚至能够超越个别专家,这套规律被广泛应用在地缘事件预测、金融市场预判、医疗辅助诊断等诸多现实场景当中。
但长久以来学界一直存在一个充满矛盾的谜题:当人们开展集体讨论之后,群体的判断有时会变得更加精准,有时却会出现羊群效应,发生判断的严重偏移。社会互动究竟什么时候可以提升集体判断,什么时候又会毁掉群体智慧,这始终是行为科学领域亟待解答的关键问题。
阿根廷托夸托・迪・特拉大学的 Federico Barrera‑Lemarchand 与合作者开展了一组包含三项实验、累计 1140 人次线上聊天室群体审议的系列研究,揭示出其中关键:群体决策存在两条完全不同的路径,一条是交换各自的初始猜测,对数字做整合;另一条则是搁置初始答案,大家共同拆解复杂问题,对子问题做近似估算之后重新推导结果,研究者将后者命名为集体费米估算。研究证实,正是这种共同拆解问题的推理模式,构成了审议式群体智慧的核心驱动力。同时该研究还开发出借助文本语义与大语言模型自动识别该推理模式的工具,为未来设计更好的群体研讨环境提供实证依据与技术方案。
两种共识路径:汇总答案,还是共同重算?
两种共识路径:汇总答案,还是共同重算?
当小组需要估计一个未知数值时,可能采取两种本质不同的策略。
第一种是数字汇集(Sharing Numbers):成员公开各自的初始答案,再通过平均、取中位数或剔除极端值形成共识。例如,四个人分别估计埃菲尔铁塔高100米、200米、500米和800米,小组可以舍弃两端数值,将中间两个答案平均为350米。此时,集体判断仍是个人原始判断的再加工,并未产生新的推理过程。
第二种是集体费米估算(Collective Fermi Estimation):成员暂时搁置初始猜测,转而共同分析问题结构。面对同一道题,小组可以把铁塔近似看作一栋100层建筑,再以每层约3.5米估算,最终得到350米。这个答案来自问题拆解、局部粗算和重新整合,是群体共同建立的新推理链条。
过去的研究已经发现,小组讨论形成的共识有时优于对独立判断的简单聚合,但由于缺少完整的对话记录,人们一直无法判断:精度提升究竟来自更高明的数字汇总,还是来自真正的集体推理?为回答这一问题,研究团队设计了三项层层递进的实验。
研究一:自发拆解问题的小组,估算更加准确
第一项探索性研究招募500名参与者,组成125个四人小组。实验分为三个阶段:参与者首先独立回答8道常识类数值估算题,并报告信心;随后,每组在文字聊天室中讨论随机抽取的4道题,在五分钟内形成共识;最后,参与者再次独立回答全部题目,并可修改先前答案。
研究首先复现了“审议型群体智慧”(Wisdom of Deliberative Crowds):聚合少量小组的共识答案,比汇总规模更大的独立人群更准确。参与者再次独立作答时,经过小组讨论的题目也表现出更大的误差下降。
图1. 研究一的三阶段实验流程。 参与者依次完成独立估算、四人聊天室审议和再次独立估算。
这种提升并不是由少数强者主导的。无论按照初始准确率还是自信程度排序,四名成员的发言比例都接近均等的25%,说明收益来自广泛参与的互动过程。为了识别不同的讨论策略,10名经过训练的标注员对聊天记录进行评分,分别衡量对话中数字汇集和集体费米估算的使用程度。结果显示,两类评分高度负相关:多数小组明显偏向其中一种路径。更重要的是,数字汇集得分越高,共识误差越大。费米估算得分越高,共识误差越小。
研究二:实验操纵建立因果,指令驱动问题拆解提升集体精度
研究一揭示了相关关系,但仍不能证明问题拆解本身导致了准确率提升。为此,团队开展了预注册实验,将240名参与者组成60个四人小组,并在讨论前随机播放两种不同的指导视频。
数字汇集组被要求分享并整合初始答案,费米估算组则被要求把大问题拆成若干较小的估算任务,分别近似计算后再合成最终答案。结果显示,接受费米指令的小组误差显著更低。盲评结果同时证明,两种指令确实塑造了不同的对话方式:数字汇集组更多重复成员的初始数字,费米组则表现出更强的问题拆解和近似计算特征。
图2. 实验 2 的结果。在集体审议阶段之前,参与者会收到一项指令:要么分享数值,要么进行近似计算并重新计算该数值。
进一步分析发现,费米组的集体答案平均能够超过组内73%的初始个人答案,而数字汇集组为63%。因此,集体费米估算并不只是纠正最差答案,还能更频繁地超越组内原本最准确的个体。研究者还检验了两种替代解释。结果显示,费米组的优势既不能归因于更高的信息多样性,也不能归因于成员语言逐渐趋同。真正发生改变的,是小组推理问题的方式。
研究三:费米估算,多人协作优于个体独自推演
即使费米方法确实有效,仍有一个问题:优势究竟来自方法本身,还是来自多人互动?第三项预注册实验招募160名参与者,其中80人组成20个四人小组,另外80人独立完成任务。所有人接受相同的费米方法指导,并被要求写下推理过程。两种条件之间唯一的区别,是是否能够与他人讨论。结果显示,独立使用费米方法同样可以提高准确率,但集体讨论带来的改善幅度更大。对于实际进行过费米推理的题目,集体条件明显优于个体条件。对于未经过审议的题目,两组没有显著差异。
研究者认为,这一额外收益可能来自群体层面的元认知纠错(Metacognitive Error Correction)。问题拆解会产生多个中间假设,而在互动中,成员可以检查并修正彼此的局部推理。诸如“太多了”“太少了”“这样更合理”等纠错表达,在集体对话中远多于个体书写。这类表达出现得越多,参与者后续作答越准确。值得注意的是,纠错语言在研究二的费米组与数字汇集组之间没有显著差异。这说明它解释的是为什么集体执行费米方法优于个人执行,而不是为什么费米方法优于数字汇集。
图3. 实验 3 的实证结果。A 组中半数参与者被分组,接收原始费米指令,以小组形式应用费米法;B 组中剩余半数参与者独立进行实验,接收改良版费米指令,要求其以个人形式应用费米法。
研究启示与局限:重新理解审议式群体智慧
研究启示与局限:重新理解审议式群体智慧
最后,团队使用5种不同的大语言模型读取聊天记录,并依据费米方法的正式定义给出0—10分评价。模型评分与人工标注高度相关,而且使用AI评分后,三项研究的核心结论均可复现。这表明,费米式推理是一种稳定、可识别的对话模式,也为大规模监测和优化群体讨论提供了技术基础。群体智慧并不只是把许多答案放在一起取平均。真正高质量的集体判断,来自成员共同拆解问题、提出可检验的近似假设,并在互动中不断修正中间步骤。让群体变得更聪明的关键,不只是增加参与者数量,而是改变他们形成共识的方式。
群体智能读书会
如果你对这些反直觉但极有用的现象感兴趣——从蚁群搭桥、鱼群同步、到无人机集群表演、集群机器人协作、群智优化与多智能体系统、网络舆论建模研究等——欢迎加入「群体智能」读书会:我们用动物—人类—机器三条线,希望把群体智能的涌现这件事讲清楚、讲透彻;用物理学、数理逻辑、多主体建模、计算传播等多学科视角,去追问同一个核心:集群何以比个体更聪明?群体智能又在何时涌现?
集智俱乐部联合北京师范大学系统科学学院韩战钢教授、暨南大学计算传播研究中心赵甜芳副教授、新疆大学物理科学与技术学院玉素甫·艾比布拉副教授等来自11所高校的学者,共同发起本次「群体智能」读书会,尝试用一条普适的线索,把自然界的鸟群蚁群、人类社会的集群行为、以及人工智能时代的多智能体与群智优化,放在同一张地图上重新理解。读书会现已结束,欢迎所有对群体智能如何涌现、如何被理解、以及如何被设计,感兴趣的朋友加入读书会,查看回放。
8. 高考分数只是张入场券,你的科研冒险在这里启航!
9. 加入集智字幕组:成为复杂科学知识社区的“织网人”
#速递

