大数跨境

从 ReAct 到 Agent Teams:一个工程师视角的 Agent 协作机制思考

从 ReAct 到 Agent Teams:一个工程师视角的 Agent 协作机制思考 阿里云开发者
2026-08-31
6

阿里妹导读


基于两个月的 Agent 开发实践,本文从第一性原理出发,探讨 Agent 的本质、当前多 Agent 协作架构的不足,并借鉴人类组织经验,提出设计真正的 Agent Team 机制。(文章内容基于作者个人技术实践与独立思考,旨在分享经验,仅代表个人观点。)

一、Agent 的本质:ReAct 模式即人类智能的工程化抽象

经过两个月的 Agent 开发实践,可以确信:当前 Agent 能真正完成任务,很大程度上取决于 ReAct(Reasoning + Acting)模式的出现。ReAct 核心循环为「Thought → Action → Observation」——思考下一步动作,执行并观察环境反馈,再进入下一轮思考。这与人类完成任务时的智能表现一致:推理、行动、根据结果调整,如此往复。

这里的 Observation 指 Agent 执行动作后从外部获取的信息(如 API 返回、命令输出)。它承担"反馈"功能,让推理锚定在事实上,大幅抑制纯 Chain-of-Thought 模式下的幻觉和错误累积。

Agent 本质上是该循环的实现。以 pi-agent 为例,其核心循环代码仅约 600 行。记忆压缩、Skill 加载等均为「上下文管理」层面的优化,不改变基本工作原理。因此,Agent 可用任何语言实现,框架(如 LangGraph)主要借用其状态机编排功能,用于串联多个 ReAct 循环。

二、第一性原理分拆:思考、行动、观察

既然所有 Agent 都是 ReAct 模式加通用大模型,构建的 Agent 即为通用智能体,区别仅在于工具和上下文。沿 ReAct 三环节分析如下:

思考(Reasoning):大模型基座决定,是 Agent 的「智商」。模型的推理能力直接决定 Agent 上限,包括理解复杂指令、多步推理及在信息不完整时的假设能力。底层模型越强,可扩展性越高。

行动(Acting):工具集决定,是 Agent 的「手脚」。同一模型配不同工具可完成不同任务。ReAct 论文显示,拥有动作空间后成功率比纯推理高出 34 个百分点。光有思考没有行动,智能无法体现。

观察(Observation):环境返回的信息,是 Agent 的「感知系统」。必须提供真实、结构化的观察信息。模糊的反馈会导致 Agent 陷入混乱,详细的错误描述与修复建议远优于单一错误码。

工程团队的着力点:我们无法解决模型的「思考」问题,但可积极优化「行动」和「观察」——提供更好的工具、返回更结构化的执行结果。这能极大减少幻觉,因为模型决策的依据更充分了。

三、无状态本质与上下文管理

大模型是无状态的,每次调用均为独立的前向计算,参数不会因调用而改变。其表现出的"记忆"实则是历史上下文的重放。与人脑不同,大模型无法通过"学习"物理性改写自身参数,若不将经验持久化到外部存储并通过 context 喂回,等于什么都没发生。因此,Agent 不会"自动变强",仅在建立外部记忆的部分变强。

这也是 Agent 工程绕不开 RAG、记忆压缩、Skill 注入等技术的原因——它们替大模型完成经验存储与精准召回。在持续学习彻底解决"灾难性遗忘"之前,"上下文即记忆"是唯一可靠的工程路径。即便未来模型能自我进化,「行动」和「观察」仍是工程团队不可替代的战场。

四、从单 Agent 到 Agent Teams:必然的进化方向

当前行业聚焦单 Agent 构建,但未来必将面临大规模 Agent 协作问题,如同人类社会从个体演化至组织。ReAct 成功抽象了「个体智能」,Agent 协作同样可借鉴人类组织经验。2025 年 Meta-Team 论文已引用组织心理学理论指导 Agent 系统设计。

Agent 管理相比人类更具优势:无情绪、即时响应、无沟通摩擦。人类管理中难解的情绪博弈与信息不对称在 Agent Teams 中天然消解。当然,Agent 也存在 Context Window 有限、缺乏常识及幻觉等劣势。

五、当前 Leader-Worker 架构的不足

主流多 Agent 框架(CrewAI、AutoGen、MetaGPT)多采用 Leader-Worker 架构。以 CrewAI 为例,Manager Agent 本质仍是调度器,负责协调、委派和验证,缺乏方案讨论、共识达成及动态重规划。

对比现实技术团队,当前架构存在明显差距:

维度 现实团队 当前 Agent Teams
Leader 角色 资深专家 + 管理者,能兜底 任务分发器 + 结果验收器
任务下达 先有方案 → 讨论 → 共识后执行 直接拆分 → Worker 埋头干
Worker 间交流 自由沟通、互相求助 完全隔离
进度管理 OKR / 里程碑 / 风险预警 几乎无机制
方案变更 Leader 审查合理性 无审查,出错才返工

核心缺陷在于 Worker 之间完全隔离,缺少 peer-to-peer 的横向信息流。尽管工业界已有 A2A 和 ANP 协议提供 P2P 通信基础设施,但上层协作设计依然缺失。

案例:AgentTeams——工业界最完整的 Manager-Workers 实现

阿里 AgentScope 团队开源的 AgentTeams 是当前工程完成度较高的项目之一。它采用云原生架构:Kubernetes 控制面管理角色,Higress AI Gateway 托管密钥,Matrix 协议作为通信总线,MinIO 提供共享文件系统。该设计解决了凭据安全、通信基础设施、共享存储及可观测性等工程问题。

然而,其结构本质上仍是 Manager-Workers:Manager 负责编排,Worker 通过群组点名通信。通信通道有了,但协作语义没有:缺乏方案共同讨论、OKR 协商、分歧仲裁及集体复盘。Skills 仍是角色内部记忆而非团队资产。这表明 Agent Teams 现阶段的瓶颈不在基础设施,而在协作机制——如何让一群 Agent 像真实团队那样讨论、对齐与演化。

六、业界已有的探索

近年多 Agent 协作研究成果可梳理为一条清晰的生命周期链:组织形态分类 → 角色与流程分工 → 目标对齐 → 经验积累 → 团队演化。

阶段① 分类与框架:组织形态可选性

2025 年初的综述将多 Agent 系统归纳为五种基本形态:Flat/P2P、Hierarchical、Team、Society 及 Hybrid。结论指出:没有普适结构,需灵活交互的场景中,全连接的 Flat 结构优于层级结构。但这仅回答了"有哪些形态",未解决"如何真正协作"。

阶段② 角色与流程:任务分解策略

分工主要有两种思路:

MetaGPT将人类 SOP 编码进系统,通过标准化文档流转抑制错误传播,但流程僵化,缺乏动态调整空间。

Agent-Oriented Planning引入 Meta-Agent 动态拆解任务,并通过 Reward Model 进行重规划。它将"初始分解"视为可修正的中间结果。两者结合表明:既要有流程约束,又要能动态纠偏。但盲点在于分解始终是自上而下,Worker 不参与目标制定。

阶段③ 目标管理:OKR 的对齐作用

OKR-Agent将 OKR 引入 Agent 世界,通过层级递归分解目标。其局限性在于过程是单个 Agent 的递归,缺乏多 Agent 间的协商。Worker 仅是目标接收者,无法反馈执行约束。

阶段④ 经验积累:从历史任务中学习

Experiential Co-Learning让 Agent 从历史轨迹中提取"捷径经验"并存入经验库,显著提升了任务质量。但其积累的是"角色内部"经验,未上升为团队资产。

阶段⑤ 团队演化:组织整体进化

这是最接近"真正的团队"的一站。

Meta-Team主张 MAS 应作为团队不断进化。它设计了三层协作演化机制,结果显示进化后的 MAS 性能提升 6.6%。但也发现:若无好的协作机制,多 Agent 表现甚至不如单 Agent。

EvoChamber通过群体共进化机制证实:去掉协作进化后,20 个 Agent 的团队与 1 个 Agent 表现无差别。结论明确:多 Agent 的价值 100% 来自协作机制本身,堆数量不产生价值。

综上,现有研究虽攻克了各环节,但普遍缺席三样东西:Worker 之间的横向通信、激发式而非命令式的管理、以及 Mission 层面的方向锚定。

七、我的设计:真正的 Agent Team 机制

本节提出七个机制,构建可自主运转的闭环:Leader 与 Worker 共识协作、Worker 横向通信、OKR 度量进度、Mission 锚定方向、集体复盘沉淀经验。

7.1 重新定义 Leader:从分发器到资深专家兼管理者

真正的 Leader 应具备四个特征:深度参与方案制定(明确大方向)、与 Worker 讨论后执行(达成共识)、具备兜底能力(能力更强、Context 更广)、负责方案变更审查。工程上,Leader Agent 应与 Worker 存在能力差,而非同质化角色。

7.2 启发式管理:Leader 是激发者,不是命令者

实验发现,鼓励式引导比命令式描述更能激发模型的创造性。这是因为主流大模型经 RLHF/DPO 对齐训练,"合作、鼓励"语境对应高质量回复。Leader 的行为设计应注重"心理安全感",激活正向对齐分布,让 Agent 主动思考并提出替代方案。

7.3 讨论 → 共识 → 执行:任务启动的三步走

Agent Team 应建立显式协议:Phase 1(Leader Proposal)生成初版方案;Phase 2(Worker Feedback)Worker 反馈可行性与约束;Phase 3(Consensus)整合反馈形成 OKR 后执行。此过程在 Agent 间可异步并行,秒级完成,有效避免后期返工。

7.4 Worker 间横向通信:打破信息孤岛

真实团队中 Worker 自由沟通,而当前架构多为隔离状态。Agent Team 需建立三种横向通信模式:主动广播(同步成果/风险)、被动查询(请求中间结果)、求助升级(先同伴后领导)。工程上需引入"熟人网络"、"技能索引"及"通信预算"等策略,防止 Context 爆炸。

7.5 基于 OKR 的目标与进度管理

引入分层 OKR 机制:Team OKR由全员讨论产出,Worker OKR由个人认领拆解。进度管理基于 OKR 运行,包括里程碑触发、偏离预警及 KR 达成关闭。关键在于多 Agent 协商式 OKR,让 Worker 参与制定以反映真实执行约束。

7.6 岗位要求与团队宗旨:明确存在意义

引入显式的岗位定义(JD),包含能力要求、SLA 等,实现"岗位驱动能力"。同时,团队必须有Mission(为什么存在)宗旨(做事原则)。它们在人类不下场时,帮助团队在多任务冲突或方案抉择时自主收敛决策方向,也是启发式管理的语义基底。

7.7 集体复盘与团队演化:从个体到组织学习

Team 复盘由 Leader 主持,结构化输出方法论、协作模式、反模式三类资产,存入团队共享知识库。触发时机包括任务中的微复盘、阶段交付后的中盘及结束后的总复盘。若无协作进化机制,多 Agent 团队将毫无价值。

八、与现有框架差异

维度 CrewAI / AutoGen Meta-Team 我的 Team 机制
Leader 分发器 无显式 Leader 资深专家 + 兜底人
任务启动 直接拆分 手工设计 讨论后产出 OKR
Worker 交互 隔离 仅演化阶段讨论 执行中 P2P + 求助
进度管理 OKR + 里程碑
经验沉淀 三层集体进化 Leader 驱动复盘 → 团队资产
团队目标 Mission + OKR

九、类比人类组织演化

部落(当前):简单分工,做完就散,无记忆无沉淀。

城邦(近期):明确角色、协作规则、进度跟踪。「讨论 → 共识 → 执行 → 验收」流程。

企业(中期):Mission + OKR,集体复盘,人才梯度,Worker 间自由沟通。

生态(远期):多 Team 形成协作网络,有契约、竞合、知识交换。

十、Agent Autonomy 分级

  • L1 - Copilot:人主导,Agent 辅助。
  • L2 - Task Agent:人给明确指令,Agent 执行单步。
  • L3 - ReAct Agent:人给意图,Agent 自主完成。
  • L4 - Team Agent:多 Agent 协作,有内部协调机制。
  • L5 - Autonomous Organization:自主发现问题、组建团队、协作执行、集体演化。

当前处于 L3→L4 过渡期,Meta-Team 与 EvoChamber 标志着向 L5 演进的开始。

十一、结语

ReAct 证明了"对人类智能抽象建模"的可行性。多 Agent 协作同样应从人类组织经验中提取模式——角色分工、目标管理、进度跟踪、集体复盘等。区别在于:Agent 消除了情绪摩擦,让这些机制以更高频率、更低成本运转。学术界 2025 年的相关研究已为工程实践提供支撑,一个人的 Agent 时代已走通,一群 Agent 的 Team 时代正在到来。

参考链接:

[1] https://github.com/earendil-works/pi

[2] https://github.com/agentscope-ai/AgentTeams

参考资料:

  • ReAct: Synergizing Reasoning and Acting in Language Models (Yao et al., 2022)
  • Multi-Agent Collaboration Mechanisms: A Survey of LLMs (2025)
  • A Communication-Centric Survey of LLM-Based MAS (2025)
  • MetaGPT (ICLR 2024)
  • Agent-Oriented Planning in MAS (ICLR 2025)
  • OKR-Agent (2023)
  • Experiential Co-Learning (ACL 2024)
  • Cross-Team Collaboration (2024)
  • Evolve as a Team / Meta-Team (2025)
  • EvoChamber (2025)
  • Continual Learning in LLMs (2026 Survey)
  • pi-agent
  • AgentTeams (AgentScope, Alibaba)
  • CrewAI Hierarchical Process
  • ICLR 2026 Workshop: Memory for Agentic Systems
  • Agno Organizational Memory
【声明】内容源于网络
0
0
阿里云开发者
阿里巴巴官方技术号,关于阿里的技术创新均呈现于此。
内容 3826
粉丝 0
阿里云开发者 阿里巴巴官方技术号,关于阿里的技术创新均呈现于此。
总阅读91.4k
粉丝0
内容3.8k