关注我们,未来不迷路,一起重启,慢慢变好
“又是周末,户外寒风哆嗦,出门浪不如窝家里看看书,继续学习北纬大叔的《大家一起学AI》第三章吧,跟上时代的步伐,也算庆祝澳门回归26年,与时代同行”
《大家一起学AI》第一章:回到本源,为什么我们要学 Agent AI
《大家一起学AI》第二章:为什么要把大模型和 Agent 融合?
1. 我们先聊个问题:大模型,到底算不算一个Agent?
你第一次用 GPT 的时候,有没有觉得:它好像一个会说话、会推理,还能解决问题的“人”?
我记得我第一次用的时候,就是这种感觉。你问它问题,它不仅回答,还能举例、还能推理,甚至能“聊人生”。
于是很多人很自然地就说:
👉“大模型就是Agent 啊,它已经有智能了呀。”
但后来我越用越发现,好像又不是那么回事。
比如我问它:“帮我查一下明天多伦多到渥太华的火车票,给我订一张。”
它会很认真的给我写一段行程计划,告诉我应该几点出发、几点到达,甚至还能写得煞有介事。
可问题是,它真的能帮我订票吗?不能。它不会去
VIA Rail 的网站操作,也不会输入我的信用卡。它只会“说”,不会“做”。
所以我就陷入了思考:👉大模型到底是Agent,还是 Agent 的一部分?
2. 范式是什么?为什么我们必须先搞清楚范式?
论文里用了一个词:Paradigm(范式)。
这个词其实不难理解,就是“我们看待问题的框架”。
我给你打个比方:
-
同样一盘围棋,有的人说“棋手最重要”,因为是棋手在下棋; -
但也有人说“规则最重要”,因为没有规则,棋局根本下不起来。
这就是两种不同的范式。
在 AI Agent的世界里,
-
一种范式是:LLM = Agent。 -
另一种范式是:LLM 只是 Agent 的大脑,Agent 还需要身体、记忆和工具。
为什么这个问题重要?
👉因为你认同哪种范式,就会决定你未来做研究、做应用时的路线。
-
如果你觉得 LLM 就是 Agent,你就会研究“如何增强大模型,让它更自主”。 -
如果你觉得 LLM 只是 Agent 的一部分,你就会研究“如何用框架把大模型整合进一个更大的系统”。
所以,这一章讨论的,其实就是一个“定位”的问题。
大模型在 Agent里,到底是什么角色?
3. 两种看法,两个世界
看法一:LLM 就是 Agent
很多人支持这种观点。他们说:
-
LLM 已经能理解自然语言。 -
它能做推理,能回答问题,能解决复杂任务。 -
它还可以通过插件调用工具(比如写代码、调用API)。
那它为什么不是一个Agent 呢?
从表面上看,确实很有道理。你给它一个问题,它能一步步思考,还能自己生成“行动计划”。
举个例子:你说:“帮我写一份 3 天的云南旅游计划。”
它马上就能生成:第一天昆明石林,第二天大理古城,第三天丽江玉龙雪山。
这不就是 Agent的“感知 + 推理 + 行动”了吗?
所以很多人干脆说:大模型就是Agent。
看法二:LLM 只是 Agent 的一部分
-
但也有人反对。他们说:真正的 Agent,不只是“说话”,还要“做事”。 -
它需要记忆,需要与外部环境互动,需要真正的执行。 -
而 LLM只是负责“思考”,它没有手,没有脚。
还是回到刚才的例子:
你让它帮你“订一张火车票”,它会给你计划,但不会真的打开网站下单。
所以,它更像是一个大脑,负责思考。真正的执行,还需要其他模块,比如浏览器自动化、API调用器、支付接口。
所以他们说:👉Agent = 大模型(大脑) + 工具(手脚) + 框架(规则) + 记忆(经验)。
这就是另一种范式。
4. 谁对谁错?其实都对
有意思的是,这两种看法都没有错。关键看你要用它来干什么。
-
如果你只是让它回答问题、写文案、写代码,大模型自己就能搞定,这时候你完全可以把它看作一个“简单的Agent”。 -
但如果你要它帮你“执行任务”,比如订票、发邮件、跑流程,这时候光有大模型不够,你需要Agent 框架,把大模型当作“大脑”,配合身体和工具。
👉 这就是为什么要讨论范式。因为不同的范式,决定了不同的应用边界。
5. Agent Transformer:让“意图”变成语言
论文里提了一个很有意思的方向:Agent Transformer。
我们知道,GPT 的底层是 Transformer 架构,它处理的是“token”,就是文字的最小单元。
比如“苹果”这个词,会被拆成“苹”和“果”。
那 AgentTransformer 想干嘛呢?
👉它想引入一种新的token,叫做 Agent Token(行动单元)。
什么意思?
举个例子:
你说:“帮我订一张 9 月 20 号的火车票,从多伦多到渥太华。”
传统 LLM 处理的时候,会把这句话拆成很多文字 token。
但 Agent Token 的思路是,把它抽象成一系列“意图”:
-
查询航班信息; -
选择合适航班; -
填写个人信息; -
提交支付。
这样,大模型就不是在处理零散的文字,而是在处理“行动的语言”。
👉 这是一种新的思路,能让大模型更自然地与 Agent 框架结合。
6. 一体化还是模块化?一场哲学之争
接着,论文还谈到一个老生常谈的问题:
👉我们到底要不要搞一个“超级一体化模型”?
设想一下,一个超级大模型:
-
它能理解文字; -
能看图片; -
能听语音; -
还能直接执行动作。
听起来很酷对吧?这就是所谓的 端到端一体化模型(End-to-End Model)。
但问题也来了:
-
训练这样一个模型,算力需求极大。 -
一旦出错,很难排查问题。 -
数据要求高到几乎不可实现。
所以,有人坚持走另一条路:模块化(Modular Design)。
-
大模型负责理解和推理; -
工具负责执行; -
框架负责协调; -
记忆负责存储信息。
模块化的好处是:灵活、可扩展。
坏处是:工程上更复杂,需要系统集成。
👉 这就像人类社会:
-
有人喜欢“全能选手”,一个人包办所有工作; -
有人更喜欢“分工协作”,大家各司其职。
目前,工业界更多是选择模块化,因为它更务实;而一体化模型更多还是科研探索。
7. 我们来总结一下(加点重复)
- 范式就是思维方式
:我们要先问清楚,大模型在Agent 里扮演什么角色。 - 两种答案
: -
一种说:LLM = Agent; -
一种说:LLM只是 Agent 的大脑。 - Agent Transformer
提供了一个新思路:把行动变成“语言单元”,让大模型更像能“理解行动”的大脑。 - 端到端 vs 模块化
: -
端到端模型:简洁但理想化,算力需求巨大; -
模块化设计:灵活务实,但系统更复杂。
👉 重复一句话(非常重要):大模型不是Agent,它是 Agent 的大脑。只有配合身体、工具和记忆,才是真正的智能体。
8. 中英词语对照
-
Paradigm → 范式 -
LLM (Large Language Model) → 大语言模型 -
VLM (Vision-Language Model) → 视觉-语言模型 -
Agent Transformer → Agent 变压器架构 -
Agent Token → Agent 意图单元 / 行动符号 -
End-to-End → 端到端一体化 -
Modular Design → 模块化设计 -
Autonomy → 自主性 -
Emergence → 涌现能力

