大数跨境

《大家一起学AI》第三章:Agent 的范式——到底谁在下棋?

《大家一起学AI》第三章:Agent 的范式——到底谁在下棋? 半场Halftime
2025-12-20
2
导读:“又是周末,户外寒风哆嗦,出门浪不如窝家里看看书,继续学习北纬大叔的《大家一起学AI》第三章吧,跟上时代的步伐,也算庆祝澳门回归26年,与时代同行”

关注我们,未来不迷路,一起重启,慢慢变好


又是周末,户外寒风哆嗦,出门浪不如窝家里看看书,继续学习北纬大叔的《大家一起学AI》第三章吧,跟上时代的步伐,也算庆祝澳门回归26年,与时代同行”

《大家一起学AI》第一章:回到本源,为什么我们要学 Agent AI

《大家一起学AI》第二章:为什么要把大模型和 Agent 融合?

1. 我们先聊个问题:大模型,到底算不算一个Agent?

你第一次用 GPT 的时候,有没有觉得:它好像一个会说话、会推理,还能解决问题的“人”?

我记得我第一次用的时候,就是这种感觉。你问它问题,它不仅回答,还能举例、还能推理,甚至能“聊人生”。

于是很多人很自然地就说:

👉“大模型就是Agent 啊,它已经有智能了呀。”


但后来我越用越发现,好像又不是那么回事。

比如我问它:“帮我查一下明天多伦多到渥太华的火车票,给我订一张。”

它会很认真的给我写一段行程计划,告诉我应该几点出发、几点到达,甚至还能写得煞有介事。

可问题是,它真的能帮我订票吗?不能。它不会去

VIA Rail 的网站操作,也不会输入我的信用卡。它只会“说”,不会“做”。

所以我就陷入了思考:👉大模型到底是Agent,还是 Agent 的一部分?


2. 范式是什么?为什么我们必须先搞清楚范式?

论文里用了一个词:Paradigm(范式)

这个词其实不难理解,就是“我们看待问题的框架”。

我给你打个比方:

  1. 同样一盘围棋,有的人说“棋手最重要”,因为是棋手在下棋;
  2. 但也有人说“规则最重要”,因为没有规则,棋局根本下不起来。

这就是两种不同的范式。

在 AI Agent的世界里,

  1. 一种范式是:LLM  = Agent
  2. 另一种范式是:LLM 只是 Agent 的大脑,Agent 还需要身体、记忆和工具


为什么这个问题重要?

👉因为你认同哪种范式,就会决定你未来做研究、做应用时的路线。

  1. 如果你觉得 LLM 就是 Agent,你就会研究“如何增强大模型,让它更自主”。
  2. 如果你觉得 LLM 只是 Agent 的一部分,你就会研究“如何用框架把大模型整合进一个更大的系统”。

所以,这一章讨论的,其实就是一个“定位”的问题。

大模型在 Agent里,到底是什么角色?


3. 两种看法,两个世界

看法一:LLM 就是 Agent

很多人支持这种观点。他们说:

  1. LLM 已经能理解自然语言。
  2. 它能做推理,能回答问题,能解决复杂任务。
  3. 它还可以通过插件调用工具(比如写代码、调用API)。

那它为什么不是一个Agent 呢?

从表面上看,确实很有道理。你给它一个问题,它能一步步思考,还能自己生成“行动计划”。

举个例子:你说:“帮我写一份 3 天的云南旅游计划。”

它马上就能生成:第一天昆明石林,第二天大理古城,第三天丽江玉龙雪山。

这不就是 Agent的“感知 + 推理 + 行动”了吗?

所以很多人干脆说:大模型就是Agent


看法二:LLM 只是 Agent 的一部分

  1. 但也有人反对。他们说:真正的 Agent,不只是“说话”,还要“做事”。
  2. 它需要记忆,需要与外部环境互动,需要真正的执行。
  3. 而 LLM只是负责“思考”,它没有手,没有脚。


还是回到刚才的例子:

你让它帮你“订一张火车票”,它会给你计划,但不会真的打开网站下单。

所以,它更像是一个大脑,负责思考。真正的执行,还需要其他模块,比如浏览器自动化、API调用器、支付接口。

所以他们说:👉Agent = 大模型(大脑) + 工具(手脚) + 框架(规则) + 记忆(经验)

这就是另一种范式。


4. 谁对谁错?其实都对

有意思的是,这两种看法都没有错。关键看你要用它来干什么。

  1. 如果你只是让它回答问题、写文案、写代码,大模型自己就能搞定,这时候你完全可以把它看作一个“简单的Agent”。
  2. 但如果你要它帮你“执行任务”,比如订票、发邮件、跑流程,这时候光有大模型不够,你需要Agent 框架,把大模型当作“大脑”,配合身体和工具。

👉 这就是为什么要讨论范式。因为不同的范式,决定了不同的应用边界。


5. Agent Transformer:让“意图”变成语言

论文里提了一个很有意思的方向:Agent Transformer

我们知道,GPT 的底层是 Transformer 架构,它处理的是“token”,就是文字的最小单元。

比如“苹果”这个词,会被拆成“苹”和“果”。

那 AgentTransformer 想干嘛呢?

👉它想引入一种新的token,叫做 Agent Token(行动单元)

什么意思?

举个例子:

你说:“帮我订一张 9 月 20 号的火车票,从多伦多到渥太华。”

传统 LLM 处理的时候,会把这句话拆成很多文字 token。

但 Agent Token 的思路是,把它抽象成一系列“意图”:

  1. 查询航班信息;
  2. 选择合适航班;
  3. 填写个人信息;
  4. 提交支付。

这样,大模型就不是在处理零散的文字,而是在处理“行动的语言”。

👉 这是一种新的思路,能让大模型更自然地与 Agent 框架结合。


6. 一体化还是模块化?一场哲学之争

接着,论文还谈到一个老生常谈的问题:

👉我们到底要不要搞一个“超级一体化模型”?

设想一下,一个超级大模型:

  1. 它能理解文字;
  2. 能看图片;
  3. 能听语音;
  4. 还能直接执行动作。

听起来很酷对吧?这就是所谓的 端到端一体化模型(End-to-End Model)

但问题也来了:

  1. 训练这样一个模型,算力需求极大。
  2. 一旦出错,很难排查问题。
  3. 数据要求高到几乎不可实现。


所以,有人坚持走另一条路:模块化(Modular Design)

  1. 大模型负责理解和推理;
  2. 工具负责执行;
  3. 框架负责协调;
  4. 记忆负责存储信息。

模块化的好处是:灵活、可扩展。


坏处是:工程上更复杂,需要系统集成。

👉 这就像人类社会:

  1. 有人喜欢“全能选手”,一个人包办所有工作;
  2. 有人更喜欢“分工协作”,大家各司其职。

目前,工业界更多是选择模块化,因为它更务实;而一体化模型更多还是科研探索。


7. 我们来总结一下(加点重复)

  1. 范式就是思维方式
    :我们要先问清楚,大模型在Agent 里扮演什么角色。
  2. 两种答案
  3. 一种说:LLM = Agent;
  4. 一种说:LLM只是 Agent 的大脑。
  5. Agent  Transformer
     提供了一个新思路:把行动变成“语言单元”,让大模型更像能“理解行动”的大脑。
  6. 端到端  vs 模块化
  7. 端到端模型:简洁但理想化,算力需求巨大;
  8. 模块化设计:灵活务实,但系统更复杂。

👉 重复一句话(非常重要):大模型不是Agent,它是 Agent 的大脑。只有配合身体、工具和记忆,才是真正的智能体。


8. 中英词语对照

  1. Paradigm → 范式
  2. LLM (Large Language Model) → 大语言模型
  3. VLM (Vision-Language Model) → 视觉-语言模型
  4. Agent Transformer → Agent 变压器架构
  5. Agent Token → Agent 意图单元 / 行动符号
  6. End-to-End → 端到端一体化
  7. Modular  Design → 模块化设计
  8. Autonomy → 自主性
  9. Emergence → 涌现能力

【声明】内容源于网络
0
0
半场Halftime
1234
内容 100
粉丝 0
半场Halftime 1234
总阅读31
粉丝0
内容100