大数跨境

《大家一起学AI》第一章:回到本源,为什么我们要学 Agent AI

《大家一起学AI》第一章:回到本源,为什么我们要学 Agent AI 半场Halftime
2025-12-09
3
导读:9月15日发布《大家一起学AI》半场预告,后来因各种琐事耽搁,就没了下文,眼看2025年即将翻篇,我们挤出时间,继续跟着北纬学习李飞飞教授团队The Age of AI Agents83页英文原稿,为
20250915《大家一起学AI》半场预告:在AI的巨浪中,做一名清醒的“理解者”
“9月15日发布《大家一起学AI》半场预告,后来因各种琐事耽搁,就没了下文,眼看2025年即将翻篇,我们挤出时间,继续跟着北纬学习李飞飞教授团队AGENT AI:SURVEYING THE HORIZONS OF MULTIMODAL INTERACTION 80页英文原稿,为我们的理解添上翅膀,更好理解当前AI发展趋势。”
李飞飞(Fei-Fei Li),享誉全球的计算机科学家、人工智能领域权威,被誉为“AI教母”。美国国家工程院、国家医学院、艺术与科学院三院院士,美国斯坦福大学首位红杉讲席教授,斯坦福人工智能实验室主任,谷歌云人工智能与机器学习首席科学家。她不仅是过去十年“感知智能”浪潮的奠基者,如今正通过这篇重量级论文和她的新创业,引领AI向“行动与交互智能”的新时代——即“AI智能体时代”迈进。

八十多页的论文读起来并不难,但是要读懂每个细节,精读需要更多的耐心和时间,同时还要总结和提炼成大家能理解的方式说出来,就是更进一层的工作,幸好有ChatGPT,很多总结、归纳工作它可以代做,节省很多时间,看样子,一周两更可以做到,请大家也耐心的多读几遍,达到理解的状态比较好一些。关注半场,持续学习;大家有什么建议,请留言。

1、从一杯洒掉的咖啡说起

有一次,我在 YouTube 上看过一个实验视频。场景是一个研究所的实验室,里面有个小机器人,被编程去完成一个任务:把一杯咖啡端到桌子上。

刚开始,它笨拙地用机械手抓住杯子,小心翼翼地走了几步。周围的人鼓掌欢呼,觉得很厉害。可是,没走几秒,机器人一晃,杯子掉在地上,咖啡洒了一地。实验室里顿时一片尴尬。

这让我想起了一个问题:

👉 这个机器人,它真的懂自己在做什么吗?

它完成了一个动作:抓起杯子。可是它不懂“端稳”的含义,不知道“洒出来”代表失败。它只是按预设的指令做了一个动作,却没有理解背后的意义。

李飞飞团队在论文一开始就提醒我们:人工智能已经取得了很多突破,但要真正建成能感知、推理、行动的系统,仍然是一道巨大的难关。这就是我们学习的起点。

2、为什么现在要关注 Agent AI?

过去十几年,AI 的发展像坐过山车一样,一波又一波。我们稍微回顾一下:

  1. 第一波(2012–2018):深度学习的兴起。计算机能认出猫、能翻译语言、能玩 Atari 游戏。机器的“眼睛”和“耳朵”变得灵敏,但它们还不会真正思考。
  2. 第二波(2019–2022):大语言模型(LLM)横空出世。GPT 系列让机器能写文章、聊天、写代码。突然之间,我们感觉机器变聪明了。但它们依然只是“语言高手”,脱离现实环境就不行。
  3. 第三波(2023–现在):Agent AI 的概念被推到台前。我们不再满足于“会说”的 AI,而是希望它能“去做”:帮我订机票、写报告、自动发邮件,甚至控制机器人。

李飞飞团队在引言里说得很直接:“大型基础模型(foundation models)的出现,给智能体(agents)带来了新的机遇,使得它们能跨模态互动,执行复杂任务。”

用大白话翻译就是:

👉 以前AI 的大脑太小,不够灵活。现在 GPT、Claude、DeepSeek 这些大模型,就像给 AI 装上了“超级大脑”。有了它,AI 不仅能聊天,还能跨越语言、图片、声音去理解和执行任务。

3、那么,Agent 到底是什么?

李飞飞论文里有个很“教科书”的定义:

“在这篇综述中,我们将 Agent 定义为一个系统,它具备感知(perception)、记忆(memory)、推理(reasoning)和行动(action)的能力,能够与环境互动,实现目标。”

别急,我们慢慢拆开:

  1. 感知
    :就像人有眼睛耳朵,Agent 要能看、能听、能读懂输入。比如识别一张照片里的猫,理解一段语音里的命令。
  2. 记忆
    :不能像金鱼一样一转身就忘。Agent 要记得上下文,记得历史任务。比如你上周让它查过航班,这周它还记得你要去的城市。
  3. 推理
    :这是“聪明”的关键。推理意味着它能判断“下一步该干什么”,而不是机械执行。比如“帮我做饭”,它得先想到“去买菜”,再想到“洗菜、切菜、炒菜”。
  4. 行动
    :光会说不行,还得真去做。比如发一封邮件,运行一个代码,移动一个机械臂。


👉 所以一句话总结:Agent = 会感知 + 会记忆 + 会推理 + 会行动

这就是我们要学的核心概念。

4、普通大模型 vs Agent

我们可以做个对比:

比如,你让 ChatGPT 给你写一个旅行计划,它会给你列出详细表格。

但你让一个 Agent 去执行,它真的会去帮你订票、定酒店、发确认邮件。

5、三大挑战

李飞飞团队在引言里特别指出了 Agent 面临的三大挑战。

  1. 幻觉(Hallucination)
  2. 大模型有时候会“胡编”。
  3. 举例:它可能告诉你“武汉有黄鹤大厦”,实际上不存在。
  4. 在聊天里只是好笑,但如果 Agent 用这个“假信息”去订票、发指令,就可能酿成严重错误。
  5. 偏见(Bias)
  6. 模型的训练数据里有社会偏见,比如性别刻板印象、种族歧视。
  7. 如果 Agent 用在招聘、医疗,可能会造成不公平甚至危险的后果。
  8. 隐私(Privacy)
  9. 为了行动,Agent 需要访问你的邮箱、文件、甚至银行卡。
  10. 如果安全不够,风险比单纯聊天大得多。

此外,论文还提到一个经常被忽略的问题:可解释性(Explainability)。

  1. 如果 Agent 做错事,我们能不能理解“它为什么这么做”?
  2. 如果连研发者都解释不了,就很难建立信任。


6、这篇论文的贡献

李飞飞团队在 Introduction 的最后说,这篇综述的目标是:

  1. 提供一个关于 Agent AI 的全面概览。
  2. 系统总结现有的研究进展和挑战。
  3. 为未来研究指明方向。

换句话说,这篇论文就是一张“地图”。

👉 它告诉我们:现在Agent 研究走到哪一步了,哪里有路,哪里有坑,哪里可能有宝藏。

7、小练习

打开 ChatGPT 或 DeepSeek,输入:“请用一句话解释什么是 Agent AI,并举 3 个生活中的例子。”

然后,找出你觉得它回答里“不靠谱”的地方,写下来。

  1. 想象你有一个“家务Agent”,能帮你做饭、打扫、购物。
  2. 你最担心它的什么?(隐私?误判?价格?)
  3. 把担心写下来,看看别人是不是也有同样的顾虑。

8、小结

今天我们走完了第一步:

  1. 知道了 Agent = 感知 + 记忆 + 推理  + 行动
  2. 知道了它和普通大模型的区别:不仅会说,还能做
  3. 也知道了它的三大挑战:幻觉、偏见、隐私
  4. 最重要的,是理解了为什么现在要学 Agent:因为基础模型的发展,让它终于可能实现

在下一篇里,我们会深入论文的第二部分:Agent AI Integration。那时我们要问:Agent 和大模型如何结合?“幻觉”有没有解决办法?我们能不能让 Agent 更可靠?

附录:

模块一  关键词对照表(中英文)

一、核心概念(Agent 的基本定义)

  1. Agent → 智能体 / 行动体
  2. Perception → 感知
  3. Memory → 记忆
  4. Reasoning → 推理
  5. Action → 行动
  6. Environment → 环境
  7. Multimodal → 多模态(文字、图像、声音、视频等多种输入输出)
  8. Foundation Models → 基础模型(如 GPT、LLaMA 这类大模型)
  9. Interaction → 交互
  10. Autonomy → 自主性


二、挑战与风险(论文在引言中特别点出的难题)

  1. Hallucination → 幻觉(AI 编造并不存在的内容)
  2. Bias → 偏见(训练数据中的偏差或歧视)
  3. Privacy → 隐私
  4. Explainability /
  5. Interpretability → 可解释性
  6. Reliability → 可靠性
  7. Robustness → 鲁棒性 / 稳健性(面对变化还能正常工作)


三、论文表述常用词(阅读时会频繁遇到)

  1. Motivation → 动机 / 背景
  2. Overview → 概览
  3. Challenge → 挑战
  4. Opportunity → 机遇
  5. Capability → 能力
  6. Limitation → 局限
  7. Integration → 融合 / 集成
  8. Contribution → 贡献
  9. Structure of the paper → 论文结构


北纬行者 + ChatGPT 共同完成 2025-09-15  于 多伦多


【声明】内容源于网络
0
0
半场Halftime
1234
内容 100
粉丝 0
半场Halftime 1234
总阅读31
粉丝0
内容100