【从零走向AGI】旨在深入了解通用人工智能(AGI)的发展路径,从最基础的概念起,逐步构建完整的知识体系。
项目地址🔗:https://ai-mzq.github.io/From-Zero-to-AGI/[1]
欢迎关注【魔方AI空间】👇
AIGC技术交流社区(涵盖AI绘画、AI视频、大模型、AI多模态、数字人、具身智能等AIGC干货资源及教程)欢迎大家加入:
本文聚焦大模型的 12 个核心机制:Token、Embedding、Attention、Transformer、MoE、预训练、后训练、对齐、RAG、工具调用、推理和评测,旨在帮助读者把这些常见概念串成一条完整技术线。
学习大模型,绕不开这 12 个词:
Token、Embedding、Attention、Transformer、MoE、预训练、后训练、对齐、RAG、工具调用、推理、评测。
图 1:大模型 12 个核心机制全景图。
它们看起来像一串术语,实际对应的是模型从输入、计算、训练到使用和验证的完整链路:先把文本变成可计算的表示,再完成上下文建模;训练阶段让模型学到通用模式,并逐步学会按任务和偏好回答;需要外部知识和能力时,接入 RAG 与工具;最后再用推理和评测判断它能不能稳定解决问题。

01 核心机制速览
表 1:大模型 12 个核心机制速查表。
02 Token:大模型先把文字切成什么
自然语言不能直接进入神经网络。模型看到的不是完整句子,而是一串 Token。
Token 是模型处理文本的基本单位。它可以是一个字、一个词、一个子词,也可以是标点、空格、代码片段。具体怎么切,由模型的分词器决定。同一句话,在不同模型里可能对应不同数量的 Token。
所以 Token 不只是计费单位。它会影响上下文长度、API 成本、长文档处理效率,也会影响中文、英文、代码和多语言输入的压缩效率。
常见分词方式可以粗略分成三类:按词切、按字符切、按子词切。词级方法语义完整,但词表容易变大;字符级方法覆盖面强,但序列会变长;子词方法介于两者之间,把高频片段合并,把低频词拆开,也是现代大模型更常见的选择。BPE[2] 和 SentencePiece[3] 都是理解现代分词器的重要参考。
03 Embedding:Token 怎样变成向量
Token 本身只是离散编号。编号不能表示语义,也不能直接参与神经网络计算。
图 2:Token 与 Embedding 输入流程。
Embedding 的作用,是把 Token 映射成连续向量。向量里编码的是模型学到的语义、位置和上下文线索,后面的注意力计算、语义关联、上下文建模,都是在这些向量表示上完成的。
这里要区分两种常见说法。
表 2:模型内部 Embedding 与检索 Embedding 的区别。
很多人说 Embedding 时,想到的是向量数据库。这个理解没错,但不完整。大模型内部也有 Embedding:Token 进入 Transformer 之前,先要变成向量。RAG 里的检索 Embedding 则更强调“相似内容在向量空间里距离更近”,用来把问题和文档片段匹配起来。
04 Attention:上下文信息怎样流动
有了向量之后,模型要解决一个问题:当前 Token 更新自己的表示时,应该从上下文里取哪些信息?
这就是 Attention 要做的事。
Attention Is All You Need[4] 让 Attention 成为现代大模型的核心模块。它的基本计算可以用 Query、Key、Value 来理解:
· Query:当前 Token 在问什么;
· Key:上下文 Token 能提供什么线索;
· Value:真正被取走的信息。
Self-Attention 会让每个 Token 都和其他 Token 建立关系。Multi-Head Attention 则让模型从多个角度看同一段上下文:语法关系、指代关系、位置关系、代码依赖,都可能由不同注意力头捕捉。
Attention 不是智能的全部来源,但它解决了上下文信息如何流动的问题。
05 Transformer:现代大模型的主干结构
Attention 是模块,Transformer 是结构。
一个典型 Transformer Block 通常包括 Attention、前馈网络、残差连接、LayerNorm 和位置信息。把这样的 Block 堆叠很多层,就形成了大模型的主干。
图 3:Attention 与 Transformer Block。
现代大语言模型多采用 decoder-only Transformer,通过自回归方式一步步预测下一个 Token。它的重点不只是“用了注意力”,还包括可并行训练、可扩展堆叠,以及把不同模态统一成序列来处理的能力。
文本、图像 patch、音频 token、视频 token,最后都可以被组织成序列。这也是为什么 Transformer 后来不只用于语言模型,也成为多模态模型的基础结构之一。
表 3:Attention 与 Transformer 的区别。
06 MoE:不是所有参数都要同时工作
模型越来越大之后,参数规模和计算成本之间的矛盾会越来越明显。
MoE,也就是 Mixture of Experts,给出了一种“高参数、低激活”的折中:模型可以拥有很多专家参数,但每个 Token 只激活其中少数专家。
图 4:Dense 模型与 MoE 路由对比。
以 Switch Transformers[5] 为代表的稀疏模型路线,重点不在“多个模型投票”,而在模型内部加入 Router,由它决定当前 Token 该送到哪些 Expert:
MoE 的收益,是让模型总参数变大,但单次计算量不必按总参数线性增长。换句话说,模型容量可以继续扩展,实际参与一次计算的参数仍然保持在可控范围内。
它的难点也很现实:路由负载均衡、专家利用率、多卡通信、训练稳定性和推理部署都会更复杂。
表 4:Dense 模型与 MoE 模型的差异。
07 预训练:模型能力从哪里来
如果说 Token 和 Embedding 是输入,Transformer 是结构,那么预训练就是模型能力的来源。
预训练通常使用自监督目标,不需要人工给每条数据标注答案。GPT 类模型常见做法是预测下一个 Token;BERT[6] 代表的路线则通过预测被遮盖的词来学习上下文表示。GPT-3[7] 则把自回归语言模型的规模化能力推到更显眼的位置。
预训练让模型从大规模文本、代码、图文对或多模态数据中学习语言结构、知识关联、代码模式和世界常识的统计关系。
规模为什么重要?Scaling Laws[8] 讨论了模型参数、数据量和计算量之间的关系。Chinchilla[9] 进一步提醒:不是只把模型做大就够,数据量和计算分配同样关键。
预训练后的模型会续写,但不一定会稳定回答问题。它可能知道很多东西,却未必知道用户想要什么样的回答。
08 后训练与对齐:从会续写,到更会回答
要让预训练模型进入真实产品,还需要后训练。
后训练是一个方法集合,常见包括 SFT、RLHF、DPO、RLVR 等。平时说的指令微调、偏好优化、强化学习训练,基本都可以沿着这条线理解。对齐则是后训练的重要目标之一:让模型更符合人类意图、任务要求和安全边界。
图 5:预训练、后训练和对齐流程。
InstructGPT[10] 是理解指令微调和 RLHF 的经典入口。它大致包含三步:
后来 DPO[11] 这类方法尝试更直接地使用偏好数据,减少强化学习流程的复杂度。
对齐不只是安全过滤。它会影响模型是否遵循指令、是否拒绝不合适请求、是否减少胡编、是否保持格式稳定,以及是否在不确定时承认边界。一个模型“会说”,不等于已经适合真实交互;后训练和对齐解决的正是这段距离。
09 RAG:大模型如何接入外部知识
预训练再大,也会遇到三个限制:知识会过时,私有资料进不了训练集,长文档也不可能全部塞进上下文。
RAG,Retrieval-Augmented Generation,就是把检索和生成结合起来。RAG 原始论文[12] 提出的方向,是让模型生成时能利用外部知识。
典型 RAG 可以拆成三段:先建立索引,再检索相关内容,最后把检索结果交给模型生成回答。
RAG 的价值,是把模型回答锚定到外部资料上,让答案更容易追溯,也让企业知识库、论文问答、项目文档检索这类场景变得可做。
它的难点不只在向量库。chunk 怎么切、query 怎么改写、召回是否足够、上下文会不会塞错、引用能不能支撑答案,都会影响最终效果。
10 工具调用:大模型开始连接外部动作
RAG 主要解决“从哪里取知识”。工具调用解决的是“能不能做动作”。
工具可以是搜索引擎、代码解释器、数据库、日历、邮件、浏览器、企业 API,也可以是图像生成、语音合成、文件转换这类多模态工具。
图 6:RAG 与工具调用对比。
Toolformer[13] 讨论了语言模型如何学习调用工具。ReAct[14] 则把 reasoning 和 acting 放在一起:模型一边推理,一边决定是否要使用工具。
所以工具调用也是 Agent 系统的底层能力之一。没有工具调用,模型大多只能停留在回答问题;有了工具调用,它才可能查询实时信息、运行代码、操作文件,或者把任务交给外部系统完成。
工具调用的一般流程是:
工具调用不是简单把 API 接上就完事。参数错了会执行错,权限过大有安全风险,工具结果本身也可能不可靠,多步任务还会遇到失败恢复、状态记忆和成本延迟问题。
11 推理:模型为什么要分步骤想问题?
推理不是回答更长,也不是把过程写得更像人。
它更关心几件事:模型能不能把复杂问题拆开,能不能维护中间状态,能不能比较不同路径,能不能在必要时检查答案。
Chain-of-Thought Prompting[15] 让大家看到一个现象:在数学、常识、多步问答等任务中,让模型显式写出中间步骤,往往能提升表现。
后来的推理路线继续分化:从 prompt 诱导,到训练中强化推理过程,再到结合搜索、验证器和工具调用。
这里也要有边界:推理链写得长,不代表答案更可靠。模型可能生成看似合理但错误的推理过程。很多任务还需要检索、计算器、代码执行或外部工具一起完成。
12 评测:为什么榜单分数高,不等于真实好用?
模型机制讲完,最后要回到评测。
图 7:推理与评测关系。
因为模型最终不是拿来欣赏结构,而是要在任务里稳定解决问题。
常见评测可以分成几类:
表 5:大模型常见评测方向。
MMLU[16] 代表多任务知识评测,HumanEval[17] 常用于代码生成评测,HELM[18] 则尝试从更整体的角度评估语言模型。
榜单有价值,但不能替代真实任务测试。benchmark 可能被污染,模型可能针对题型过拟合,平均分可能掩盖关键失败场景,单轮问答也不能代表长期交互。
13 最后
理解大模型,不适合只背术语。
更稳的方式,是看每个机制在链路里的位置:
把这条线看清楚,再看 RAG、Agent、推理模型、MoE 架构、多模态大模型,就不会只看到一个个热词。
也更容易判断:一个新技术到底是在改输入、改架构、改训练、改外部系统,还是改评测方式。
参考链接
1. https://ai-mzq.github.io/From-Zero-to-AGI/:https://ai-mzq.github.io/From-Zero-to-AGI/
2. BPE:https://arxiv.org/abs/1508.07909
3. SentencePiece:https://arxiv.org/abs/1808.06226
4. Attention Is All You Need:https://arxiv.org/abs/1706.03762
5. Switch Transformers:https://arxiv.org/abs/2101.03961
6. BERT:https://arxiv.org/abs/1810.04805
7. GPT-3:https://arxiv.org/abs/2005.14165
8. Scaling Laws:https://arxiv.org/abs/2001.08361
9. Chinchilla:https://arxiv.org/abs/2203.15556
10. InstructGPT:https://arxiv.org/abs/2203.02155
11. DPO:https://arxiv.org/abs/2305.18290
12. RAG 原始论文:https://arxiv.org/abs/2005.11401
13. Toolformer:https://arxiv.org/abs/2302.04761
14. ReAct:https://arxiv.org/abs/2210.03629
15. Chain-of-Thought Prompting:https://arxiv.org/abs/2201.11903
16. MMLU:https://arxiv.org/abs/2009.03300
17. HumanEval:https://arxiv.org/abs/2107.03374
18. HELM:https://arxiv.org/abs/2211.09110

