01|原理:一个例子讲清楚Transformer原理
一、课程简介
三个目标:
-
跟着 Transformer 程序流程图,把所有 Transformer 里的概念串联起来,并理解清楚流程。 -
理解 Token、Embedding 和 Self-Attention 这 3 个最核心的算法和数据结构,解释 Transformer 为何可以达到人类智力级别。 -
从业务层看待 Transformer 程序流程图,理解上述所有大模型的相关概念。
二、GPT 的核心原理:一句话说清楚
★通过输入一段文本,GPT 模型会预测出最可能成为下一个字的字。
举例:
-
用户输入:"翻译:我爱你" -
GPT 推理:字符串以"翻译:"开头 → 推测这是翻译任务 → 输出 "i" -
下一步输入变为:"翻译:我爱你 i" → 输出 "love" -
再下一步输入:"翻译:我爱你 i love" → 输出 "you"
生成式:一个字一个字预测生成一段文字的方式。
三、从经典概率模型理解 Transformer
在拆解复杂的 Transformer 之前,先看一个简化模型:
-
假设"汪星语"只有 6 个词:我、刚才、现在、吃饭、睡觉、跑步 -
句式: 我 刚才 跑步,我 现在 ___ -
要预测横线里填什么,只要计算"跑步"之后哪个行为的概率最大 -
例如:P(吃饭|跑步) = 0.6,P(睡觉|跑步) = 0.3,P(跑步|跑步) = 0.1 -
结果向量:[0, 0, 0, 0.6, 0.3, 0.1] → 选择概率最高的"吃饭"
核心思想:根据已有文本,遍历词表找出概率最大的下一个词。
Transformer 的流程虽然比这个复杂得多,但结构和功能是一样的,只是概率计算方法不同 [pdf_1]。
四、Transformer 整体架构(三大部分)
用分治法,把 Transformer 架构分为 3 大部分:
|
|
|
|---|---|
| 1- 输入模块 |
|
| 2- 编解码模块 |
|
| 3- 输出模块 |
|
关键公式:
-
程序 = 算法 + 数据结构 -
大模型 = 模型算法 + 模型参数 [pdf_1]
五、三大核心概念
1. Token 和 Token 词表
-
Token 是比"词"更细的基本运算单位 -
例如:"我叫金伟" → 拆成 4 个 Token:我 / 叫 / 金 / 伟 -
拆成 Token 的目的是控制词表大小(长尾词占 90%) -
"我爱你" + "i" → Token 表示:[我, 爱, 你, #i]
2. Embedding 向量
-
每个 Token 不再只是一个序号,而是一个 M 维向量 -
示例: #i → [0.1095, 0.0336, ..., 0.1589, 0.0282, 0.1756] -
维度越高,语义表达能力越强 -
GPT-3 中:M = 12288 维 -
输入 4 个 Token → 得到 4 × 12288 的矩阵,传递给编解码模块 -
Embedding 把一个词分成了上万个维度表示,这是大模型智能的基础
3. Self-Attention 自注意力机制
核心思想:大模型做预测时,会关注当前句子里那些重要的词。
三个权重矩阵(QKV):
-
Wq → 生成查询向量(Q):Token 拿来去向别人查询 -
Wk → 生成键向量(K):Token 用来回应他人的查询 -
Wv → 生成值向量(V):表示 Token 的重要性值
算法流程:
-
第一步:每个 Token 生成自己的 Q、K、V 向量 -
第二步:Token ti 拿着自己的 Q 向量去询问每个 Token,获得重要性分数 Score -
第三步:Score 与值向量 V 计算,得到表示重要性的向量 Z
生活类比:Self-Attention 就像会议中能同时关注所有人,理解每个人说的话及其关系,形成全面的会议纪要。
Self-Attention 是 GPT 拥有高智能在算法层面的核心因素! [pdf_1]
六、关键流程要点
-
N = 输入 Token 总数,M = Embedding 维度,L = 词表总数 -
关键流程:词的 Token 化 → Embedding 查询 → 组成 N×M 输入矩阵 → Self-Attention 计算 Q、K、V → Nk 层计算 → 得到结果向量 -
关键参数:Token 词表、每个 Token 的 Embedding 向量、Wq/Wk/Wv 权重矩阵、其他算法层 Ci×Di 参数矩阵 -
Transformer 里所有算法都是矩阵和向量计算,每个算法的输入输出都是矩阵 -
编解码层数为 Nx,每一层的参数具体数值不同 [pdf_1]
七、核心概念速记表
|
|
|
|---|---|
| 模型 |
|
| 生成式 |
|
| 参数 |
|
| 无监督 |
|
| 语义表示 |
|
| NLP |
|
八、为什么 GPT 如此智能?
核心原因在于 Transformer 里最关键的三个设计:
-
Token → 细粒度拆分,控制词表规模 -
Embedding → 把一个词分成上万个维度表示语义 -
Self-Attention → 让大模型处理信息时考虑当前会话的重要性
★这两个看似简单的创新(Embedding + Self-Attention)加上巨量的模型参数,最终让大模型的智能得到了涌现。[pdf_1]
九、思考题
既然大语言模型通过预测最高概率的下一个字来生成文本,那是不是意味着一个输入应该只有一种输出?但现实应用中,相同的输入为什么会有多种不同输出呢?说说你的理解!
十、知识点总结(10 条)
-
Transformer 架构通过输入文本,预测下一个字的概率,实现 NLP 任务 -
输入、输出、词表等外围概念为理解程序流程打下基础 -
整体流程可从业务视角和程序视角理解,包括输入、编解码和输出模块 -
算法通过矩阵和向量计算实现,每个算法的输入和输出都是矩阵 -
核心算法和数据结构:Token、Embedding 和 Self-Attention -
通过理解 Transformer 的流程和数据结构,为学习大模型开发提供基础 -
用分治法将其分为输入、编解码和输出三大部分,便于逐步理解 -
了解每个算法的输入、输出和计算过程,以及模型参数的训练和应用 -
理解整体架构和程序流程,帮助将概念落实到程序中 -
三大核心:Token 词表、Embedding 向量和 Self-Attention 算法 [pdf_1]
★📌 下节预告:ChatGPT 有哪些核心工程创新点?—— Decoder 架构、数据训练、强化学习……
★💬 欢迎在评论区交流,如果觉得有收获,欢迎分享给更多朋友一起学习!

