大数跨境

原理:一个例子讲清楚Transformer原理

原理:一个例子讲清楚Transformer原理 知识代码AI
2026-10-07
5
导读:01|原理:一个例子讲清楚Transformer原理一、课程简介三个目标:跟着 Transformer 程序流

01|原理:一个例子讲清楚Transformer原理


一、课程简介

三个目标:

  1. 跟着 Transformer 程序流程图,把所有 Transformer 里的概念串联起来,并理解清楚流程。
  2. 理解 Token、Embedding 和 Self-Attention 这 3 个最核心的算法和数据结构,解释 Transformer 为何可以达到人类智力级别。
  3. 从业务层看待 Transformer 程序流程图,理解上述所有大模型的相关概念。

二、GPT 的核心原理:一句话说清楚

★

通过输入一段文本,GPT 模型会预测出最可能成为下一个字的字。

举例:

  • 用户输入:"翻译:我爱你"
  • GPT 推理:字符串以"翻译:"开头 → 推测这是翻译任务 → 输出 "i"
  • 下一步输入变为:"翻译:我爱你 i" → 输出 "love"
  • 再下一步输入:"翻译:我爱你 i love" → 输出 "you"

生成式:一个字一个字预测生成一段文字的方式。


三、从经典概率模型理解 Transformer

在拆解复杂的 Transformer 之前,先看一个简化模型:

  • 假设"汪星语"只有 6 个词:我、刚才、现在、吃饭、睡觉、跑步
  • 句式:我 刚才 跑步,我 现在 ___
  • 要预测横线里填什么,只要计算"跑步"之后哪个行为的概率最大
  • 例如:P(吃饭|跑步) = 0.6,P(睡觉|跑步) = 0.3,P(跑步|跑步) = 0.1
  • 结果向量:[0, 0, 0, 0.6, 0.3, 0.1] → 选择概率最高的"吃饭"

核心思想:根据已有文本,遍历词表找出概率最大的下一个词。

Transformer 的流程虽然比这个复杂得多,但结构和功能是一样的,只是概率计算方法不同 [pdf_1]。


四、Transformer 整体架构(三大部分)

用分治法,把 Transformer 架构分为 3 大部分:

模块
职能
1- 输入模块
接收用户输入,做内部数据转换(Embedding),输出矩阵给编解码模块
2- 编解码模块
做核心算法(Self-Attention 等),预测概率
3- 输出模块
根据概率向量查词表,得到下一个输出字符

关键公式:

  • 程序 = 算法 + 数据结构
  • 大模型 = 模型算法 + 模型参数 [pdf_1]

五、三大核心概念

1. Token 和 Token 词表

  • Token 是比"词"更细的基本运算单位
  • 例如:"我叫金伟" → 拆成 4 个 Token:我 / 叫 / 金 / 伟
  • 拆成 Token 的目的是控制词表大小(长尾词占 90%)
  • "我爱你" + "i" → Token 表示:[我, 爱, 你, #i]

2. Embedding 向量

  • 每个 Token 不再只是一个序号,而是一个 M 维向量
  • 示例:#i → [0.1095, 0.0336, ..., 0.1589, 0.0282, 0.1756]
  • 维度越高,语义表达能力越强
  • GPT-3 中:M = 12288 维
  • 输入 4 个 Token → 得到 4 × 12288 的矩阵,传递给编解码模块
  • Embedding 把一个词分成了上万个维度表示,这是大模型智能的基础

3. Self-Attention 自注意力机制

核心思想:大模型做预测时,会关注当前句子里那些重要的词。

三个权重矩阵(QKV):

  • Wq → 生成查询向量(Q):Token 拿来去向别人查询
  • Wk → 生成键向量(K):Token 用来回应他人的查询
  • Wv → 生成值向量(V):表示 Token 的重要性值

算法流程:

  1. 第一步:每个 Token 生成自己的 Q、K、V 向量
  2. 第二步:Token ti 拿着自己的 Q 向量去询问每个 Token,获得重要性分数 Score
  3. 第三步:Score 与值向量 V 计算,得到表示重要性的向量 Z

生活类比:Self-Attention 就像会议中能同时关注所有人,理解每个人说的话及其关系,形成全面的会议纪要。

Self-Attention 是 GPT 拥有高智能在算法层面的核心因素! [pdf_1]


六、关键流程要点

  1. N = 输入 Token 总数,M = Embedding 维度,L = 词表总数
  2. 关键流程:词的 Token 化 → Embedding 查询 → 组成 N×M 输入矩阵 → Self-Attention 计算 Q、K、V → Nk 层计算 → 得到结果向量
  3. 关键参数:Token 词表、每个 Token 的 Embedding 向量、Wq/Wk/Wv 权重矩阵、其他算法层 Ci×Di 参数矩阵
  4. Transformer 里所有算法都是矩阵和向量计算,每个算法的输入输出都是矩阵
  5. 编解码层数为 Nx,每一层的参数具体数值不同 [pdf_1]

七、核心概念速记表

概念
一句话解释
模型
算法的具体程序实现 + 训练好的模型参数
生成式
一个字一个字预测生成文字的方式
参数
各矩阵在模型训练完成后的具体数值
无监督
下一个字正好是语料里的下一个字,无需人工标注
语义表示
Token 表示为 M 维的 Embedding 向量
NLP
类似语言翻译这样的自然语言任务

八、为什么 GPT 如此智能?

核心原因在于 Transformer 里最关键的三个设计:

  1. Token → 细粒度拆分,控制词表规模
  2. Embedding → 把一个词分成上万个维度表示语义
  3. Self-Attention → 让大模型处理信息时考虑当前会话的重要性
★

这两个看似简单的创新(Embedding + Self-Attention)加上巨量的模型参数,最终让大模型的智能得到了涌现。[pdf_1]


九、思考题

既然大语言模型通过预测最高概率的下一个字来生成文本,那是不是意味着一个输入应该只有一种输出?但现实应用中,相同的输入为什么会有多种不同输出呢?说说你的理解!


十、知识点总结(10 条)

  1. Transformer 架构通过输入文本,预测下一个字的概率,实现 NLP 任务
  2. 输入、输出、词表等外围概念为理解程序流程打下基础
  3. 整体流程可从业务视角和程序视角理解,包括输入、编解码和输出模块
  4. 算法通过矩阵和向量计算实现,每个算法的输入和输出都是矩阵
  5. 核心算法和数据结构:Token、Embedding 和 Self-Attention
  6. 通过理解 Transformer 的流程和数据结构,为学习大模型开发提供基础
  7. 用分治法将其分为输入、编解码和输出三大部分,便于逐步理解
  8. 了解每个算法的输入、输出和计算过程,以及模型参数的训练和应用
  9. 理解整体架构和程序流程,帮助将概念落实到程序中
  10. 三大核心:Token 词表、Embedding 向量和 Self-Attention 算法 [pdf_1]

★

📌 下节预告:ChatGPT 有哪些核心工程创新点?—— Decoder 架构、数据训练、强化学习……

★

💬 欢迎在评论区交流,如果觉得有收获,欢迎分享给更多朋友一起学习!


【声明】内容源于网络
0
0
知识代码AI
技术基底 机器视觉全栈 × 光学成像 × 图像处理算法 编程栈 C++/C#工业开发 | Python智能建模 工具链 Halcon/VisionPro工业部署 | PyTorch/TensorFlow模型炼金术 | 模型压缩&嵌入式移植
内容 414
粉丝 0
知识代码AI 技术基底 机器视觉全栈 × 光学成像 × 图像处理算法 编程栈 C++/C#工业开发 | Python智能建模 工具链 Halcon/VisionPro工业部署 | PyTorch/TensorFlow模型炼金术 | 模型压缩&嵌入式移植
总阅读8.3k
粉丝0
内容414