作者丨正在学AI的小泉同学
前两篇咱们搞定了 Transformer 的核心目标、文字转向量和 Encoder “阅读理解”,今天直击最后一环 —— 模型怎么把读懂的内容,转换成咱们能看懂的文字?
Decoder 是 Transformer 的 “写作担当”,就像看完文章写读后感,核心是把 Encoder 的全局语义特征,转换成目标序列(比如翻译结果、问答答案)。它和 Encoder 很像,但多了两个关键模块:
一层 DecoderLayer 的核心结构,记 3 点就够:
1.掩码自注意力层:和 Encoder 的自注意力不同,这里会屏蔽未来的词 —— 生成 “我吃饭” 时,生成 “吃” 只能看到 “我”,看不到 “饭”,保证生成的序列符合逻辑,不 “偷看”、不闹笑话。
2.交叉注意力层:Encoder 和 Decoder 的 “桥梁”!Decoder 输出的向量当 Q,Encoder 的全局语义特征当 K 和 V,让源文本和目标文本精准对齐。比如输入英文 “I eat apples”,Decoder 生成中文时,能把 “我” 和 “I”、“吃” 和 “eat”、“苹果” 和 “apples” 对齐,不跑偏。
3.前馈网络与残差归一化:和 Encoder 完全一样,核心是稳定训练、强化特征表达,不用额外调整。
简单说,Decoder 的作用:一边 “回看” Encoder 读懂的语义,一边 “回忆” 已生成的词,逐词生成符合逻辑、和输入对齐的目标序列 ——“读懂了,也能写出来”。
Decoder 输出的还是向量,要转换成文字,就两步:
1.线性层:把 Decoder 的向量映射到整个词表维度。比如词表有 10000 个词,就映射成 10000 维向量,每个维度对应一个词(比如第 100 维对应 “我”,第 200 维对应 “吃”)。
2.Softmax 激活函数:把向量转换成概率分布(所有概率加起来 = 1),选概率最高的词作为当前输出,循环直到生成结束标志,整个序列就搞定了!
超精简总结
Transformer 的核心,是解决 RNN/LSTM“效率低、长距离依赖差” 的痛点,以自注意力为核心,搭了可并行、可扩容的架构,总结 3 点:
1.核心目的:实现序列建模的全并行计算,精准抓长距离语义关联,解决老模型的致命 bug;
2.核心组件:自注意力(抓全局关联)、位置编码(补顺序短板)、Encoder-Decoder 堆叠(扩模型规模);
3.完整流程:文本→分词→词嵌入 + 位置编码→Encoder 提取全局语义→Decoder 生成目标序列→输出层转化为文本。
它不只是一个模型,更是大模型时代的 “地基”—— 所有主流大模型,都是在它的基础上优化来的,吃透它,学大模型就成功了一半!
#大模型 #AI #AI学习

