大数跨境

Meta新研究:字节模型蒸馏后,天花板破了

Meta新研究:字节模型蒸馏后,天花板破了 量子位
2026-09-15
4

Token 词元虽是大模型主流,但字节(Byte)模型在蒸馏技术加持下展现出新潜力。Meta FAIR 与华盛顿大学联合发布的论文《突破 Token 天花板:蒸馏出更小、更强的字节模型》提出,将知识蒸馏的学习单位从 Token 转换为字节,让学生模型直接学习字节级概率分布。

实验显示,随着训练计算量增加,字节级蒸馏的性能上限将反超传统 Token 级蒸馏,下游任务平均准确率高出 4 个百分点。

传统蒸馏要求学生模型学习教师在庞大 Token 词表上的概率分布,而字节仅有 256 种基础取值,预测空间更小且不受分词器限制。这意味着学习单元更小,但模型能力上限更高。

字节级蒸馏核心技术

知识蒸馏旨在让大模型(教师)指导小模型(学生)。不同于监督训练仅告知“下一个正确 Token",蒸馏还要求学生学习教师对候选 Token 的概率判断。然而,Llama 3-8B 等模型的词表高达 12 万余项,完整保存概率分布成本极高,通常需进行 top-k 截断。

字节模型将候选空间压缩至 256 种,使得保留完整概率分布成为可能。为解决教师预测 Token 与学生预测字节之间的对齐问题,论文提出了两种方案:Marginalize-ItEnd-Of-Token

两种方法的核心思路一致:将教师对不同 Token 的概率逐步分解到对应的字节位置。例如,若候选 Token 均以字节"i"开头,则预测首字节时累加这些候选的概率;随前缀匹配推进,逐步计算后续字节概率。

Marginalize-It:概率重分配

针对不同 Token 长度不一致的问题,Marginalize-It 采取直接策略:当某候选 Token 结束时,不再追踪其后续分布,而是将剩余候选概率重新归一化。该方法只需一次教师前向计算,效率高,但因丢弃部分结束 Token 的概率信息,本质上是一种近似处理。

End-Of-Token:明确结束标记

End-Of-Token 方案为每个 Token 末尾引入特殊符号,明确标识"Token 结束”。当预测进行到前缀结束时,学生模型既可预测后续字节,也可预测结束标记。这种方法在保留 Token 边界的同时,更完整地将教师分布映射到字节空间,且同样仅需一次教师前向计算。

实验验证与性能分析

研究团队以 Llama 3-8B 为教师,训练参数量约 12.8 亿的学生模型,对比了 Token、普通字节及两种字节蒸馏方案共六组设置。评测涵盖选择题、语言生成及机器翻译等八项任务。

训练曲线显示,Token 模型前期收敛快,但易遇瓶颈;字节模型起步慢,却具备更强的 Scaling 潜力。尽管字节模型在每字节预测损失(BPB)上表现优异,但下游任务成绩需结合 Scaling 定律推算。

基于“计算量→BPB→任务成绩”的拟合预测,三种蒸馏方案的准确率上限分别为:Token 蒸馏 48.4%,Marginalize-It 蒸馏 50.5%,End-Of-Token 蒸馏 52.4%。

End-Of-Token 方案表现最佳,比传统 Token 蒸馏高出 4 个百分点。值得注意的是,普通字节监督模型的预测上限(51.2%)高于 Marginalize-It 蒸馏,印证了后者因近似处理丢失信息的缺陷。而 End-Of-Token 凭借完整的分布保留,超越了所有对比方案。

在资源效率方面,End-Of-Token 达到同等性能上限所需的实际文本量仅为 Token 方案的六分之一;在存储相同分布精度的前提下,存储量约为五分之一。不过,由于引入结束标记,其训练计算量比普通字节模型高出约 30.94%,推理成本的公平比较仍有待进一步研究。

核心作者团队

论文由 Meta FAIR 与华盛顿大学合作完成,核心作者包括:

  • Kalyani Marathe:华盛顿大学博士生,主攻大模型训练与架构,曾在 Meta AI Research 实习。
  • Artidoro Pagnoni:华盛顿大学博士生、Meta 访问研究员,Byte Latent Transformer (BLT) 及 QLoRA 核心作者。
  • Tomasz Limisiewicz:华盛顿大学与 Meta 博士后,专注大模型学习机制与分词研究。
  • Margaret Li:华盛顿大学博士生、Meta FAIR 访问研究员,研究方向为大模型高效训练与安全。
  • Mike Lewis:Meta FAIR 研究科学家,Llama 3 预训练负责人之一,RoBERTa 等代表作作者。
  • Luke Zettlemoyer:华盛顿大学教授兼 Meta FAIR Seattle 负责人,NLP 领域资深专家。
  • Srinivasan Iyer:Meta FAIR 研究科学家,专攻语言建模与文本生成。

参考链接:https://arxiv.org/pdf/2609.12303

【声明】内容源于网络
0
0
量子位
各类跨境出海行业相关资讯
内容 16447
粉丝 1
量子位 各类跨境出海行业相关资讯
总阅读427.3k
粉丝1
内容16.4k