大数跨境

GPT-6带火循环Transformer,阿里早已布局

GPT-6带火循环Transformer,阿里早已布局 量子位
2026-09-05
4
导读:手握两篇顶会论文

GPT-6 Astra 的发布让「循环深度」(Recurrent Depth)技术迅速成为行业焦点。该技术核心在于让同一组 Transformer 层反复运行,在不显著增加参数规模的前提下,通过加深计算层级提升模型能力。

然而,这一架构也引发了关于 AI 安全与可解释性的争议。由于循环过程发生在隐藏状态(hidden state)内部,未必生成人类可读的思维链,导致监测难度增加。OpenAI 首席科学家 Jakub Pachocki 已表示将就此发布详细解释。

回归技术本身,学界早已发现循环模型面临的核心瓶颈:**计算冗余**。在同等算力下,简单的循环模型往往难以战胜普通 Transformer。针对这一难题,阿里及合作高校团队近期发表了两篇重磅论文——**MeSH**与**SpiralFormer**,分别从信息管理和计算粒度两个维度提出了解决方案。

下一代架构候选:突破「计算冗余」瓶颈

循环 Transformer 被视为大模型 Scaling 的新路径。传统模式依赖堆叠参数(如 24 层需 24 套参数),而循环架构允许用较少参数(如 8 层跑 3 遍)完成同等深度的计算,从而以计算深度换取参数规模的高效利用。

此前,Claude Mythos 曾在图搜索任务中展现出惊人性能,在 GraphWalks BFS 测试中得分远超 GPT-5.4 及自家 Opus 版本,外界推测其可能采用了循环架构。这表明,模型无需持续扩大规模,仅靠内部多轮计算即可显著提升能力。

但实验数据揭示了残酷现实:随着循环次数增加,后续计算带来的状态更新幅度急剧减小。如图所示,第一个核心循环(core loop)贡献了主要更新,后续循环虽消耗同等算力,却陷入“空转”。

这种“计算冗余”表现为:循环次数增加,但有效增量递减。阿里团队的研究正是致力于解决这一问题,确保每一轮计算都能产生实际价值。

MeSH:动态管理信息流,解决「计算无分化」

被 ICLR 2026 接收的论文《MeSH》指出,循环模型效率低下的根源在于「计算无分化」和「信息过载」。研究发现,传统循环模型存在三大问题:后续循环状态变化微弱、相邻轮次表示高度相似、隐藏状态逐渐坍缩至低维空间。

实验数据显示,在 Pythia-1.4B 级别模型中,引入 MeSH 后,非嵌入参数减少约 33%,零样本下游平均准确率反而从 49.50% 提升至 50.56%,且额外计算开销极低。

MeSH 的核心创新在于引入动态存取的「Memory Buffer」(记忆缓冲池)及双路由器机制:

  • Write Router(写入路由器):决定新一轮计算结果如何按权重分配至不同的记忆槽。
  • Read Router(读取路由器):在下一轮开始前,按需从各槽位读取信息重组隐藏状态。

该机制实现了信息的动态分流与重组,使共享网络在不同轮次形成明确分工,有效缓解了重复劳动和信息拥堵问题。

SpiralFormer:多分辨率计算,从全局到局部

继 MeSH 解决“算什么”之后,被 EMNLP 2026 接收的《SpiralFormer》进一步解决了“以何种粒度算”的问题。该研究受隐式思考启发,提出不同循环轮次应采用可变的序列长度

实验表明,SpiralFormer-L 在参数量与普通 Transformer 相当的情况下,计算量降低约 6.7%,5-shot 下游平均准确率却从 51.93% 提升至 54.37%。

SpiralFormer 采用“由粗到细”的处理策略:初始轮次将相邻 Token 压缩为短序列(如原长的 1/8),关注全局模式;随后逐步恢复分辨率(1/4、1/2),最终在完整序列上处理细节。这种设计类似于先看地图全貌再定位街道。

注意力机制探测实验证实,低分辨率阶段模型关注广泛的全局信息,高分辨率阶段则聚焦局部关键位置。这种从 Global Pattern 到 Local Pattern 的自然过渡,是普通循环模型难以自发形成的。

此外,研究还发现循环层比例存在最佳区间(30%-40%),过度共享参数反而会拖累性能,这为模型架构设计提供了新的 Scaling 维度。

总结:从理论验证走向工程实践

MeSH 与 SpiralFormer 分别从信息流转和计算尺度两个维度,补齐了循环 Transformer 的短板。前者通过动态路由实现精细分工,后者通过多分辨率策略优化计算效率。

在大模型 Scaling 陷入参数堆砌瓶颈的当下,循环架构提供了一条“以计算换参数”的新路径。虽然这需要更精细的结构设计以避免冗余,但阿里团队的最新成果证明,通过针对性的架构改良,循环模型完全具备成为下一代高效大模型候选者的潜力。

从 Universal Transformer 的早期尝试,到如今 ICLR 与 EMNLP 顶会的认可,循环深度技术正逐步从学术构想走向产业落地。随着 Astra 等模型的推动,这条技术路线的未来值得持续关注。

【声明】内容源于网络
0
0
量子位
各类跨境出海行业相关资讯
内容 16418
粉丝 1
量子位 各类跨境出海行业相关资讯
总阅读407.7k
粉丝1
内容16.4k