大数跨境

菲尔兹奖得主入局大模型!4B手机Qwen+云端GLM刷爆ARC-AGI 3

菲尔兹奖得主入局大模型!4B手机Qwen+云端GLM刷爆ARC-AGI 3 量子位
2026-09-07
6
导读:“在两个AI模型之间找到数学上的共同基础其实非常困难”

导读

GPT-6 Astra 在 ARC-AGI 3 基准测试中接近满分的同时,一个仅需在手机端运行的 4B 小模型也取得了突破性成绩。这并非单一模型的胜利,而是智谱 GLM-5.2(753B)与阿里 Qwen-3.5(4B)的跨界组合。初创团队 Mostik 通过构建“隐藏状态桥”,让大模型在不输出任何文本的情况下,将内部计算状态直接传递给小模型。该方案不仅弥补了两者间 50% 的性能差距,更将大模型推理成本压缩至原本的二十分之一。

两兆字节与十七比特的信息损耗

当前多模型协作系统存在显著的效率瓶颈。大模型生成一个 token 时,内部会构建包含约一百万个数值的隐藏向量,总计约两兆字节的内部状态信息。然而,最终输出的仅为从词表中选出的一个 token,相当于仅 17 比特。

这意味着,每生成一个字,就有两兆字节的深层计算信息被丢弃。现有的智能体协作、模型委员会等方案,均建立在这 17 比特的文本输出之上,导致模型间沟通渠道极其低效。

可解释性研究证实,被丢弃的两兆字节中蕴含着核心推理内容。ICLR 2026 论文显示,模型在输出特定词汇前,其内部状态已携带该词的表征,从而提前规划语法结构。Anthropic 团队也在 Claude 3.5 Haiku 中发现了一种"J-space"结构,即模型时刻维护着一组未表达的概念。当模型通过文本与其他模型交流时,丢失的正是这些做出选择背后的深层计算过程。

构建模型间的“隐藏状态桥”

Mostik 团队的核心创新在于搭建了一座“桥”,允许模型将隐藏状态直接传递给另一模型,全程无需生成文本,且双方模型权重保持冻结,仅训练桥梁部分。

在公开演示中,团队选用智谱 GLM-5.2(753B 参数)作为发送方,阿里 Qwen-3.5(4B 参数)作为接收方。大模型仅负责读取问题并生成隐藏状态,随即停止;所有文本生成任务均由小模型承接。

这一架构带来了关键的成本优势:大模型仅需执行廉价的“预填充”操作,而昂贵的逐 token“解码”环节完全由小模型承担。实验数据显示,该方案使 4B 小模型弥补了与 753B 大模型之间 50% 的性能差距,自身准确率提升 25%;在高难度子集上,性能提升幅度达 2 倍。同时,大模型侧的推理成本降至传统方案的约五十分之一。

对比传统的文本接力方案,桥接技术在算力受限或需要早期介入的场景下表现尤为出色。即便在大模型尚未输出任何文字时,其隐藏状态中积累的信息已通过桥梁有效传递。此外,由于 GLM 与 Qwen 由不同团队使用不同数据训练,该成功案例证明桥梁利用的是模型训练中自然产生的通用数学结构,而非过拟合的结果。

菲尔兹奖得主领衔的精英团队

Mostik(俄语意为“小桥”)成立仅四个月,核心团队 15 人中拥有 12 位博士。公司首席科学家为 2010 年菲尔兹奖得主、日内瓦大学教授 Stanislav Smirnov。

Smirnov 指出,在不同 AI 模型间寻找数学共同基础极具挑战,目前尚缺乏合适的数学语言来描述表征的对应与迁移。CEO Sasha Malysheva 作为核心方法开发者之一,提出未来 AI 格局未必是单一巨型模型主导,而是前沿通用模型与生物、物理等专用模型的高效配对。

团队以“群体智慧”比喻多模型协作潜力:正如普通人平均值往往优于单个专家,多个模型协作若能降低沟通成本,将释放巨大潜能。Mostik 的方案正是跳过了将内部计算压缩为文字再重新展开的繁琐手续。

技术延伸与未来展望

连接既有模型仅是第一步,Mostik 正探索两条进阶路径:

高效蒸馏

传统蒸馏依赖教师模型的最终输出信号。若通过“桥”同步教师的内部状态,监督信号可更早介入学生模型的生成过程。初步结果显示,同等训练预算下,学生模型能更逼近教师模型水平。

专项化与安全观测

小模型借助桥梁训练特定领域能力时,学习效率更高且能保留通用能力,这意味着为大模型增加新技能可能无需重训整套系统。在安全层面,桥梁提供了新的观测维度,通过记录发送方隐藏状态、转换结果及接收方行为,可更有效地监控链式思维无法覆盖的异常行为。

尽管该技术在真实业务负载中的普适性仍需验证,但在 ARC-AGI 3 测试中,这种让大模型“闭嘴思考”、小模型代为表达的创新架构,已展现出颠覆性的性能与成本优势。

【声明】内容源于网络
0
0
量子位
各类跨境出海行业相关资讯
内容 16427
粉丝 1
量子位 各类跨境出海行业相关资讯
总阅读414.7k
粉丝1
内容16.4k