大数跨境

Qwen3.8,登顶英伟达榜单!

Qwen3.8,登顶英伟达榜单! 智东西
2026-07-22
11
导读:超越腾讯混元、人类开发者、Cursor。

超越腾讯混元、人类开发者及 Cursor,阿里 Qwen3.8 登顶英伟达算子优化榜单。
作者 |  程茜
编辑 |  云鹏

智东西 7 月 22 日报道,阿里千问最新发布的Qwen3.8 预览版模型在英伟达 AI 算子优化评估榜单中登顶,排名超越腾讯混元、人类开发者及 AI 编程独角兽 Cursor。

该榜单中的 SOL 得分由 GPU 峰值算力与 HBM 带宽共同决定的理论性能极限界定。模型得分越接近 1,代表其生成和优化 GPU 算子的能力越趋近理论极限,能够在无需人类标注的情况下,通过与真实硬件环境交互,自主产生训练信号、评估输出质量并持续迭代优化。
此次榜单中,腾讯混元 Hyra 排名第二,人类开发者 Amir M. Mir 位列第四,美国 AI 创企 doubleAI 的全自动 GPU 内核生成智能体系统排名第六,Cursor 排名第十。

SOL-ExecBench 是英伟达于今年 3 月推出的 GPU CUDA Kernel 内核优化基准评测套件,专为 Blackwell B200 架构设计,旨在评估 AI 智能体、编译器及自动内核生成工具的算子性能。Qwen3.8 夺冠的 FlashInfer-Bench 子集,专门用于测试和优化大语言模型推理系统中的 GPU 算子。

7 月 19 日,阿里千问团队宣布即将开源 Qwen3.8。该模型参数量达 2.4T,可能是除 Fable 5 外最强大的模型。昨晚更新的 Qwen3.8-Max-Preview 在前端(WebDev)表现上进一步提升。

01. 从 124 个模型中提取共 235 项 CUDA 内核优化任务

随着 AI 智能体生成与优化 GPU 内核能力的增强,现有基准评测仅关注相对软件基线加速比的局限性日益凸显。在现代数据中心中,未能充分利用硬件的 kernel 意味着算力与能源的双重浪费。

为此,英伟达推出 SOL-ExecBench 基准套件。该套件包含235 项CUDA 内核优化任务,提取自124 个商用及前沿人工智能模型,覆盖大语言模型、扩散模型、计算机视觉、音视频及混合架构。测试目标硬件为英伟达 Blackwell 系列 GPU,涵盖 BF16、FP8、NVFP4 精度下的前向与反向计算负载。

与传统基于软件性能的评估不同,SOL-ExecBench 通过"Speed-of-Light(SOL)”界限来评估内核性能,即由 GPU 峰值算力与 HBM 带宽共同决定的理论性能极限

英伟达开发的 SOLAR 工具可从 FLOP 数量、字节数、GPU 峰值吞吐量及带宽等维度分析硬件 SOL 界限,并结合预定义评分基准得出 SOL 评分。

评分为 0.5 表示与基准值相当,1.0 则表示达到硬件 SOL 界限。该评分不仅反映相对改进程度,更体现了距离最大可实现硬件性能的剩余优化空间。

为确保结果可靠可复现,SOL-ExecBench 内置沙盒评估工具。其开发的智能优化算法可在相同协议下改进 PyTorch 参考实现,并能识别试图绕过评估机制以获取虚假加速的行为。

Qwen3.8 此次夺魁的是FlashInfer-Bench 子集,专用于测试和优化大语言模型推理系统中的 GPU 算子。

该子集包含 26 个来源于 Llama-3.1-8B、Qwen3-30B-A3B、DeepSeek-V3/R1 的问题,覆盖 BF16 与 FP8 精度格式。每个问题提供 7-48 个动态形状输入配置,涵盖融合注意力(Fused Attention)、FP8 MoE 和 RMSNorm 等推理关键算子,高度还原真实生产场景。

官方披露,所有提交内容均在真实 NVIDIA B200 GPU 上隔离执行,GPU 时钟锁定在 1500 MHz 以保证可复现性。

02. 榜单排名靠前意味模型具备闭环自我改进潜力

Kernel 优化是少数能提供清晰、客观、可量化反馈信号的工程任务:
反馈明确:运行时间、吞吐量、带宽利用率可精确测量;标准客观:距离硬件理论极限的距离无歧义;迭代自然:每一轮优化均可作为下一轮起点。
这意味着模型无需人类标注,即可通过与真实硬件交互,自主产生训练信号、评估质量并持续改进。
在 SOL-ExecBench FlashInfer-Bench 子集表现优异,表明模型在以下能力上具备显著优势:
  • 长程因果推理:优化决策间存在复杂依赖链,局部改动影响全局性能,模型需跨越长上下文进行一致性推理。
  • 工具使用与环境交互中的策略规划:面对多轮工具调用,模型需根据执行反馈动态调整策略,而非机械执行预设步骤。
  • 稀疏反馈下的探索能力:性能提升非线性,模型需在大量“看似合理但无效”的方向中识别真正有价值的优化路径。
  • 系统级抽象与具体实现的双向翻译:从高层算法语义映射到底层硬件指令,再从硬件反馈反推优化方向,该能力在科学计算、编译器及芯片设计领域具有直接迁移价值。

综上,能在 SOL-ExecBench 上持续进化的模型,已具备在客观物理约束下进行闭环自我改进的能力。

03. 训练侧搭建真实 GPU 环境,推理侧引入阿里智能体框架

据千问团队透露,其在训练与推理两端均针对 Kernel Self-Evolving 进行了专项优化。
在训练侧,为赋予模型真正的 kernel 优化能力而非仅学习代码模式,团队构建了一套基于真实 GPU 环境的大规模强化学习体系

1. 搭建基于沙盒的真实 GPU 训练环境

为模型提供丰富的硬件文档与可交互 Workspace,使其通过真实编译、执行与性能测量获取硬件奖励信号,摒弃代理指标或模拟器,确保每个训练信号具备真实物理意义。

2. 真实 Kernel 仓库作为训练数据

团队系统性收集了大规模工程级 kernel 优化代码作为训练 query。相比合成数据,真实反馈覆盖了更广泛的优化模式、硬件适配策略与工程取舍,提供了更接近生产场景的学习信号。

3. RL 基础设施的针对性优化

Kernel 优化任务涉及超长工具调用序列,单次优化可能包含数十至数百轮“编译 - 执行 - 分析”循环。研究人员对强化学习基础设施进行专项优化,高效支持超长多轮工具调用训练,使模型学会跨越长序列的持续优化策略。
在推理侧,研究人员采用阿里巴巴 Atrex Kernel Agent 框架承载算子优化的完整分析迭代流程与经验沉淀机制。

▲阿里巴巴 Atrex Kernel Agent 框架和工作流(图源:GitHub)

在 SOL-ExecBench FlashInfer-Bench 子集评测中,该模型完成了平均 29354 轮工具调用的持续迭代。在每轮循环中,模型对 kernel 实现进行编译、执行、性能分析与策略调整,将性能逐步推向硬件理论极限。
这表明模型在数万轮迭代中能保持方向一致性、持续产出有效优化且不陷入局部震荡,正是长程持续优化能力区别于普通代码生成能力的核心所在。

04. 结语:从手写算子到 AI 生成、调优

Qwen3.8 此次登顶,标志着其已具备承担底层算力优化复杂工程任务的能力,进一步压缩人工介入环节。它能直接对接真实硬件环境采集运行反馈,形成从算子生成到性能调优的自动化闭环。
自动化 GPU 算子生成赛道的长期竞争,未来或将取决于大模型理解硬件架构、推演访存瓶颈及自主迭代调参的综合智能水平。长远来看,伴随大模型能力升级,模型侧与编译层在算力优化方面将形成持续双向反馈,硬件规格、算子实现与模型架构的协同演进或将成为常态。
【声明】内容源于网络
0
0
智东西
各类跨境出海行业相关资讯
内容 11724
粉丝 0
智东西 各类跨境出海行业相关资讯
总阅读186.7k
粉丝0
内容11.7k