大数跨境

刚刚,阶跃Step 5 Preview发布!一举杀进全球开源前三

刚刚,阶跃Step 5 Preview发布!一举杀进全球开源前三 新智元
2026-09-20
16

新智元报道

9 月是全球 AI 实验室密集发布旗舰模型的“修罗场”。在这场周周洗牌的混战中,阶跃星辰选择“攒一个大招”,于 9 月 20 日正式发布新一代旗舰基座模型 Step 5 Preview,宣告重回竞争核心。

创造新的前沿:开源模型跻身全球前三

在 Artificial Analysis Intelligence Index(AA 智能指数)中,Step 5 Preview 取得 44 分的成绩。

横向对比显示,Claude Fable 5.1(53 分)领跑全球,GPT-6 Astra(52.8 分)紧随其后。Step 5 Preview 凭借 44 分闯入全球开源模型前三甲。

更引人注目的是其极致性价比:输入成本 1 美元/百万 token,输出 2.7 美元/百万 token,完成一道 AA 智能指数任务平均仅需 0.71 美元。

在 AA 官方“智能指数 vs 单任务成本”图谱中,Step 5 Preview 确立了新的帕累托前沿:同等智能水平下成本最低,同等价格下智能最高。

值得注意的是,AA 智能指数月初已升级至 v4.2 版本,剔除简单评测项并大幅提升私有测试集权重,旨在考察模型在未知任务上的真实推理能力。在此背景下,Step 5 Preview 作为少数进入核心竞争区的开源模型,标志着中国开源模型能力天花板的进一步上移。

Benchmark 是入场券,实战才是成绩单

Step 5 Preview 明确聚焦 Coding、软件工程、专业知识及金融场景,主打长上下文、多轮工具调用与持续执行能力。其原生支持 1M 上下文,可容纳整个代码仓库或数据室,致力于像靠谱员工般接手复杂项目。

一句话生成可玩 3D 飞行游戏

在代码能力实测中,要求仅用单文件 HTML 和 three.js 库开发一款街机风格低多边形 3D 飞行游戏。Step 5 Preview 耗时 20 余分钟生成上千行代码,直接可运行。

  • 画面表现:自编写着色器实现动态海面起伏、阳光反射及雾气效果,视觉体验出色。
  • 操作手感:具备自动回正、动态视野拉伸及碰撞反馈机制,节奏流畅。
  • 细节完善:主动添加光柱指引、粒子特效、计分系统及冷却条,无需人工修改即可达到生产级标准。

长程 Agent:12 份合同审查零遗漏

面对 12 份中英文合同对照 10 条法务标准进行审查、计算续约日期并撰写修订函的复杂任务,Step 5 Preview 展现了卓越的长程稳定性。

  • 精准度:120 个判断点全部命中,额外识别出隐藏条款风险,第 12 份合同审查细致度与首份一致。
  • 深度洞察:成功揪出附件中的违规项,并基于逻辑推导指出错过退出窗口及通知期冲突等潜在风险。
  • 逻辑闭环:输出的修订函、续约清单与总结报告三者数据互相咬合,逻辑严密。

Deep Research:多源冲突信息下的逻辑推理

在处理 9 份数据冲突的公司材料时,模型自主建立七级信源优先级规则(如审计报告优于新闻稿),并严格执行。

  • 规则优先:在 CEO 采访与官方更正声明冲突时,依据规则采纳后者,并解释数值差异原因。
  • 异常发现:通过反推营收数据,发现增长率背后的季节性异常,列为关键风险点。
  • 过程透明:所有结论均精确引用至具体文件行号,推理过程清晰可查。

金融尽调:模拟专业投资经理工作流

基于 B 轮公司数据室(含财务报表、流水、股权表等),Step 5 Preview 完成了尽调备忘录与勾稽底稿的编制。

  • 数据精确:收入、回款等核心财务指标精确到元,底稿公式可追溯源头。
  • 风险识别:核出增速、毛利率及客户集中度等 6 处数据不符,并剔除股东借款等非经营性流入,还原真实现金流状况。
  • 关联挖掘:通过跨文档比对,发现未披露的关联交易(CEO 配偶收取高额咨询费)及成本倒算嫌疑。

此外,阶跃自建 FinStepBench 评测体系并结合外部 FrontierFinance 测试,Step 5 Preview 在实时检索、估值建模及完整研究流程中均表现优异。

反直觉技术路线:窄而深的效率进化

Step 5 Preview 采用稀疏 MoE 架构,总参数 600B,激活参数仅 27B,原生支持文本与视觉输入,上下文长度达 1M。阶跃并未盲目追求参数量,而是探索“能力×效率”的最优解。

Narrow but Deep:强化长程信息传播

针对复杂 Agent 任务中的多跳依赖问题,模型将 Transformer 深度增加至 92 层,通过“窄而深”架构延长信息在 Prefill 阶段的传播路径。为此,团队对 Hidden State、RMSNorm 及梯度进行了专项优化,解决了深层网络的训练稳定性难题。

多层面稀疏设计:Sparse MoE ++ Sparse GQA

引入 Sparse GQA 机制,在百万 token 长上下文中仅挑选相关历史信息参与注意力计算,大幅降低计算开销,实现“只看该看的地方”。

系统效率打通:从算法稀疏到硬件加速

为解决稀疏计算带来的 GPU 利用率碎片化问题,Step 5 Preview 采用 Block-wise Token Merging 技术,将索引与选择成本降低 8 倍,并通过合并相邻 Token 的 Top-k 结果,显著提升推理效率。

面向 Agent 的训练体系

构建由 Agent 参与样本生成、任务设计及难度控制的动态训练闭环,加入 Anti-hacking 机制防止模型利用评测漏洞。同时,通过 Context Compaction 与细粒度奖励分配,优化长轨迹学习能力,确保模型在有限上下文中持续推进长任务。

从 Flash 到旗舰:效率基因的连续演进

回顾阶跃技术演进史,“效率优先”贯穿始终:

  • Step 3.5 Flash:196B 总参/11B 激活,成为吉利整车智能体核心。
  • Step 3.7 Flash:加入原生视觉能力,斩获多项多模态榜单全球第一。
  • Step 5 Preview:600B 总参/27B 激活,激活比例更低,能力跃升至旗舰级,上下文扩展至 1M。

阶跃证明了高效率设计与高智能上限并不对立,成功将 Flash 级别的效率优势延伸至旗舰模型,推动大模型竞争从单一规模 Scaling 转向综合能力与效率的比拼。

体系级选手的重新入场

阶跃此次不仅发布了基座模型,更亮出了三张体系级王牌:

前沿基座能力确认

Step 5 Preview 以 AA 智能指数 44 分、全球开源前三的成绩,重新确立了阶跃在旗舰模型研发领域的领先地位。

全模态矩阵补齐

近期发布的 StepAudio 3 系列中,Realtime 版本拿下语音交互榜全球第一,ASR 词错误率并列全球第一。结合 Step Edge、StepGUI 及 Step1X 等模型,阶跃已构建起完整的全栈多模态布局。

终端量产与数据飞轮

这是阶跃最独特的护城河。其模型手机装机量超 4200 万台,日均服务近 2000 万人次,覆盖超半数中国头部手机品牌;在汽车端深入吉利整车智能体合作。搭载 Step AOS 的大模型原生手机 STEPX Neo 更通过国标 L3 级测试。

海量的真实终端数据构成了纯 API 厂商难以企及的数据飞轮,持续驱动模型在噪声环境、低算力条件下的迭代。面对即将到来的 Personal Agent 战场,阶跃凭借“模型 + 系统 + 终端”的闭环生态,已提前卡位。

随着 Step 5 Preview 的发布,大模型竞争已进入涵盖基础能力、全模态体系、终端落地及商业闭环的系统性竞赛新阶段。阶跃正以高效的差异化路径,驶入生产级 Agent 模型的核心竞争区。

编辑:所罗门

【声明】内容源于网络
0
0
新智元
智能+中国主平台,致力于推动中国从互联网+迈向智能+新纪元。重点关注人工智能、机器人等前沿领域发展,关注人机融合、人工智能和机器人革命对人类社会与文明进化的影响,领航中国新智能时代。
内容 16561
粉丝 0
新智元 智能+中国主平台,致力于推动中国从互联网+迈向智能+新纪元。重点关注人工智能、机器人等前沿领域发展,关注人机融合、人工智能和机器人革命对人类社会与文明进化的影响,领航中国新智能时代。
总阅读411.8k
粉丝0
内容16.6k