
新智元报道

9 月是全球 AI 实验室密集发布旗舰模型的“修罗场”。在这场周周洗牌的混战中,阶跃星辰选择“攒一个大招”,于 9 月 20 日正式发布新一代旗舰基座模型 Step 5 Preview,宣告重回竞争核心。
创造新的前沿:开源模型跻身全球前三
在 Artificial Analysis Intelligence Index(AA 智能指数)中,Step 5 Preview 取得 44 分的成绩。
横向对比显示,Claude Fable 5.1(53 分)领跑全球,GPT-6 Astra(52.8 分)紧随其后。Step 5 Preview 凭借 44 分闯入全球开源模型前三甲。
更引人注目的是其极致性价比:输入成本 1 美元/百万 token,输出 2.7 美元/百万 token,完成一道 AA 智能指数任务平均仅需 0.71 美元。
在 AA 官方“智能指数 vs 单任务成本”图谱中,Step 5 Preview 确立了新的帕累托前沿:同等智能水平下成本最低,同等价格下智能最高。
值得注意的是,AA 智能指数月初已升级至 v4.2 版本,剔除简单评测项并大幅提升私有测试集权重,旨在考察模型在未知任务上的真实推理能力。在此背景下,Step 5 Preview 作为少数进入核心竞争区的开源模型,标志着中国开源模型能力天花板的进一步上移。
Benchmark 是入场券,实战才是成绩单
Step 5 Preview 明确聚焦 Coding、软件工程、专业知识及金融场景,主打长上下文、多轮工具调用与持续执行能力。其原生支持 1M 上下文,可容纳整个代码仓库或数据室,致力于像靠谱员工般接手复杂项目。
一句话生成可玩 3D 飞行游戏
在代码能力实测中,要求仅用单文件 HTML 和 three.js 库开发一款街机风格低多边形 3D 飞行游戏。Step 5 Preview 耗时 20 余分钟生成上千行代码,直接可运行。

- 画面表现:自编写着色器实现动态海面起伏、阳光反射及雾气效果,视觉体验出色。
- 操作手感:具备自动回正、动态视野拉伸及碰撞反馈机制,节奏流畅。
- 细节完善:主动添加光柱指引、粒子特效、计分系统及冷却条,无需人工修改即可达到生产级标准。
长程 Agent:12 份合同审查零遗漏
面对 12 份中英文合同对照 10 条法务标准进行审查、计算续约日期并撰写修订函的复杂任务,Step 5 Preview 展现了卓越的长程稳定性。

- 精准度:120 个判断点全部命中,额外识别出隐藏条款风险,第 12 份合同审查细致度与首份一致。
- 深度洞察:成功揪出附件中的违规项,并基于逻辑推导指出错过退出窗口及通知期冲突等潜在风险。
- 逻辑闭环:输出的修订函、续约清单与总结报告三者数据互相咬合,逻辑严密。
Deep Research:多源冲突信息下的逻辑推理
在处理 9 份数据冲突的公司材料时,模型自主建立七级信源优先级规则(如审计报告优于新闻稿),并严格执行。

- 规则优先:在 CEO 采访与官方更正声明冲突时,依据规则采纳后者,并解释数值差异原因。
- 异常发现:通过反推营收数据,发现增长率背后的季节性异常,列为关键风险点。
- 过程透明:所有结论均精确引用至具体文件行号,推理过程清晰可查。
金融尽调:模拟专业投资经理工作流
基于 B 轮公司数据室(含财务报表、流水、股权表等),Step 5 Preview 完成了尽调备忘录与勾稽底稿的编制。

- 数据精确:收入、回款等核心财务指标精确到元,底稿公式可追溯源头。
- 风险识别:核出增速、毛利率及客户集中度等 6 处数据不符,并剔除股东借款等非经营性流入,还原真实现金流状况。
- 关联挖掘:通过跨文档比对,发现未披露的关联交易(CEO 配偶收取高额咨询费)及成本倒算嫌疑。
此外,阶跃自建 FinStepBench 评测体系并结合外部 FrontierFinance 测试,Step 5 Preview 在实时检索、估值建模及完整研究流程中均表现优异。
反直觉技术路线:窄而深的效率进化
Step 5 Preview 采用稀疏 MoE 架构,总参数 600B,激活参数仅 27B,原生支持文本与视觉输入,上下文长度达 1M。阶跃并未盲目追求参数量,而是探索“能力×效率”的最优解。
Narrow but Deep:强化长程信息传播
针对复杂 Agent 任务中的多跳依赖问题,模型将 Transformer 深度增加至 92 层,通过“窄而深”架构延长信息在 Prefill 阶段的传播路径。为此,团队对 Hidden State、RMSNorm 及梯度进行了专项优化,解决了深层网络的训练稳定性难题。
多层面稀疏设计:Sparse MoE ++ Sparse GQA
引入 Sparse GQA 机制,在百万 token 长上下文中仅挑选相关历史信息参与注意力计算,大幅降低计算开销,实现“只看该看的地方”。
系统效率打通:从算法稀疏到硬件加速
为解决稀疏计算带来的 GPU 利用率碎片化问题,Step 5 Preview 采用 Block-wise Token Merging 技术,将索引与选择成本降低 8 倍,并通过合并相邻 Token 的 Top-k 结果,显著提升推理效率。
面向 Agent 的训练体系
构建由 Agent 参与样本生成、任务设计及难度控制的动态训练闭环,加入 Anti-hacking 机制防止模型利用评测漏洞。同时,通过 Context Compaction 与细粒度奖励分配,优化长轨迹学习能力,确保模型在有限上下文中持续推进长任务。
从 Flash 到旗舰:效率基因的连续演进
回顾阶跃技术演进史,“效率优先”贯穿始终:
- Step 3.5 Flash:196B 总参/11B 激活,成为吉利整车智能体核心。
- Step 3.7 Flash:加入原生视觉能力,斩获多项多模态榜单全球第一。
- Step 5 Preview:600B 总参/27B 激活,激活比例更低,能力跃升至旗舰级,上下文扩展至 1M。
阶跃证明了高效率设计与高智能上限并不对立,成功将 Flash 级别的效率优势延伸至旗舰模型,推动大模型竞争从单一规模 Scaling 转向综合能力与效率的比拼。
体系级选手的重新入场
阶跃此次不仅发布了基座模型,更亮出了三张体系级王牌:
前沿基座能力确认
Step 5 Preview 以 AA 智能指数 44 分、全球开源前三的成绩,重新确立了阶跃在旗舰模型研发领域的领先地位。
全模态矩阵补齐
近期发布的 StepAudio 3 系列中,Realtime 版本拿下语音交互榜全球第一,ASR 词错误率并列全球第一。结合 Step Edge、StepGUI 及 Step1X 等模型,阶跃已构建起完整的全栈多模态布局。
终端量产与数据飞轮
这是阶跃最独特的护城河。其模型手机装机量超 4200 万台,日均服务近 2000 万人次,覆盖超半数中国头部手机品牌;在汽车端深入吉利整车智能体合作。搭载 Step AOS 的大模型原生手机 STEPX Neo 更通过国标 L3 级测试。
海量的真实终端数据构成了纯 API 厂商难以企及的数据飞轮,持续驱动模型在噪声环境、低算力条件下的迭代。面对即将到来的 Personal Agent 战场,阶跃凭借“模型 + 系统 + 终端”的闭环生态,已提前卡位。
随着 Step 5 Preview 的发布,大模型竞争已进入涵盖基础能力、全模态体系、终端落地及商业闭环的系统性竞赛新阶段。阶跃正以高效的差异化路径,驶入生产级 Agent 模型的核心竞争区。
编辑:所罗门

