大数跨境

又一国产MoE旗舰模型登场!跻身全球开源第三,价格对标DeepSeek-V4-Pro

又一国产MoE旗舰模型登场!跻身全球开源第三,价格对标DeepSeek-V4-Pro 智东西
2026-09-20
1
导读:单任务成本是Claude Opus 5的1/8。

单任务成本是 Claude Opus 5 的 1/8。
作者 |  程茜
编辑 |  李水青

智东西 9 月 20 日报道,今日,阶跃星辰发布新一代 MoE 旗舰模型Step 5 Preview。该模型专为真实世界 Agentic 任务打造,总参数量 600B、激活参数 27B,支持 100 万 Token 上下文窗口,原生支持文本与视觉输入。

在全球 AI 榜单 Artificial Analysis Intelligence Index 中,Step 5 Preview 得分44 分,位居开源模型第三,仅次于 Qwen3.8 Max(0902)和 GLM-5.3(max)。

根据阶跃公开的基准测试结果,Step 5 Preview 在 Agent 长周期 CLI 任务测试、金融投资研究评测 FrontierFinance,以及跨领域深度研究评测 DRACO 等测试中优于 Kimi K3、GLM‑5.3,略逊色于 GPT-6 Astra 或 Claude Opus 5。

根据 Artificial Analysis 的榜单,该模型的输出速度为 100 token/秒,排名第 6。

在成本方面,据阶跃官方数据,Step 5 Preview 单任务成本为 Claude Opus 5(max)的1/8。Artificial Analysis 数据显示,前者单次总开销 0.71 美元(约合人民币 4.76 元),后者为 5.86 美元(约合人民币 39.25 元)。

Step 5 Preview 的定价为:每百万 Token 输入价格(缓存未命中)7 元、输入价格(缓存命中)0.35 元、输出价格 20 元。对比来看,该模型的价格可对标 DeepSeek-V4-Pro-0813 的高峰时段

实测显示,Step 5 Preview 擅长理解复杂任务、分步骤落地执行、文档转 PPT、视觉网页生成、3D 交互及模拟推演等多种真实工作场景,可处理图片、文字、3D 等混合的复杂需求,并独立输出可用结果。但在对视觉设计要求更复杂的场景中,其产出形式尚缺少多元化视觉素材,需用户介入迭代指令以达到更佳效果。

Step 5 Preview 目前已全量开放,将于10 月 15 日开源

国内开放平台 API 接入:
https://platform.stepfun.com/

国外开放平台 API 接入:
https://platform.stepfun.ai/

Studio 平台在线体验地址:
studio.stepfun.com

实测四大案例:博客一键变 PPT,7 轮模拟经营直出可交互复盘网页

智东西体验了 Step 5 Preview 在执行多轮长任务、抽象提示词理解、原生视觉等方面的能力,大部分任务一次输出即可完成。

案例一:将博客链接上传并直接生成面向非技术人员的 PPT。生成的 PPT 内容重点明确、风格统一,关键数据突出,且每页下方均划有演示重点。不足之处在于表现形式主要依靠文字样式变化,缺乏图表和配图等多元设计。

案例二:基于抽象提示词“一曲流动的诗篇……"生成视觉网页。模型先拆解需求并扩写提示词,随后生成对应网页。初版背景较为单调,经进一步要求增加设计感后,重新生成的页面实现了文字随滚动出现,背景色调与元素伴随文字变化的动态效果。

案例三:使用 Three.js 开发卡帕多奇亚热气球交互场景网页。模型一次生成的效果基本符合需求,用户可在功能框中调整风向、日照时间、热气球数量,并实时查看效果。

案例四:模拟经营一家新式茶饮小店。Step 5 Preview 扮演创业模拟 Agent,将经营过程划分为商业模式、选址、产品体系、供应链、装修、开业及终局报告等 7 轮。每一轮模型均提出多个方案并给出决策核心要素,在用户选择方案后推进。当用户提供特定约束(如“运营经验少”)时,模型能基于此在多轮决策中动态调整建议。

最终估算显示,该茶饮小店达成月净利 2.5 万元,账户留存现金 18.6 万元,并积攒了 1450 名排队客群。模型还能将所有决策流程生成为交互式产品,总结提炼各方案侧重点及可复用结论。

22 小时优化 GPU 内核,峰值性能提升至 508 TFLOPS

阶跃官方展示了 Step 5 Preview 在真实软件工程及长程任务执行中的多个案例。

Web 开发与视觉设计

在 Web 开发方面,模型可基于一张照片生成可编辑的 3D 环境,支持用户在带摆放反馈的情况下移动旋转家具或以第一人称视角参观房间。

在资料重构方面,模型基于 1922 年旅行指南构建交互式历史图册,通过路线、车站、行程规划与票价计算重建九广铁路,使档案资料呈现更生动。

长程任务执行与性能优化

优化 GPU Kernel:Step 5 Preview 在 24 小时内,于一张 NVIDIA H100 GPU 上从零开始优化一个 MLA GPU 内核。经过约 22 小时自主修改、运行及测量,峰值性能提升至 508 TFLOPS,超越 Claude Opus 5 的 493 TFLOPS。

优化后训练数据流程:在 24 小时内,通过自动化后训练提升 Qwen3-30B-A3B 基础模型在 AIME24 上的表现。准确率由 53.3% 提升至 60%,表现与 Claude Opus 5 持平且消耗 Token 更少。

游戏长程挑战:在未做专项优化的情况下,Step 5 Preview 在 Pokémon Red 游戏中持续完成超过 3000 Turns,累计交互近 600 万 Tokens。该任务要求模型记忆信息、管理资源并完成相互依赖的任务,人类玩家通常需约 26 小时完成主线。

此外,模型还可实现大规模研究、结构化分析及交互式报告生成。

Agent 长周期 CLI、金融投资等任务表现优于 Kimi K3、GLM‑5.3

在第三方及内部基准测试中,Step 5 Preview 与 GPT‑6 Astra、Claude Opus 5、Kimi K3、GLM‑5.3 进行了对比。在 Agent 长周期 CLI 任务、金融投资研究(FrontierFinance)及跨领域深度研究(DRACO)等多个测试中,Step 5 Preview 表现优于 Kimi K3 和 GLM‑5.3,仅次于 GPT-6 Astra 或 Claude Opus 5。

阶跃内部构建了覆盖 553 个代码仓库、9 类任务、20 个应用领域和 33 种编程语言的测试集 StepCodeBench。基于该评测,Step 5 Preview 在整体任务成功率和跨场景稳定性等方面综合得分为 49 分,超过 Kimi K3 和 GLM‑5.3。

在设备侧开发与调试方面,获得授权后,Step 5 Preview 可直接调用相机、COM 端口、截图和模拟鼠标输入。例如,模型曾连续工作超 3 小时,根据自然语言需求自主阅读 ESP32 文档,将一块 ESP32-S3 开发板改造成支持蓝牙按键与语音输入的 Vibe Coding 键盘。

在金融领域,阶跃构建了 FinStepBench-LiveSearch、FinStepBench-CorporateValuation、FinStepBench-DeepResearch 三项内部测试,考察模型的专业知识、因果联系建立能力及严谨分析建模能力。Step 5 Preview 在信息检索、估值和完整研究流程上得分较高,在外部基准测试 FrontierFinance 中得分仅次于 Claude Opus 5。

结语:大模型竞赛从算力军备赛转向算力转化率之争

阶跃指出,过去大模型 Scaling 的核心逻辑是用更多计算换取更强智能,但随着规模增长,核心关注点已转变为如何更高效地将计算转化为模型能力。下一阶段的 Scaling 不仅是更多计算,更是更高效率的计算。

未来大模型竞赛的核心将从原始算力军备赛转向算力转化率竞赛。谁能用更少的激活计算输出更强的真实世界任务能力,谁就能更适配 Agent 时代的产业落地趋势,效率已成为大模型发展的核心命题。

【声明】内容源于网络
0
0
智东西
各类跨境出海行业相关资讯
内容 11841
粉丝 0
智东西 各类跨境出海行业相关资讯
总阅读244.5k
粉丝0
内容11.8k