千问 AI 平台上线 Qwen3.8-Flash:极致性价比赋能真实任务
千问 AI 平台正式发布 Qwen3.8-Flash 模型。该模型在编程、Agent 等真实应用场景中实现了极致的性价比,最新定价如下:
- 输入价格:每百万 Tokens 0.8 元
- 输出价格:每百万 Tokens 2.7 元
- 缓存命中价格:每百万 Tokens 0.1 元
架构革新:Qwen3.8-Flash 的技术突破
Qwen3.8-Flash 是一款基于下一代(Next)架构的多模态混合专家(MoE)模型。其千亿总参数中仅激活 60 亿(6B),创下了模型效率的全球新基准。该模型采用了与此前千问系列完全不同的全新架构,主要技术创新包括:
注意力机制优化
引入独特的 QSA(Qwen Sparse Attention)机制,与 GDN 高效融合形成混合注意力架构。这一设计显著降低了计算开销,在高缓存命中的 1M Tokens 长上下文场景中,推理速度提升 8 倍以上,兼顾精准度与响应速度。
分层通信升级
采用自研 Gated Residual 方法,将传统 Transformer 的单条信息主通道拓展为四条。模型可根据需求动态决定信息读写路径,不仅提升了信息传递效率,也增强了训练过程的稳定性。
参数扩展创新
引入 51B 的 N-gram Embedding 参数,为 Transformer 提供高效的查表寻址能力。该部分参数在 Token 计算时无需参与运算,相当于以极低资源消耗“外挂”了大规模记忆指南,大幅提升了参数扩展效率。
调优协同增效
实现模型结构与后期优化的协同进行,显著提升了收敛效率和训练吞吐量。
成本大幅降低,全面开放 API 服务
得益于 Qwen3.8 系列的技术创新,训练与推理成本大幅下降。目前,模型 API 服务已首发上线千问 AI 平台,开发者可通过 API 或 Token Plan 以普惠价格获取前沿性能。
国内定价:输入每百万 Tokens 低至 0.8 元,输出 2.7 元;缓存命中价格低至 0.1 元。
国际站定价:输入每百万 Tokens 0.15 美元,输出 0.47 美元;缓存命中价格 0.016 美元。
针对 Agent 工作流中长输入(Input)频繁、缓存命中率对成本影响显著的特点,Qwen3.8-Flash 极具优势的缓存命中定价,使其特别适合大量、频繁的日常智能体任务,帮助开发者以极致性价比部署应用。
此外,千问办公“标准模式”已内置 Qwen3.8-Flash,可胜任 95% 的日常办公任务。
开源生态与未来展望
此次采用的 Next 新架构被视为全新一代千问大模型 Qwen4 的雏形。Qwen3.8-Flash-Next 模型权重已在 Hugging Face 及魔搭社区全面开源,接受全球 AI 开源社区检验,旨在共同打磨未来的 Qwen4 模型。
截至目前,Qwen3.8 系列已开源发布 Qwen3.8-Max(2.4T 参数量)、Qwen3.8-27B 及 Qwen3.8-Flash 三大尺寸模型,并均已上线千问 AI 平台提供 API 服务。

