大数跨境

4B 打 9B?讯飞星火 X2.5-4B 开源解读:百万级上下文,Agent 逆袭

4B 打 9B?讯飞星火 X2.5-4B 开源解读:百万级上下文,Agent 逆袭 路过银河AI
2026-09-11
4
导读:4B 打 9B?讯飞星火 X2.5-4B 开源解读:百万级上下文,Agent 逆袭模型:Spark-X2

模型:Spark-X2.5-4B(XHToken / 词元星火)
许可证:Apache-2.0(可商用)| 参数:4.11B(同族另有 1.7B 端侧款与 293B-A30B MoE 云端款)
资料:Hugging Face 官方模型卡
说明:成绩均为官方公布的 thinking 模式自测;标注 * 的为竞品公开模型卡/论文数据

一、4B 模型两周登顶 Hugging Face

9 月 1 日,科大讯飞全资子公司词元星火(XHToken)正式开源星火 X2.5-4B 与 X2.5-1.7B 两款端侧通用大模型。上架仅两周,官方 4B 仓库下载量超 1.1 万、点赞近千,一度登顶 Hugging Face 趋势榜。

该模型的核心卖点在于成为业界首个支持百万级上下文的端侧模型。其能力不仅限于基础对话,更能一次性读取几十页产品手册并提炼重点,或根据表格指令直接完成任务,标志着端侧智能从“能对话”向“能干活”的实质性跨越。

二、四大核心技术亮点

1. 混合注意力架构:原生支持 1M 上下文

模型采用"1 层全注意力 + 3 层滑动窗口注意力(SWA)”交替的混合架构,大幅降低长上下文算力与 KV 缓存开销。原生支持最高 100 万 Token 上下文(config 中 max_position_embeddings 达 1,048,576),并结合千亿 Token 级长文数据专项训练,实现长文档、完整代码仓库及多轮任务的“一次读完”。

2. 全球语言覆盖

预训练语料涵盖网页、书籍、学术文献、代码与百科等,支持 200 余种语言,全面覆盖中英日常交流与专业翻译场景。

3. Agent 原生深度集成

官方宣布与 Codex、Claude Code、OpenClaw、Hermes 等主流 Agent harness 深度集成。此外,DeepSeek Harness、OpenCode、Pi 等开源 Harness 也可直接接入本地开发与自动化流程。

4. 全国产算力全流程打通

模型在华为昇腾集群上完成预训练与大规模强化学习,采用 MOPD 多策略融合后训练。部署侧兼容英伟达、昇腾、海光、后摩等硬件,支持 vLLM、SGLang、llama.cpp、MLX 等框架,Ollama 与 LM Studio 可一键启动,LLaMA-Factory 支持增量微调,是典型的“去 CUDA 依赖”路线代表。

三、性能评测:小尺寸展现越级能力

官方数据显示,Spark-X2.5-4B 在多项硬核基准测试中表现优异,部分指标超越更大参数的竞品模型(如 Qwen3.5-9B、Gemma4-12B 等)。

类别 基准 4B 成绩 参考对比
Agent BFCL-V4(工具调用) 65.1 Qwen3.5-9B 66.1*
Agent BrowseComp(长文检索) 40.9 Qwen3.5-9B 仅 8.3*
Agent MCP-Atlas 54.6 Qwen3.5-9B 47.4*
Agent Workspace Bench 31.2 Qwen3.5-9B 25.5
Agent τ²-bench 75.1 Qwen3.5-9B 79.1*
代码 SWE-Bench Pro 44.4 Qwen3.5-9B 33.8 / Gemma4-12B 21.9
代码 SWE-Bench Verified 41.6 Qwen3.5-9B 53.1*
代码 Multilingual 53.3 Qwen3.5-9B 43.3
数学 高考 2026(满分 150) 133.4 Qwen3.5-9B 135.5
数学 AIME 2026 90.7 Qwen3.5-9B 88.2
数学 IMO-AnswerBench 74.2 Qwen3.5-9B 69.8
通用 IFEval 93.0 Qwen3.5-9B 91.5*
通用 GPQA 67.4 Qwen3.5-9B 77.2*

核心看点:在 BrowseComp 长文检索任务中,40.9 分对 Qwen3.5-9B 的 8.3 分形成跨级优势;在 SWE-Bench Pro、MCP-Atlas 等硬核 Agent 基准上全面领先 9B 竞品。尽管在 SWE-Bench Verified、GPQA 等个别通用项上受限于参数量未全面超越大模型,但整体表现符合甚至超出物理预期。

端侧实测佐证:在 Domux 智能家居场景中,X2.5-1.7B 的控制指令端到端执行正确率达 90.3%,平均响应时间仅 0.85 秒。

注:以上为官方自测(thinking 模式),*号数据来自竞品公开渠道,实际效果建议下载 GGUF 版本本地测试验证。

四、部署方案与资源选择

官方仓库提供多种精度版本(均遵循 Apache-2.0 协议),适配不同硬件环境:

版本 体积 适用场景
BF16 权重(5 分片) ≈8.2GB 16GB+ 显存 / 大内存 CPU 完整精度
BF16 GGUF ≈8.2GB llama.cpp 系完整精度
Q8_0 GGUF ≈4.4GB 8GB 显存环境
Q4_K_M GGUF ≈2.6GB 4GB 级显存 / 纯 CPU 尝鲜
FP8 / INT8 官方仓库提供 国产显卡 / 高吞吐场景

部署示例:用户可克隆 XHToken 的 llama.cpp fork 编译后导入 GGUF 创建本地模型,或通过 vLLM 单卡 Docker 快速启动服务

# vLLM(NVIDIA 单卡示例;1M 上下文请按显存调小 --max-model-len)
docker run --gpus all -v $PWD:/models vllm/vllm-openai:latest \
  --model /models/Spark-X2.5-4B --trust-remote-code --max-model-len 32768

推荐采样参数:temperature=1.0 / top_p=0.95 / top_k=-1;默认开启 thinking 模式(可关闭)。此外,讯飞星辰 MaaS 平台提供限时免费 API 调用;同日上线的云端大模型星火 X2.5(293B-A30B MoE,256K 上下文)定价为输入 1.6 元/百万 Token、输出 6 元/百万 Token。

五、权威资源链接

• 官方 Hugging Face 仓库 / 合集(含 4B、1.7B、GGUF、FP8/INT8 及模型卡全文)
   https://huggingface.co/XHToken/Spark-X2.5-4B
   https://huggingface.co/XHToken/Spark-X2.5-4B-GGUF
   https://huggingface.co/collections/XHToken/spark-x25
• llama.cpp 兼容实现(官方 fork):https://github.com/XHToken/llama.cpp

注:若国内访问 Hugging Face 不便,可将链接中的 huggingface.co 替换为 hf-mirror.com。

六、综合点评

核心价值:作为 4B 尺寸的"Agent 卷王”,其在 SWE-Bench Pro、BrowseComp 等硬核基准上展现出越级打击 9B 模型的能力;首创端侧原生百万上下文,完美解决长文档与整仓代码处理痛点;基于 Apache-2.0 协议可商用,且实现从昇腾训练到多硬件部署的全链国产化,保障本地数据安全;提供从 2.6GB 到 8.2GB 的多种量化版本,通过 Ollama/LM Studio 即可低门槛运行。

理性建议:基准数据源于厂商自测的 thinking 模式,部分通用项(如 SWE-Bench Verified、GPQA)并未全面领先大参数模型。若计划将其作为本地 Agent 主力,建议先下载 Q4_K_M 版本针对真实业务场景进行测试验证。

结论:对于寻找“本地可运行 Agent 小模型”的用户而言,星火 X2.5-4B 是 2026 年 9 月最值得优先尝试的解决方案。

【声明】内容源于网络
0
0
路过银河AI
1234
内容 1069
粉丝 1
路过银河AI 1234
总阅读33.9k
粉丝1
内容1.1k