大数跨境

刚刚,蚂蚁站在Kimi肩膀上开源了一款新模型

刚刚,蚂蚁站在Kimi肩膀上开源了一款新模型 智东西
2026-08-11
2
导读:1.3B激活参数硬刚31B!蚂蚁开源本地Agent新模型,MacBook可跑。

1.3B 激活参数硬刚 31B!蚂蚁开源本地 Agent 新模型,MacBook 可跑。
作者 | 李水青
编辑 | 心缘
智东西 8 月 11 日报道,今日,蚂蚁百灵大模型开源了一款轻量级混合推理 MoE 模型——Ling-3.0-tiny。
该模型总参数量为 7.9B,推理时激活参数量仅 1.3B,专为高效本地部署设计。同步提供 BF16、FP8 和 INT4 三个版本,已在 DGX Spark、MacBook、Mac mini 等设备完成验证,兼顾性能、效率与可部署性。
在 Artificial Analysis Intelligence Index 评价体系中,Ling-3.0-tiny 获得 25 分,仅比 Gemma-4-26B-A4B 低 1 分,同时高于 gpt-oss-120B(high)、Qwen3.5-9B、Gemma-4-12B 和 Gemma-4-E4B。
该模型关键要点总结如下:
1、高效的混合线性架构:采用月之暗面自研 KDA(Kimi 增量注意力)与 DeepSeek 自研 MLA(多头潜在注意力)按 3:1 交替堆叠,配备由 128 个路由专家组成的稀疏 MoE 前馈网络。每个 Token 仅激活 8 个路由专家和 1 个共享专家,在长上下文建模、参数效率与计算成本间实现平衡。
2、原生混合推理与智能体能力:兼顾快速响应与多步推理,可通过 enable_thinking 参数灵活开关思考模式。在通用智能体任务、代码生成、数理科学推理及指令遵循场景下表现均衡。
3、本地与边缘部署:FP8 精度下,DGX Spark 推理吞吐量达 100–105 tokens/s,M4 Pro MacBook 达 86–90 tokens/s;8K 上下文长度时,峰值内存占用仅 8.34GiB。
实测显示,百灵在 36GB 内存 MacBook Pro 上复刻 Infinite Wiki(无限百科)核心体验,支持点击词语生成上下文解释卡片及多层知识下钻。全程本地推理,首 Token 响应低于 100 毫秒,数据留存设备端,无云端 API 计费,接近原生速度的本地知识引擎。
Hugging Face 地址:
https://huggingface.co/inclusionAI/Ling-3.0-tiny
https://huggingface.co/inclusionAI/Ling-3.0-tiny-fp8
https://huggingface.co/inclusionAI/Ling-3.0-tiny-int4
ModelScope 地址:
https://modelscope.cn/models/inclusionAI/Ling-3.0-tiny
https://modelscope.cn/models/inclusionAI/Ling-3.0-tiny-fp8
https://modelscope.cn/models/inclusionAI/Ling-3.0-tiny-int4

1.3B 激活参数“以小博大”,评分紧咬 26B 大模型

在 Artificial Analysis Intelligence Index 评价体系中,Ling-3.0-tiny 获得 25 分。该指数从真实任务、工具使用、代码、科学推理、知识可靠性和长上下文等九个维度综合衡量模型跨任务能力。
对比结果显示,Ling-3.0-tiny 综合得分仅比 Gemma-4-26B-A4B 低 1 分,接近激活参数约 4B 的更大 MoE 模型,且优于 gpt-oss-120B(high)、Qwen3.5-9B 等主流模型。
Ling-3.0-tiny 总参数 7.9B,但每 Token 仅激活 1.3B 参数。这意味着它以较低的实际计算规模,进入了主流 4B 至 12B 级模型的综合能力区间。
尽管单项分数无法覆盖全部能力,Tiny 模型也无法完全取代大型模型,但从评测看,Ling-3.0-tiny 已具备进入代码辅助、知识工作流、工具调用和本地 Agent 应用的基础,其定位超越了单纯追求“设备装得下”的小尺寸模型。

Agent 评分超 31B 大模型,输出速度超 160 tokens/s

Ling-3.0-tiny 在真实任务与 Agent 执行方面表现突出。其 Artificial Analysis Agentic Index 得分为 16,高于 Gemma-4-31B;其中 GDPval-AA v2 取得 772 Elo,τ³-Banking 得分为 20.80,体现了模型在任务理解、工具调用和流程推进方面的优势。
在对比模型中,Ling-3.0-tiny 在 IMO-AnswerBench 和非幻觉率指标上领先,在数学、科学推理、代码 Agent、指令遵循和长上下文等任务上表现均衡。
综合智能指数达 25 分的同时,Ling-3.0-tiny 输出速度超过 160 tokens/s,输出 500 个 Token 的端到端用时约 18 秒(含思考过程)。较小的激活规模转化为更短的任务等待时间,提升了 Agent 连续执行任务的响应效率。

站在 DeepSeek、Kimi 肩膀上创新架构,降低本地部署门槛

Ling-3.0-tiny 延续 Ling-3.0 系列的原生混合线性注意力技术路线,针对轻量化和低门槛部署进一步优化。总参数量控制在 7.9B,每 Token 激活参数量 1.3B。
模型采用 3:1 KDA-MLA 架构(每 4 层含 3 层 KDA 和 1 层 MLA),提高长上下文处理效率。MoE 部分设置 128 个稀疏专家,每 Token 激活 8 个路由专家和 1 个共享专家,以小激活量承载完整模型能力。
此外,模型采用原生混合推理机制,由同一模型完成常规任务快速响应和复杂任务多步思考;Multi-Token Prediction 训练目标则为高效 Token 预测及后续推理加速奠定基础。这些设计旨在减少计算资源需求,降低本地部署和二次开发门槛,使轻量模型具备接入真实 Agent 工作流的能力。

从 DGX Spark 到 MacBook,三个精度版本覆盖不同设备

Ling-3.0-tiny 同步开源 BF16、FP8 和 INT4 三个版本,开发者可根据硬件条件、性能要求和成本选择部署方案。BF16 适用于高精度研究评测和生产应用;FP8 在效果、速度和资源间寻求平衡;INT4 进一步压低资源需求,面向算力有限的本地环境。
三个版本覆盖了从专业级本地 AI 工作站到个人电脑的不同设备,可接入本地知识库、代码助手、UI 自动化等工作流,确保模型和业务数据保留在本地。

DGX Spark:单机可支撑小规模本地服务

Ling-3.0-tiny 可在单台 NVIDIA DGX Spark 上运行 FP8 推理,权重文件约 7.85GB。2K 输入测试中,单请求稳态解码速度约 100-105 tokens/s,两路并发聚合吞吐约 161 tokens/s。
中小团队无需搭建大规模集群,仅用一台 DGX Spark 即可搭建独立运行的本地模型服务,应用于企业内部知识助手、研发代码助手等场景。百灵还演示了利用该模型驱动移动设备,完成任务理解、工具调用及自动化操作验证,展现了其在运行成本、数据可控性和执行可靠性方面的潜力。

MacBook:首 Token 响应低于 100 毫秒

模型已完成面向 MacBook(Apple Silicon)的适配,BF16 和 FP8 版本均可运行,适用于代码辅助、文档处理、本地问答和工作流自动化。由于数据留存在本地,用户在处理隐私敏感信息时拥有更可控的数据边界。
FP8 版本进一步降低资源需求,持续生成速度提升约 30%,改善多轮交互体验。在 36GB 内存 MacBook Pro 上复刻 Infinite Wiki 的测试表明,Ling-3.0-tiny 能以接近原生应用的响应速度充当本地知识引擎。

Mac mini:变身常驻式本地智能节点

部署方案同样延伸至 Mac mini。相比侧重移动办公的 MacBook,Mac mini 更适合作为低功耗、常驻式的本地智能节点,持续提供知识库检索、文档分析和本地模型 API 服务。
在演示 Demo 中,部署于 Mac mini 的模型用于划词翻译、语法纠错和文本改写,无需上传云端即可离线运行并提供低延迟响应,适用于个人及企业的本地阅读与写作场景。
至此,Ling-3.0-tiny 已完成从 DGX Spark、MacBook 到 Mac mini 的适配验证。不同精度版本与设备形态共同扩大了部署范围,让中小团队能根据算力、数据边界和业务需求选择合适的本地运行方式。

结语:下一步将补强事实准确性和长程 Agent 稳定性

百灵表示,接下来将继续增强 Ling-3.0-tiny 的长尾知识覆盖和事实准确性,提高复杂工具调用及长程 Agent 任务的稳定性,并优化代码、科学推理和长上下文能力。
团队计划改善模型推理能力、响应时间和任务成本之间的平衡,完善 FP8 和 INT4 版本的硬件适配、推理框架支持与部署文档,并与硬件厂商、高校及开发者社区共同建设轻量模型生态。

9 月 20-21 日,智东西主办的 2026 全球 AI 芯片峰会将在上海举行,设有开幕式,大模型 AI 芯片、Agent 推理芯片、具身智能芯片 3 场高峰论坛,以及 Token 工厂异构混训混推、超节点、AI 芯片架构创新、新型存储器、大模型 KV Cache 5 场技术研讨会。

【声明】内容源于网络
0
0
智东西
各类跨境出海行业相关资讯
内容 11763
粉丝 0
智东西 各类跨境出海行业相关资讯
总阅读200.0k
粉丝0
内容11.8k