黄仁勋力挺开源同一天,蚂蚁百灵扔出124B“执行模型”
智东西

近期,硅谷 AI 圈围绕“开源监管”与“发展速度”的争论愈演愈烈。从黄仁勋呼吁审慎监管,到 OpenAI 与 Anthropic 员工联署要求“控速”,再到扎克伯格反击称此举扼杀创新,路线之争已达顶点。
与之形成鲜明对比的是,中国 AI 界始终将“开源”与“前进”视为并行不悖的战略。从 DeepSeek、智谱到阿里通义、蚂蚁百灵,国产大模型的开源步伐从未停歇。
7 月 24 日,蚂蚁百灵正式发布新一代原生混合推理模型 Ling-3.0-flash,并在 OpenRouter 与官方平台同步开启限时免费 API 调用(截至 8 月 3 日),随后将正式开源模型权重。发布仅 5 天,该模型在 Token 调用量排行榜中从第 9 位跃升至第 6 位,调用量紧追 DeepSeek V4 Pro。
Ling-3.0-flash 总参数量为 124B,激活参数量仅为 5.1B。相较于 5 月开源的万亿级旗舰 Ring-2.6-1T,其总参数量约为后者的 12.4%,激活参数量仅为 8.1%,却在 12 项基准测试中有 11 项表现更优。面对硅谷关于“开源能否兼顾安全与强大”的质疑,蚂蚁百灵用产品给出了肯定答案。
01. 以小搏大:12 项测试 11 项超越万亿旗舰
在基准测试中,Ling-3.0-flash 在 34 个评测维度中斩获 15 个第一、19 个第二,综合均分与 DeepSeek-V4-Flash 并列第一,领先万亿级旗舰 Ring-2.6-1T 近 8 分。蚂蚁百灵新提出的“智能密度”与“智效比”两项指标中,该模型双双登顶,实现了以最少参数撬动最高性能。
代码能力全面领跑
在 SWE-Bench Pro 测试中,Ling-3.0-flash 以 56.6% 的得分位居第一;在 ArtifactsBench 一次性生成交互式组件测试中,其 77.0% 的得分断层领先第二名 10 余分。而在高难度的 MiniAppBench 测试中,该模型 25.3% 的通过率与参数量约两倍的开源 SOTA 模型持平。
通用 Agent 与搜索能力卓越
在行业通用的函数调用评测 BFCL-v4 中,该模型以 73.0% 的准确率与 Claude-Sonnet-4.6 并列第一;在端到端综合 Agent 评测 GDPVal v2-AA 中拔得头筹。搜索能力方面,其在 WideSearch 测试中排名第三,在多智能体协作的 BrowseComp 测试中与 Claude-Sonnet-4.6 基本持平,展现了强大的复杂网页交互与信息获取能力。
指令遵循与长上下文优势明显
在检验多重约束指令遵循的 IFBench 中,该模型排名第三;在测试长期指令记忆的 LIFEBench 中位列第一。此外,原生支持 256K 上下文窗口的 Ling-3.0-flash,在 MRCR_256K 与 Multi-IF 测试中均表现优异,验证了其在长程交互中的稳定性。
02. 能力实测:快、稳、省的场景化落地
Ling-3.0-flash 的定位并非取代超大参数通用推理模型,而是成为高效执行任务的 AI 助手。其核心优势在于极短的首字响应时间,以及在多轮对话中维持复杂空间逻辑的能力。
游戏开发与视觉互动
在“结对编程”模式下,该模型能保持工程架构一致性,避免上下文丢失或逻辑跑偏。实测显示,通过三轮对话即可生成符合物理规律的 3D 台球模拟器,且能快速定位并迭代优化 BUG,反应迅速无需长时间思考。
科研协同与办公自动化
在多智能体科研场景中,Ling-3.0-flash 可协调 Scientist、Data Analyst 等多个角色完成从假说提出到论文产出的全流程。在办公自动化方面,通过挂载 Office MCP 工具集,模型能将自然语言指令转化为序列化 API 调用,直接驱动软件底层协议完成 Excel 数据处理与 Word 排版,展现了稳定的工具调用能力。
纯代码生成艺术网页
无需外部素材,该模型仅凭代码即可批量生成涵盖包豪斯、波西米亚等多种设计流派的艺术网页,精准还原各类美学特征,体现了强大的 CSS 渐变、SVG 路径构建与版式布局能力。
03. 架构创新:混合线性注意力与稀疏 MoE
“小身材大能量”源于架构层面的系统性重构。Ling-3.0-flash 从预训练阶段即采用原生混合线性注意力架构,以 5:1 比例交替堆叠 KDA 线性注意力层与 MLA 层。
混合注意力机制
KDA 层引入细粒度对角门控,提升了长文档与大型代码库的关键信息记忆能力;MLA 层则通过低秩压缩大幅降低显存占用。两者协同,实现了长上下文效率与计算成本的平衡。
极致稀疏 MoE 与分级缓存
基于"Ling Scaling Law",该模型将专家激活比例从前代的 1/32 压缩至 1/64,每次推理仅激活 5.1B 参数,通过精细路由策略将算力精准投放。同时,接入 SGLang HiCache 与 Mooncake 分级缓存体系,借鉴 CPU 三级缓存理念复用 KV Cache,使长输入场景下的首字响应时间降低 60% 至 80%。
多智能体协同架构
升级后的 Ling Multi-Agent 架构,通过多角色分工协作与相互校验,有效减少了长程任务中的误判风险,将单点执行器升级为支撑高频线上服务的“集团军”作战平台。
04. 结语:开源与实用并重,推动技术普惠
从 5 月开源万亿级模型到 7 月推出 Ling-3.0-flash 并计划 8 月开源,蚂蚁百灵的开源节奏持续提速。Ling-3.0-flash 的价值不仅在于性能突破,更在于将轻量化、高性价比的技术路线推向新阶段。在高并发、低延迟的商用场景下,其依托约 1/12 的激活算力即可逼近旗舰模型表现,显著降低了企业推理开销。
当开源模型能够兼顾实用性、效果与成本优势时,AI 技术的普惠才具备了落地的现实基础。