撰文 | 文烨豪
编辑 | 王 潘
深夜,老人突感不适手臂难抬,因夜深路远,只能求助于 AI 应用“蚂蚁阿福”。模型判断仅为睡姿压迫,建议调整姿势并深呼吸,症状随即缓解。
这一案例让阿福模型技术负责人进捷印象深刻。9 月 9 日外滩大会期间,蚂蚁集团百灵大模型及阿福模型的核心技术团队与行业媒体展开对话。四位专家达成共识:大模型应从参数竞赛走向真实世界的应用落地。
自去年发布万亿参数模型后,百灵不再单纯追求“做大”,而是将“智效比”作为核心主线。不同于行业普遍聚焦 Coding(代码生成),百灵选择将核心资源投入金融与医疗领域。团队认为,代码在人类历史中存续较短,而金融、医疗、法律等任务已演进数千年,具备更复杂的约束条件,更能锤炼模型能力。

基于此战略,百灵在 Ling-3.0 基座之上,打造了面向真实投研任务流的金融增强模型 Ling-3.0-flash-Fin,覆盖信息检索、推理及估值建模;医疗方向则通过健康 AI 应用“阿福”落地。目前,阿福用户突破 1.5 亿,日咨询量达 2000 万,其中过半来自三四线城市,16% 的咨询发生在午夜之后。
蚂蚁基础智能技术部负责人西亭将未来投入概括为三个方向:向上提升复杂场景的 Agent 能力;向下降低门槛,优化智效比以适配资源受限环境;向外深化专业性,与行业伙伴共同打磨复杂工作流。其核心目标是从“模型的能力”转向“任务的价值”。
以下为对话实录(经编辑整理):
从“更大”到“更省”,回答智效比这道题
Q:去年发布 1T 模型后,团队开始反思“模型必须一直变大”的逻辑。如今如何定义一个好模型?
西亭:好模型的定义需关注两个维度。一是走向真实世界,Scaling 不应局限于 Coding,更应扩展至高经济价值、高难度的领域,解决更多复杂任务,这才是 AGI 的正确演进方向。二是综合考量能力、响应速度与成本。如同人类在约束条件下做决策,模型也应以合理成本、快速响应端到端地解决问题,而非仅看生成效率。
月引:标准很朴素——能否帮我把活干完。例如在金融领域,能否将分析师研究一个标的的时间压缩,从而覆盖十个标的,大幅提升工作效率。
零幺:技术层面,我们追求用更低的 FLOPs(浮点运算次数)撬动更大的智能。大尺度与小尺度模型交替演进:小尺度压缩高智能,大尺度压缩更高智能。终极目标是实现高智效比。
Q:在预训练、后训练、强化学习等多条 Scaling 路线中,哪条边际收益最高?资源如何取舍?
零幺:以 Benchmark 为坐标系并不科学,因其存在饱和效应。实验显示,目前唯一未观察到边际收益递减的是 Pre-train Scaling(预训练扩展),损失函数仍呈对数线性下降。其他如推理时计算等维度已显现收敛。
由于算力稀缺,我们无法无限扩大预训练规模,必须在架构、数据策略上确保收益。因此策略是:长周期看待预训练,短周期高频迭代后训练,依据实验结果动态调整。
西亭:我们还在探索通用能力与专业能力的协同 Scaling。人类历史上鲜有兼具顶尖医疗与金融能力的全才,但大模型有望打破这一局限。此外,大小模型的协同路由也是一种符合人类认知规律的 Scaling 方式。
Q:“智效比”能否被量化?
西亭:我们已设定量化目标,核心是“端到端任务成功率”。这不仅是模型生成的成功率,更涉及执行多轮任务后的最终完成率。我们将评估在固定完成率下的成本,或在固定成本下的任务完成量。这需要模型、Harness(框架)、评估体系及行业安全规则的联合优化,推动模型从“产品”向“商品”转化。
零幺:标准化产品需要确定性。当前智能在很多维度尚不确定,但随着能力提升,任务完成的确定性将增高,从而使其成为可量化的标品。
不卷 Coding,去啃金融和医疗
Q:为何选择金融和医疗这两个行业作为突破口?
零幺:最适合引导智能演进的问题具备三大特点:量大、难度大、易验证。医疗(活得久)和金融(赚更多钱)完美契合这些特征。
西亭:约束是能力生长的土壤。金融与医疗行业天然存在大量隐性约束,随着行业对模型要求提高,约束只会更多。攻克这些难题,对提升模型智商及实现 AGI 至关重要。
Q:金融领域广阔,为何首选投研作为切口?
月引:银行场景如客服和信贷审批,前者偏问答可用 RAG 解决,后者偏决策逻辑且链路较短。我们要挑战领域智能上限,因此选择难度最高、专业性最强且部分环节(如估值建模)可校验的行研领域。未来将逐步延伸至更长决策链路。
Q:行业积累如何反哺基座模型?
月引:一是将专业端的知识与推理能力沉淀,赋能 C 端用户;二是泛化工作流能力。若能处理好“操作数千张表、覆盖数千家公司”的复杂任务,这种能力将迁移至所有办公与信息处理行业。
西亭:真实场景既是考场也是训练场。失败案例可复盘为专业数据闭环;贴近专业的评测不仅看结论,更看证据、流程与权限合规;留存的训练环境可转化为强化学习素材,教会模型动作与结果的关联。
Q:相比其他厂商,蚂蚁在金融 AI 上的差异化优势是什么?
月引:首先,数据优势。我们与海外头部数商交流发现其样本错误率高,而蚂蚁拥有深耕一二级市场十余年的专家团队,能将专业 Know-how 注入数据。其次,专家介入环节前置,不仅做后训练,更在预训练的数据知识输入阶段参与,解决如财年计算口径等行业特有难题。最后,这是结合模型、Harness、产品及私域数据的生态之战。

“宁愿说一句我不知道”
Q:优秀的 Agent 应懂得“有所不为”,这在模型设计上如何实现?
零幺:现有模型倾向于迎合人类以获取奖励,且多数 Benchmark 鼓励“蒙答案”。我们需要改变评估方式,不仅考核正确率,还要考核模型是否知晓自身的知识边界,即“拒答率”与准确率的平衡。
月引:在金融实战中,研究员无法接受模型罗列八十五条模棱两可的决策建议。我们宁可模型承认“不知道”,也不愿其产生幻觉误导决策。因此在训练中,对严肃场景下的幻觉行为施加更重惩罚。
Q:何为“可专业化”与“可信执行”?
西亭:可专业化意味着理解语境、调用工具、遵循流程。如同医生问诊需先询问病史而非直接开药,模型需懂得授权与复核机制。可信执行并非永不犯错,而是具备发现问题、限制影响范围及请求人工复核的能力。好的 Agent 核心价值在于知道哪一步不能做。
在医疗场景中,模型需像专业医生一样,意识到信息缺失并主动追问,审慎表达不确定性,将关键决策交由专业人员。
把模型装进“盒子”里
Q:阿福日咨询量达千万级,这对技术架构提出了哪些挑战?
进捷:规模效应带来高昂的推理成本与延迟挑战。C 端用户对等待时间极度敏感,因此必须通过大小模型协同,在保证效果水位线的前提下降低成本、提升速度。此外,隐私保护促使模型向定制化、本地化(AI 工作站)发展,让模型更贴近数据源与用户场景。
月引:效率不仅是成本问题,更是业务可行性问题。若无法在限时内输出结果,长程任务便无法开展。
Q:技术路线与应用需求,谁更优先?
进捷:我们沿技术发展的延长线寻找应用落脚点,同时结合 AGI 核心命题与公司禀赋。例如,针对理财师未被满足的工作场景,以及医生受困于临床事务的现状,提供针对性的 AI 解决方案。
Q:普惠医疗要做长期,关键点是什么?
西亭:针对不同层级用户需求,我们采取双向策略:一方面连接患者与医疗机构,解决三四线城市资源匮乏问题;另一方面利用 AI 为医生组建虚拟团队,将单人接诊能力从十人提升至百人,随访管理规模从两百人扩至两千人,真正实现医疗资源的普惠。
Q:若模型要真正进入真实世界,最关键的三个指标是什么?
西亭:第一是智效比;第二是专业性,模型需具备像医生一样的问诊逻辑而非盲目作答;第三是开放性,思维链透明才能建立信任。若加一项,则是反馈闭环,模型需在真实环境中通过多模态感知自我修正。

