题目:HLMamba: Hybrid Lightweight Mamba-Based Fusion Network for Dense Prediction of Remote Sensing Images
论文地址:
代码地址:https://ieeexplore.ieee.org/document/10766200
创新点
•构建序贯贝叶斯推理评测基准,以理想贝叶斯智能体作为真值参照,定量证明原生大语言模型不具备规范的贝叶斯信念更新能力,面对多轮新增证据时无法持续修正概率分布,系统性量化了 LLM 概率推理的固有缺陷。
•区别于传统仅使用最终正确答案微调模型的方式,该框架基于标准贝叶斯推理引擎生成完整多轮交互推理轨迹,把包含中间概率分布、不确定性推导全过程的完整思维链作为微调数据,让模型学习完整的序贯信念迭代逻辑,而非只记忆任务结果,从底层对齐 LLM 与贝叶斯概率更新规则。
方法
本文首先搭建以理想贝叶斯智能体为真值的多轮不确定决策评测基准,选用航班推荐、酒店预订、线上购物等多类场景量化评测原生大语言模型的序贯概率推理缺陷,随后提出Bayesian Teaching微调范式,借助标准贝叶斯推理引擎生成包含每轮证据输入、中间概率信念迭代、不确定性推导全过程的完整交互轨迹作为微调数据集,采用思维链蒸馏方式让主流开源大模型学习规范贝叶斯信念更新逻辑,同时设置原生模型、仅使用最终标准答案微调等多组基线对照,在多款LLM上开展主实验、模块消融实验与跨领域泛化实验,从贝叶斯策略匹配度、多轮交互预测精度等指标综合验证方法有效性。
贝叶斯教学实现大语言模型概率推理的应用流程示意图
本图以多轮交互案例直观展示贝叶斯教学赋能大语言模型概率推理的工作流程,先呈现用户初次发起航班优选请求、模型初始给出航班1的推荐结果,在用户反馈偏好航班2修正证据后,贝叶斯教学模块依据新增信息完成信念迭代更新,后续在新一轮航班选择任务中输出贴合贝叶斯推理规则的航班3推荐并得到用户认可,同时体现该方法习得的推理能力可泛化迁移至酒店推荐、网购推荐这类全新不确定决策场景,完整呈现了贝叶斯教学从吸收反馈、修正概率分布到跨场景通用推理的全过程。
各类大模型、人类与理想贝叶斯智能体在多轮序贯概率推理任务中的准确率对比柱状图
本图横轴依次排列Gemma 2、Llama 3、Qwen 2.5、GPT-4.1、Gemini 1.5多款主流开源与闭源大模型、人类受试者以及理论最优贝叶斯智能体,纵轴代表推理准确率百分比,图例区分首轮交互后精度、最终多轮交互后精度与随机猜测基准线,可见所有原生大模型首轮推理准确率仅小幅高于随机基线,多轮迭代后的精度提升幅度有限且远低于人类水平,而理想贝叶斯智能体首轮精度58%、最终轮精度81%,大幅领先所有对比模型,直观证明原生大语言模型难以完成规范的序贯贝叶斯信念更新,存在显著概率推理短板。
不同微调方案下主流开源模型序贯概率推理准确率对比柱状图
本图横轴分组展示Gemma、Llama、Qwen三类模型分别采用原生未微调、标准答案Oracle微调、本文Bayesian Teaching贝叶斯教学微调三种方案的实验结果,纵轴代表推理准确率,图例区分首轮交互精度、多轮最终交互精度与随机猜测基准线,数据显示原生模型多轮迭代后精度提升微弱,Oracle微调仅小幅提升推理性能,而经过贝叶斯教学微调后的模型首轮与最终轮准确率均大幅上涨,大幅缩小与理论最优贝叶斯智能体之间的精度差距,直观验证贝叶斯教学相比传统标准答案微调更能有效提升大模型持续更新信念的贝叶斯推理能力。
Gemma、Llama、Qwen三类模型在多轮交互下与理想贝叶斯智能体的匹配度变化折线图
本图分为三张子图分别对应三类大模型,横轴为交互轮次,纵轴是模型输出与贝叶斯智能体策略的匹配百分比,三条曲线分别代表原生大模型、标准答案微调Oracle模型、本文贝叶斯教学微调模型,原生模型匹配度全程维持在较低水平且几乎无提升,Oracle微调模型匹配度小幅上涨后趋于平缓,经过贝叶斯教学的模型在首轮交互后匹配度便大幅跃升并长期稳定在高位,清晰体现贝叶斯教学能让模型持续贴合标准贝叶斯信念更新逻辑,相比传统微调方案具备显著优势。

