序言
随着大推理模型(Large Reasoning Model)如 DeepSeek-R1、QwQ 的涌现,长链推理成为可能,模型开始像人一样"一步步想清楚再回答"。然而,一个被广泛忽视的问题正在悄悄侵蚀推理效率:过思考(Overthinking)。
对模型推理轨迹的分析发现,一多半的 token 消耗在反复验证同一个中间结论上。这种重复并没有带来推理深度,只是在空耗计算资源——模型不是在"想得更深",而是在"想得更久"。
这引出一个核心问题:
模型能否学会自主消除推理中的冗余重复,同时不丧失推理能力?
本期 EvoAgentX Talk,我们邀请到东南大学网络空间安全博士生戴鑫邦,带来主题分享:
Evolving Thinking in Large Reasoning Models via Self-Pruning and Aha-Moment Preference Optimization
EvoThink:自剪枝与顿悟偏好优化,让大推理模型走向思维自进化
本次分享将围绕大推理模型的推理效率与思维自进化展开,介绍 EvoThink 训练框架,探讨模型如何自主剪除冗余推理、从失败中学会纠错,以及"模型自改进"这一流程的更多可能。
讲座核心内容
大推理模型正在成为解决复杂问题的主力,但当前的优化范式面临一个尴尬的权衡:想让模型说得少,往往意味着答得差——"压缩即掉点"几乎成了共识。
本次分享将介绍团队提出的 EvoThink——一个面向大推理模型思维自进化的训练框架,它从两个方向同时发力:
自剪枝训练(Self-Pruning):在无监督条件下,迭代移除推理轨迹中的冗余推理单元。不需要人工标注哪些是废话——模型在训练中自己学会识别并删除那些"翻来覆去验证同一结论"的部分。
顿悟偏好优化(Aha-Moment Preference Optimization):失败的推理轨迹并不是垃圾。EvoThink 从失败轨迹中挖掘"从错到对"的转折点——那些模型突然意识到错误并成功纠正的"顿悟时刻",并通过偏好优化强化这种自纠错能力。
实验表明,该方法在全部测试场景中均同时实现了准确率提升与 token 数减少,打破了"压缩即掉点"的权衡观点。
在此基础上,本次分享还将围绕模型自改进(Self-Improvement)的流程展开延伸讨论:优化推理不应该只是让模型"少说废话",更应该让模型学会"在试错中顿悟、在进化中精炼",从而走向真正的思维自进化。
嘉宾简介
戴鑫邦(Xinbang Dai),东南大学网络空间安全博士生,导师为漆桂林教授。他的研究致力于大语言模型安全,重点方向包括可信的检索增强生成、语言模型的高效推理,并在国际会议和期刊上发表论文十余篇。他目前主要研究推理大模型在推理轨迹中出现的低效思考和错误推理问题。同时,他是 OpenKG SIGEval 成员,致力于前沿大模型的知识评测,并联合 CCKS 会议和阿里天池平台举办了人工智能领域论文问答评测竞赛。此外,他还与华为诺亚方舟实验室合作,深度参与面向大语言模型的内外知识融合方法研究,获得华为"难题揭榜"火花奖。
你将了解到
1. 什么是"过思考",它如何侵蚀推理效率
大推理模型的一多半 token 可能都消耗在重复验证上。理解这个现象,是优化推理成本的第一步。
2. 自剪枝训练如何让模型"自己删废话"
在无监督条件下迭代移除冗余推理单元——不依赖人工标注,让模型学会判断哪些思考是必要的。
3. 失败轨迹里藏着什么宝藏
顿悟偏好优化如何从错误中挖掘"从错到对"的转折点,把失败变成自纠错能力的养料。
4. 如何打破"压缩即掉点"的魔咒
为什么 EvoThink 能在减少 token 的同时提升准确率——效率和能力并非只能二选一。
5. 从优化推理到思维自进化
模型自改进流程的延伸讨论:下一代推理模型的优化目标应该是什么?
适合谁来听?
如果你关注以下方向,这场分享值得参加:
·大推理模型(LRM)与长链推理
·推理效率与推理成本优化
·强化学习与偏好优化(DPO / RLHF)
·模型自改进 / 自进化(Self-Improvement / Self-Evolution)
·LLM Agent 与智能体系统
·大模型安全与可靠性
活动信息
📅 讲座时间
2026/09/16 16:30–17:30 (GMT+08:00) 中国标准时间 - 北京
🎙️ 分享嘉宾
东南大学网络空间安全博士生 戴鑫邦
🔍 分享主题
Evolving Thinking in Large Reasoning Models via Self-Pruning and Aha-Moment Preference Optimization
EvoThink:自剪枝与顿悟偏好优化,让大推理模型走向思维自进化
💻 会议平台
腾讯会议
🔗 会议链接 / 会议号
285-367-163
https://meeting.tencent.com/dm/hIXqP1QB8Gal
结语
推理模型的进化,不应该只是思维链越拉越长。
一个真正强大的推理模型,不仅要能想清楚,更要知道什么时候已经想清楚了——在冗余中学会精简,在失败中学会顿悟,让每一个 token 都花在真正的思考上。
本期 EvoAgentX Talk,让我们跟随戴鑫邦一起探索大推理模型的过思考问题、EvoThink 的自进化训练框架,以及模型自改进的下一步方向。
🚀 加入 EvoAgentX 开源社区,一起探索 AI Agent 的未来
欢迎加入项目交流群,与开发者、研究者和 AI 爱好者共同交流 Agent 架构、应用实践与最新进展。
⭐ Star us on GitHub,让更多开发者发现并参与 EvoAgentX!
https://github.com/EvoAgentX/EvoAgentX

