
过去三十年,量化界都在用“固定的尺子”去衡量因子,导致算法只会疯狂钻规则的空子。
为了打破这一死局,PandaAI 投研团队首创 A2A(Agent-to-Agent)全自动密封联合搜索架构:让大模型不仅“挖因子”,还能相互隔离地去“发明评价指标”!
AI 最终在无人类干预下,自行进化出对抗高换手的量价常识,在2026年盲测中斩获 1.87 的多空夏普!
【论文信息卡片】
Title: AI Trading’s Alpha Singularity: Emergent Market Reasoning through Agent-to-Agent Self-Evolution
Authors: Yuqi Li, Bingjun Liu, Siyuan Liu (Panda AI Team)
Source: Preprint, 2026
Code: 附录 C 包含大模型自主编写的 Python 评价指标源码;正文披露 A2A 拓扑、评价库演化与核心消融结果
🎯 模型/架构革命:PandaAI 团队彻底颠覆遗传算法(GP)和强化学习(RL)“目标函数固定”的行业顽疾。提出了密封联合搜索(SJS)与 A2A 自迭代机制,让“因子搜索”与“评价标准制定”在隔离的 LLM 智能体间联合演化。
📊 数据与防泄漏机制:基于中证1000(CSI 1000)长达12年的动态数据。我们首创“类型化防泄漏 Wiki 内存”,强行隔离 5 种不同角色的 LLM 的信息域,保证 2026 年(91天)盲测集的绝对纯净。
💰 涌现的超额业绩:在硬性扣除单边 9 bps(万分之九)交易成本后,这套无需人工设定任何进阶风控规则的 Agora 系统,在 2026 年的严苛盲测中实现了 +48.4% 的多空年化收益,夏普达 1.87。
三十年来,量化圈的自动化发现(从早期的公式拼凑,到遗传规划,再到近年的深度强化学习)都遵循着同一个死循环:人类设定一个打分函数(比如 Rank IC),机器疯狂去搜索能让这个分数最大化的公式。
但 PandaAI 团队在长期实盘中发现,这种“中心化集权”的评价方式是极其脆弱的!如果机器发现某种“尾盘剧烈波动”能骗过 IC 检验,它就会疯狂往这个方向过拟合。在多重假设检验的灾难下,只要“裁判”是死板的,再牛逼的算法最终也只是在加速拟合“裁判的盲区”。
为了打破这个死循环,PandaAI 团队提出了一个极其大胆的设想:既然如此,为什么不让 AI 连“裁判”一起当了?
PandaAI 这项革命性研究不仅在于理论狂想,更在于我们落地了极其精密的 A2A 系统工程实现:
数据构造:
特征 X:基于中证1000的 OHLCV 数据,结合 AlphaGen 算子空间。
标签 Y:原始目标是未来 5 日收益预测;评价标准在密封联合搜索中由评价矿工与评审委员会共同演化。
核心架构(PandaAI 自研 A2A 自演化系统 Agora):我们构建了一个包含 5 种角色、9 个独立 LLM 客户端的“量化职场博弈沙盒”。
因子矿工(Alpha-miner):拼命生成因子表达式。
评价矿工(Evaluation-miner):拼命写 Python 代码发明新的因子评价指标。
评审委员会(Adjudicators):不直接投票,而是写“叙述性报告”来评判因子和指标。
基石:类型化过滤(P1-P5 拓扑约束):这些 AI 绝对不能互相“聊天”串通作弊!它们只能将自己写的 Python 代码和战报提交到受读写权限严格控制的“LLM Wiki”。
量化直觉的涌现(Emergence):没有任何人告诉 AI 什么叫“好因子”。但系统在 100 轮的迭代中,自主发现并用 Python 写出了“十分组单调性相关(Monotonicity)”和“超额回撤与换手率惩罚(Drawdown Penalty)”这两个指标,并自动将其作为了后续因子的“生死线”!
PandaAI 独创的宛如“西部世界”般的 A2A 信息隔离与拓扑演化架构
A2A 自迭代并非学术玩具,PandaAI 让其在真实的量价角斗场中展现了降维打击:
盲测业绩霸榜:在系统乃至任何一个 Agent 都从未见过的 2026 年测试集(91天)上,经过 100 轮 A2A 自迭代的 Agora 系统,甄选出的 Top-30 因子复合策略,斩获了 +48.4% 的多空年化收益,单调性极佳(0.285)。相比之下,传统的遗传算法(GP)和迭代式单体 LLM 收益全线飘绿。
自我进化的价值验证(Ablation):如果在这个架构中“冻结”评价指标的进化功能(B6 Frozen libraries 实验),系统的盲测夏普会从 +1.87 瞬间崩盘至 -0.379。这硬核证明了:高收益并非源于 LLM 瞎蒙公式,而是完全得益于 PandaAI 体系中那两套 AI 自己悟出的防过拟合指标!
交易摩擦实测:回测极度贴近国内实盘环境,硬扣 0.04% 佣金 + 0.05% 印花税(双边合计 18 bps),且延后一天开盘执行。即使将成本惩罚放大 5 倍,由于 AI 进化出了换手率感知,其多空夏普依然坚挺在 +1.92。
AI是如何在 R21 和 R50 轮次顿悟出两个神级风控指标,并迎来因子有效性大爆发的!
Agora 在盲测集上稳健向上的多空资金曲线
🔥 落地价值评估(开启投研流水线的“自动驾驶”时代):
毫无疑问,PandaAI 的这项研究是目前量化圈最接近 AGI(通用人工智能)投研形态的里程碑!过去,国内百亿量化的 AI 探索主要停留在“Copilot”阶段(让人类研究员调教大模型写代码)。本文的 A2A(Agent-to-Agent)拓扑架构证明,只要给大模型建立合理的“盲测与晋升规则约束”,它们完全可以像一家拥有数百名员工的私募机构一样:研发部提策略、风控部挑刺、评审会拍板,实现量化逻辑的内生涌现。这为国内搭建全自动、无人值守的 Alpha 挖掘中台提供了极具野心的范本。
⚠️ 避坑与局限性(来自一线团队的真实洞察):
当然,作为深耕量化一线的团队,PandaAI 团队也极其坦诚地剖析了这套前沿系统的当前局限:
“炼丹”成本极高且方差未知:让 9 个 LLM 客户端在一张 RTX 5090 上跑完 100 轮博弈,耗费了近 4500 次大模型 API 调用和 60 个 GPU 小时。高昂的算力导致我们在本阶段仅展示了单一随机种子(Single-seed)的 100 轮结果。这种“顿悟出完美指标”的过程在大规模多种子环境下的鲁棒性,是我们下一步攻克的课题。
纯多头策略(Long-only)的实盘摩擦:仔细拆解收益来源,Agora 高达 48.4% 的多空年化,很大程度得益于空头端极度精准的负向预测(年化 -27.39%)。但其多头端(Top-decile)在扣费后的绝对收益仅为 +6.46%,略微跑输等权基准(+9.75%)。这意味着,在融券困难、只能做纯多头的 A 股实盘环境中,如何进一步激发多头 Alpha 的爆发力,仍有极大的迭代空间。
获取源码与完整文献 (CTA)
当传统的量化团队还在为如何清洗因子发愁时,PandaAI 的智能体已经开始自己写“因子防骗指南”了!理解 A2A 自迭代的拓扑逻辑,就是抢到了下一代 AI 投研中台的门票。
本期论文原文 PDF,以及包含大模型自主编写的 Python 评价指标源码(见附录C),PandaAI 团队已为您打包完毕!
👇 获取方式:关注本公众号,在后台对话框回复关键词【AI因子】,即可免费获取这份前沿内部资料,欢迎同行深入探讨交流!

