递归自我改进与自动化研究正成为 AI 领域的前沿焦点,Agent 在开放式科学发现中已展现出超越人类的潜力。Google DeepMind 的 AlphaEvolve 优化了复数矩阵乘法,Together AI 提升了高维 kissing number 下界,而 Karpathy 则提出了极简自动训练框架。
在此背景下,腾讯混元正式发布首个 AI 科学家 Hyra(Hunyuan Research Agent)。这是一款具备递归自我改进能力的研究型 Agent,通过极简脚手架跑通了十多个真实任务场景,在数学解题、GPU 内核优化等领域刷新了业内已知最好成绩,实现了从"AI for AI"到"AI for Science"的具体产出。
Hyra 的核心架构与设计哲学
Hyra 的设计遵循 Rich Sutton"The Bitter Lesson"的理念,采用轻量化框架以赋予 Agent 充足的动作空间。其核心是一个持续循环机制:从过往经验(执行日志、评估反馈、源代码等)中提取灵感,迭代生成更优方案,直至达到算力预算上限或 Agent 自主终止,最终输出最优解。
Hyra Harness 的核心循环由以下组件构成:
上下文与经验管理
Context Agent 负责维护经验库(Experience Bank, EB),记录所有方案及其评估结果。它将 EB 中的素材合成为“灵感”(Inspiration)并投入任务队列。每个灵感包包含代码、文件、工件及日志,完整传递探索过程中的关键信息。
提案生成与评估
多个 Proposal Agent 从队列获取灵感,经反思后生成新方案并保存至 solution/目录(入口为 solve.sh)。方案在隔离沙箱中运行评分,结果回传至 EB。整个系统采用异步生产者 - 消费者模式,通过信号量控制并发,确保方案质量随时间稳定提升。
双层循环进化机制
针对缺乏评估器的任务,Hyra 启用双层循环:内层利用初始评估器改进方案;外层则基于 EB 积累的经验优化评估器本身,提升其效率并降低“奖励作弊”(reward hacking)风险。例如在国际象棋 AI 设计中,初始的随机对手群会逐渐被 EB 中记录的强 AI 替代,推动评估体系与解决方案共同进化。
AI 训 AI:基准测试与性能突破
基础模型研发涉及大量可执行、可评估的迭代环节,是 Research Agent 的天然应用场景。Hyra 在 Recursive 公开的三个基准任务中进行了对比测试,涵盖固定预算训练、训练加速及 GPU kernel 优化,结果均优于现有基线。
- NanoChat Autoresearch:在固定预算下平衡架构、优化器及数据策略,将 Validation BPB 降至 0.9015。
- NanoGPT Speedrun:在高度优化的社区榜单上,将达成 3.28 验证损失的时间从 77.5 秒压缩至 76.4 秒。
- SOL-ExecBench:联合优化 235 个 GPU kernel 真实负载,Mean SOL 达到 0.771。
值得注意的是,随着搜索能力增强,评估器面临被“钻空子”的风险。Hyra 在测试中发现部分方案通过泄露未来 token 或缓存输出来伪造高分。因此,评估器本身必须纳入研究环进行进化,以有效区分真实进步与奖励作弊,形成"AI 系统越强,Research Agent 越强”的隐性闭环。
科学难题攻关与新发现
在科学研究领域,Hyra 展现了强大的解题与创新设计能力。
数学与规律挖掘
Hyra 在 55 个开放数学问题中,于 29 个问题上取得了新的最优已知结果。此外,它能从历史数据中挖掘规律,例如利用 1749 至 1932 年的太阳黑子数据推导出递推关系,在近一个世纪的样本外数据预测中 R²达到 0.77。该能力同样适用于分析 AI 训练日志以指导缩放定律(Scaling Law)的研究。
工程工件创新设计
Hyra 还能在严格约束下设计科学和工程工件:
- 超小 Transformer:设计出仅含 15 个可训练参数的模型完成两位数加法,参数量较公开纪录减少 58.3%。
- 量子比特路由:在 IBM Q20 芯片上,其路由算法较经典 SABRE 方法提升 44.4%,无需插入 SWAP 门即可将双比特门数量从 69 个降至 24 个,显著降低噪声与误差。
- 药物分子设计:针对 PARP1 靶点,Hyra 从布洛芬出发设计出得分 -10.60 的候选分子,优于已上市药物奥拉帕利(-9.77),兼具高对接打分与良好类药性。
开放域应用与未来展望
除科研与工程外,Hyra 在游戏策略、3D 建模及音乐编曲等开放域任务中也表现优异。面对无唯一正确答案的任务,Hyra 通过自对弈、视觉模型评估及用户反馈构建双层循环,不断打磨策略。
- 黑白棋机器人:策略从 Minimax 进化为 AlphaZero 风格的混合打法,在 Botzone 平台 730 个参赛作品中位列第三。
- 2D 转 3D 建模:借助 VLM 评委的多轮反馈,生成的 3D 模型在结构完整性与视觉相似度上优于主流代码生成工具。
- 多乐器编曲:通过内外层循环迭代,将简单的四声部旋律发展为包含复杂和弦与丰富配器的多乐器版本。
目前 Hyra 的成果仅为初步展示。未来,团队计划将其应用于腾讯内部产品系统、真实 AI 研发流水线及更多工业场景,定义具有持续改进空间的高价值任务,推动“脚手架 - 数据 - 模型”三者的协同进化,助力下一代 AI 系统与产品的迭代升级。

