RSI 风暴:从 OpenAI 到云知声的递归自我改进实践
过去两周,AI 领域最受关注的概念莫过于 RSI(Recursive Self-Improvement,递归自我改进)。
OpenAI 率先披露内部数据:一名人类员工全职工作一天,AI Agent 完成的工作量相当于 3.1 天。其目标直指 2028 年 3 月,旨在打造出真正的「自动化 AI 研究员」。紧接着,OpenAI 首席科学家 Jakub Pachocki 明确表示,研究重心已转向递归自我改进,认为随着能力提升,AI 将更多推动自身研发。
六天后,Anthropic CEO 达里奥在长文中确认,RSI 已在整个行业发生。其核心逻辑在于:当代 AI 参与研发以强化下一代 AI,更强的 AI 反过来承担更多研发工作,形成能力不断增强的循环。
在此背景下,国内云知声推出的 U2-Flash 模型提供了具体的实践样本。该模型将自迭代机制融入「后训练流程」,让模型主动发现薄弱环节、生成针对性数据并经训练验证,以此构建能承接复杂日常工作的「主力模型」。
实测表现:从代码修复到复杂任务交付
精准定位并修复运行时 Bug
在真实项目测试中,U2-Flash 展现了深度的排错能力。面对 vLLM 中一个隐蔽的并发 Bug——即在特定条件下带禁用词参数会导致服务报错「Already borrowed」,模型在无外部参考的情况下,通过代码分析追踪至异步执行与底层分词器的共享状态冲突。
U2-Flash 最终通过创建独立的分词器副本隔离状态,仅修改一个文件(新增 19 行、删除 2 行)便解决了问题。复测显示,在高并发压力下错误率归零,多项回归测试全部通过。
一键生成高质量新疆旅行攻略 PPT
面对「制作一份具有高级感的大美新疆旅游攻略 PPT」这一宽泛需求,U2-Flash 不仅梳理了路线、景点、预算等核心内容骨架,还统筹了配色、排版网格与视觉素材。模型成功交付了一份图文并茂、结构完整的 PPT,实现了从「讲什么」到「怎么呈现」的全流程闭环。
十年买房租房账目可视化分析
针对「手持 100 万,买房还是租房」的经典难题,U2-Flash 构建了可视化分析页面。在设定房价不涨、投资年化收益 3% 等条件下,模型计算出租房方案 10 年后净资产多出 54.26 万元,并精准推导出房价年涨幅约 1.71% 为两种方案打平的临界点。终端记录显示,其计算结果与 Python 精确计算误差不到 1 元。
从 2D 描述自主构建 3D 办公室场景
在空间建模任务中,U2-Flash 接收结构化 2D 平面描述后,自主编写脚本调用 Blender 渲染管线,将其转化为完整的 3D 场景。模型在过程中自主处理了布尔运算失败、法线翻转及光照死角等技术细节,成功完成了从平面信息到立体场景的跨越。
技术参数:Flash 体量具备万亿模型战斗力
U2-Flash 采用稀疏混合专家架构(MoE),总参数量约 266B,单次推理仅激活约 10B(激活比例不到 4%)。这种设计使其能以远低于同类稠密模型的激活规模,交付比肩主力稠密模型的任务质量。
核心性能指标:
- 编码能力:在 SWE-Bench Pro 上得分 61.6,较前代提升 10.5 分;在 DeepSWE v1.1 中得分 64.6,超越 GLM5.3-Flash 及 DeepSeek-V4-Pro 等模型。
- 终端执行:TerminalBench 3.0 得分 24.3,是前代的 9 倍,优于部分万亿参数模型。
- 办公场景:WorkBuddy-Bench Office 得分 81,领先于 DeepSeek-V4 系列及 GLM-5.2。
- 数理推理:GPQA Diamond 得分为 92.4,IMOAnswerBench 为 90.3,HMMT Feb. 2026 高达 97.1。
效率与成本优势:
得益于「隐式思考」机制,U2-Flash 能在高维隐藏状态空间中探索解法,减少显式 Token 生成。用户可调节 none 至 max 四种推理强度。实测显示,其首字响应平均在 3 秒以内,输出峰值达 300 tokens/s,Agent 任务完成时间缩短 35%,迭代步数减少 20%-30%,整体运行成本约为竞品的四分之一。
训练机制:自主闭环演进与异步强化学习
自主发现短板的数据闭环
U2-Flash 摒弃了传统依赖人工标注的模式,建立了「发现薄弱环节→生成针对性数据→强化训练→验证效果」的自主闭环。通过强模型与弱模型的路径对比,监督模型精准定位关键决策步,构建了覆盖主流编程语言、规模近十万的高质量 SWE 任务集。
动态难度校准与异步 Agent RL
为防止模型「刷穿」题库,系统引入难度校准机制,动态调整任务分布,确保模型始终在能力边界进行训练。同时,采用异步 Agent RL 架构,多个 rollout worker 并行采集轨迹,配合 GRPO 策略优化,使单位时间内的有效训练轨迹产出提升约 60%。
多教师在线策略蒸馏(MOPD)
为解决单一强化训练导致的「跷跷板效应」,U2-Flash 采用 MOPD 技术。分别训练数学、代码、Agent 等领域的专项教师模型,再将能力蒸馏至学生模型。教师模型对学生生成的每一个 Token 逐一打分,使达到同等能力所需的训练步数减少约 55%。
工程底座与自愈能力
配套优化的 TITO Rollout 网关和 FP8 全链路精度优化为训练提供支撑。更值得一提的是,团队搭建的监控 Agent 能 24 小时自动检测训练故障、查看日志并切换节点恢复任务,将训练故障的平均恢复时长压缩至人工模式的三分之一。
落地应用:内部试用与国产化适配
在正式发布前,U2-Flash 已在云知声内部试用近一个月,广泛应用于 HR 薪资处理、研发代码解读、前端搭建及文档润色等场景,获得了团队的高度信任。
该模型支持 512K 上下文窗口及 128K 最大输出,兼容 OpenClaw/MMClaw 协议。更重要的是,U2-Flash 实现了全面国产化适配,在国产平台上的吞吐、时延及集群扩展效率持续改善,部分场景表现已接近英伟达 GPU 方案,满足了行业客户对数据安全与算力自主的核心需求。
展望:RSI 驱动的长期进化
云知声表示,U2-Flash 是其在 RSI 方向上的初步成果。目前,该模型已参与到训练数据生成、执行轨迹纠正乃至训练环境修复的闭环中。未来,团队将继续押注递归自我改进路线,探索在配方优化、课程设计及架构搜索上的更大潜力。AI 参与制造 AI 的长跑,至此刚刚起步。

