大数跨境

精准揪出RL训练数据Bug,Prompt直出小游戏,IQuest-Q1夯爆了!

精准揪出RL训练数据Bug,Prompt直出小游戏,IQuest-Q1夯爆了! 量子位
2026-09-29
18
导读:模型正在尝试自己跑完研发闭环。
文婷 发自 凹非寺
量子位 | 公众号 QbitAI

别眨眼。

星空下,一辆白橙色的反重力赛车如利刃出鞘,猛地切进弯道,丝滑拐弯,在赛道上拖拽出一道道冰蓝光带,溅起金黄色的摩擦星火,直至冲线。

这可不是好莱坞特技大片,而是用IQuest-Q1模型生成的沉浸式反重力竞速游戏。

该模型既能通过一句提示词(Prompt)生成炫酷游戏,也能将十万步三体方程求解过程可视化,甚至能从强化学习(RL)训练数据中揪出隐藏的空格Bug,让模型重回训练正轨。

△数值求解三体问题运动方程实测(10万步以内)

从基准测试(Benchmark)表现来看,IQuest-Q1成绩优异。它在仓库级代码生成(NL2Repo)、网络安全基准(CyberGym)、终端任务(Terminal-Bench 2.1)、代码长程任务(DeepSWE v1.1)及办公场景(JobBench)等复杂评测中均表现不俗,在同参数量模型中极具竞争力。

320B参数仅激活15B:模型尝试自主完成研发闭环

IQuest-Q1采用decoder-only Transformer主干搭配稀疏MoE架构,总参数约320B,激活参数约15B。这种设计使其在保证庞大知识容量的同时,实现高效算力分配,每一分算力都精准作用于关键任务。

值得注意的是,模型参与了自身的研发迭代。一旦其提出的研发方案通过人类研究者验证,相关的模型更新、训练资产和研究流程将直接流入下一轮迭代。积累的数据流程、训练配置、评估方法和工具转化为可复用的研发资产,形成滚雪球效应。

实测:从生成小游戏到修复RL训练故障

实测一:生成《国庆卧室保卫战》小游戏

测试中,仅使用一段约200字的提示词,IQuest-Q1便生成了一个可在竖屏手机运行的HTML游戏《国庆卧室保卫战》。游戏针对假期居家的心理状态,设置了独特的NPC设定和血条机制。

玩家可使用枕头作为武器对抗代表坏情绪的怪兽,击中后回血方式包括躺平休息等。游戏结束后,系统会随机推荐如喝奶茶、看电影等“今日目标小彩蛋”,并提供一键保存战果功能。

实测二:定位RL训练中的空格故障

在更硬核的工程测试中,研究人员将RL训练中Reward曲线异常的问题交给IQuest-Q1。模型基于Claude Code CLI框架分析训练日志、落盘轨迹并反向追查代码库。

最终,模型定位到故障原因:RL框架接入Scaffold时,推理服务在文本解码环节额外插入了一个空格。这个微小的空格导致模型生成文本与回传历史错位,引发前缀匹配断裂和多轮生成中断。

IQuest-Q1及时发现并修复该Bug,使训练恢复正常。

△修复后的Reward曲线,实测源自官方Blog

从创意生成到工程排错,实测表明IQuest-Q1具备稳定交付经得起查验成果的能力。

研发团队至知创新研究院的技术积淀

IQuest-Q1由至知创新研究院(IQuest Research)研发。该团队近期成果频出:

  • 7月至8月,提出MuonH优化、UBio-MolFM和稀疏权重分解等研究成果,夯实模型训练基础。
  • 本月16日,参与提出的ModularRSI自进化框架登上Hugging Face日榜第二。该框架将Agent在Terminal-Bench 2.0和SWE-Bench Verified的准确率分别提升至52.43%和76.45%,有效解决了自改进中的信用分配与泛化难题。

IQuest Research团队的核心目标是让AI能够正确完成复杂任务,并使每一次交付成为下一次进化的起点。

参考链接:
GitHub:https://github.com/IQuestLab/IQuest-Q1
[2]Hugging Face:https://huggingface.co/IQuestLab/IQuest-Q1
[3]Blog:https://iquestlab.github.io/

一键三连「点赞」「转发」「小心心」

欢迎在评论区留下你的想法!

— 完 —


【声明】内容源于网络
0
0
量子位
各类跨境出海行业相关资讯
内容 16486
粉丝 1
量子位 各类跨境出海行业相关资讯
总阅读455.7k
粉丝1
内容16.5k