IQuest-Q1实测:从游戏生成到RL训练排错,至知创新研究院展示交付能力
至知创新研究院IQuest Research发布IQuest-Q1模型,实测中仅用200字提示词即可生成可玩HTML游戏,并成功定位RL训练中因推理服务插入空格导致的Reward曲线异常问题。团队此前提出的ModularRSI框架曾登Hugging Face日榜第二。
近日,至知创新研究院IQuest Research推出的IQuest-Q1模型在两项实测中展示了从创意生成到工程排错的能力。在第一项测试中,用户仅提供一段约200字的提示词,模型便生成了一款可在竖屏手机上直接运行的HTML游戏,并为NPC配置了独立的设定与血条系统。游戏包含情绪宣泄、回血机制及随机掉落目标彩蛋等元素,战果支持一键保存分享。
第二项实测则聚焦于强化学习训练中的真实故障排查。在一场RL训练中,Reward曲线未按预期上升,研究人员将问题交由IQuest-Q1,基于Claude Code CLI框架分析训练日志、落盘轨迹并从代码库反向追查。最终定位到RL框架接入Scaffold时的文本回传与轨迹拼接环节——推理服务在文本解码时额外插入了一个空格,导致模型生成文本与回传历史错位、前缀匹配断裂、多轮生成中断,前几轮读代码、跑命令、改代码的训练全部失效,仅最后一轮回答被有效训练。修复后训练恢复正常。
IQuest Research团队近期成果密集。今年7月底至8月,团队相继提出MuonH优化、UBio-MolFM和稀疏权重分解等研究成果。本月16日,团队参与提出的ModularRSI自进化框架登上Hugging Face日榜第二,该框架将Agent在Terminal-Bench 2.0和SWE-Bench Verified的准确率分别从47.57%、73.40%提升至52.43%、76.45%,并支持执行能力跨任务、跨模型复用,缓解了自改进中的信用分配与泛化难题。
从游戏生成到训练排错,IQuest-Q1的实测表现指向同一目标:AI能否将复杂任务做对、做完,并让每次交付成为下一次进化的起点。目前模型已在GitHub和Hugging Face开放。