快讯 23:41Perplexity 红队测试 SPACE 沙箱:9 个模型 108 次运行均未逃逸 VM23:08Instinct获10亿美元融资,估值百亿,AI智能体赛道热度不减22:53小米大模型负责人罗福莉晋升22级 已达职级体系最高档 全部快讯 →

每日快讯

大厂动态 · 融资事件 · 政策监管 · 前沿论文 · Agent 抓取 + 智能改写,每日 40+ 条

大厂 今天 · 星期二 · 09-29 15:59 约 2 分钟读完

IQuest-Q1实测:从游戏生成到RL训练排错,至知创新研究院展示交付能力

摘要

至知创新研究院IQuest Research发布IQuest-Q1模型,实测中仅用200字提示词即可生成可玩HTML游戏,并成功定位RL训练中因推理服务插入空格导致的Reward曲线异常问题。团队此前提出的ModularRSI框架曾登Hugging Face日榜第二。

IQuest-Q1实测:从游戏生成到RL训练排错,至知创新研究院展示交付能力
图片来源:量子位

近日,至知创新研究院IQuest Research推出的IQuest-Q1模型在两项实测中展示了从创意生成到工程排错的能力。在第一项测试中,用户仅提供一段约200字的提示词,模型便生成了一款可在竖屏手机上直接运行的HTML游戏,并为NPC配置了独立的设定与血条系统。游戏包含情绪宣泄、回血机制及随机掉落目标彩蛋等元素,战果支持一键保存分享。

第二项实测则聚焦于强化学习训练中的真实故障排查。在一场RL训练中,Reward曲线未按预期上升,研究人员将问题交由IQuest-Q1,基于Claude Code CLI框架分析训练日志、落盘轨迹并从代码库反向追查。最终定位到RL框架接入Scaffold时的文本回传与轨迹拼接环节——推理服务在文本解码时额外插入了一个空格,导致模型生成文本与回传历史错位、前缀匹配断裂、多轮生成中断,前几轮读代码、跑命令、改代码的训练全部失效,仅最后一轮回答被有效训练。修复后训练恢复正常。

IQuest Research团队近期成果密集。今年7月底至8月,团队相继提出MuonH优化、UBio-MolFM和稀疏权重分解等研究成果。本月16日,团队参与提出的ModularRSI自进化框架登上Hugging Face日榜第二,该框架将Agent在Terminal-Bench 2.0和SWE-Bench Verified的准确率分别从47.57%、73.40%提升至52.43%、76.45%,并支持执行能力跨任务、跨模型复用,缓解了自改进中的信用分配与泛化难题。

从游戏生成到训练排错,IQuest-Q1的实测表现指向同一目标:AI能否将复杂任务做对、做完,并让每次交付成为下一次进化的起点。目前模型已在GitHub和Hugging Face开放。

IQuest-Q1强化学习至知创新研究院ModularRSI
本文由新大陆基于公开信息编辑整理
213
收录 AI 工具
23
模型产品档案
54
企业落地案例
8
完整版提示词