至知创新研究院发布IQuest-Q1:320B参数MoE模型,激活15B,可揪出RL训练中的空格Bug
量子位实测称,IQuest-Q1仅凭约200字提示词即可生成可在竖屏手机玩的HTML小游戏;在官方Blog案例中,它从训练日志和落盘轨迹里定位到RL框架接入Scaffold时文本解码多插一个空格,导致前缀匹配断裂、多轮生成中断。
AI解读:IQuest-Q1是至知创新研究院(IQuest Research)推出的模型,采用decoder-only Transformer主干加稀疏MoE架构,总参数约320B,激活参数约15B。这个数字组合意味着它单次推理只动用一小部分参数,算力花在关键位置上。
它的应用场景不是单一聊天:量子位实测用约200字提示词生成了一个能在竖屏手机上直接玩的HTML游戏《国庆卧室保卫战》;官方Blog案例则用它排查RL训练故障,最终定位到RL框架接入Scaffold时推理服务在文本解码时额外插入的一个空格。
这个空格看着小,但会让模型生成文本与回传历史错位,造成前缀匹配断裂、多轮生成中断,前几轮读代码、跑命令、改代码都白练,只训练最后一轮回答。对正在做RL训练的人来说,这类数据Bug靠人翻日志很费时,模型能追到根因就是直接减少训练返工。
IQuest-Q1还宣称参与了自身研发迭代:它提出的研发方案经人类研究者确认后,验证过的模型更新、训练资产和研究流程会进入下一轮迭代,数据流程、训练配置、评估方法和工具会作为后续版本可复用的资产累积。这属于官方说法,实际复用效果尚未公开量化。
同团队此前成果包括7月底到8月提出的MuonH优化、UBio-MolFM和稀疏权重分解;本月16日参与提出的ModularRSI自进化框架登上Hugging Face日榜第二,并称将Agent在Terminal-Bench 2.0和SWE-Bench Verified的准确率分别从47.57%、73.40%提升至52.43%、76.45%。这些数字针对的是该框架,不是IQuest-Q1本身。
是否要用它,取决于你手头是否有仓库级代码、终端操作或RL训练排错这类任务;量子位称其在NL2Repo、CyberGym、Terminal-Bench 2.1、DeepSWE v1.1、JobBench等评测中表现不俗,但未给出完整分数,选型前仍需自行核对公开评测与许可条件。
量子位于2026年9月29日发布文章,介绍至知创新研究院(IQuest Research)的模型IQuest-Q1,并给出两项实测:用提示词生成HTML小游戏,以及排查RL训练中的空格Bug。
IQuest-Q1采用decoder-only Transformer主干,配稀疏MoE架构,总参数约320B,激活参数约15B。
文章称该模型在仓库级代码生成NL2Repo、网络安全基准CyberGym、终端Terminal-Bench 2.1、代码长程任务DeepSWE v1.1、办公场景JobBench等评测中表现不俗,但未在文中列出具体分数。
官方Blog案例显示,一次RL训练中Reward曲线未按预期爬升;研究人员让IQuest-Q1基于Claude Code CLI框架分析训练日志、训练中的落盘轨迹,并从代码库反向追查故障原因。
最终问题被定位到RL框架接入Scaffold时的文本回传与轨迹拼接环节:推理服务在文本解码时额外插入了一个空格,导致模型生成文本与回传历史错位,前缀匹配断裂、多轮生成中断,RL训练前几轮的读代码、跑命令、改代码均未生效,只训练了最后一轮回答。
文章还引述IQuest-Q1官宣的少量文字称,模型亲自参与了自身研发迭代:其提出的研发方案经人类研究者拍板通过后,验证过的模型更新、训练资产和研究流程会流入下一轮迭代,被后续版本接着用;每轮累积的数据流程、训练配置、评估方法和工具会转化为可复用的研发资产。
两项实测:HTML小游戏与RL训练空格Bug
量子位的实测一:作者给IQuest-Q1一段约200字的提示词,要求生成《国庆卧室保卫战》小游戏,结果得到一个可在竖屏手机上直接玩的HTML游戏。文章描述,游戏内NPC有独立设定和血条,枕头作为武器,被怪兽击中后回床上躺平可回血;游戏结束后从奶茶、炸鸡、看电影、逛超市、附近散步中随机掉落一个“今日目标小彩蛋”,战果可一键保存。
实测二来自官方Blog:RL训练中Reward曲线没有按预期爬升。研究人员把问题交给IQuest-Q1,让它基于Claude Code CLI框架分析训练日志和落盘轨迹,并从代码库反向追查。
根因是RL框架接入Scaffold时,推理服务在文本解码环节额外插入了一个空格,造成模型生成文本与回传历史错位。文章称,这会让前缀匹配断裂、多轮生成中断,前几轮任务全部白跑,只练了最后一轮回答;修复后训练恢复。
量子位还提到一个数值求解案例:IQuest-Q1可把十万步以内的三体问题运动方程解成可视化结果,但文章未给出该案例的误差或性能指标。
- 《国庆卧室保卫战》用约200字提示词生成,输出为可在竖屏手机直接玩的HTML游戏。
- 游戏包含NPC血条、枕头攻击、回床回血、结束后随机“今日目标小彩蛋”和一键保存战果。
- RL排错基于Claude Code CLI框架,输入为训练日志与训练中的落盘轨迹,追查方向为代码库反向定位。
- 根因:推理服务文本解码时额外插入一个空格,导致生成文本与回传历史错位。
- 后果:前缀匹配断裂、多轮生成中断,前几轮读代码、跑命令、改代码未参与训练,只训练最后一轮回答。
模型参与自身研发迭代的说法
关于IQuest-Q1的研发过程,文章引用其官宣的少量文字称:模型亲自参与了自身的研发迭代。一旦它提出的研发方案被人类研究者拍板通过,验证过的模型更新、训练资产和研究流程就会直接流进下一轮迭代,被后续版本接着用。
每一轮累积下来的数据流程、训练配置、评估方法和工具,会像滚雪球一样扩大,转化为后续版本可复用的研发资产。这一表述来自官方,文章没有提供具体轮次、方案采纳率或复用带来的效果数据。
- 官方称IQuest-Q1参与自身研发迭代,方案需人类研究者拍板通过。
- 通过验证的模型更新、训练资产和研究流程进入下一轮迭代。
- 数据流程、训练配置、评估方法和工具被描述为后续版本可复用的研发资产。
- 文章未给出参与轮次、采纳率或量化收益。
团队过往成果与基准数字
文章梳理至知创新研究院IQuest Research近期成果:从2026年7月底到8月,团队相继提出MuonH优化、UBio-MolFM和稀疏权重分解等研究,文章称这些为模型训练打下基础。
本月16日,IQuest Research参与提出的ModularRSI自进化框架登上Hugging Face日榜第二。文章称该框架将Agent在Terminal-Bench 2.0和SWE-Bench Verified的准确率分别从47.57%、73.40%提升至52.43%、76.45%,并能让Agent把习得的执行能力跨任务、跨模型复用,用于解决自改进中的信用分配与泛化难题。
文章最后给出IQuest-Q1的GitHub、Hugging Face和Blog链接,供读者进一步查看模型信息。
- MuonH优化、UBio-MolFM、稀疏权重分解于2026年7月底至8月提出。
- ModularRSI自进化框架于本月16日登上Hugging Face日榜第二。
- ModularRSI将Agent在Terminal-Bench 2.0准确率从47.57%提升至52.43%,在SWE-Bench Verified从73.40%提升至76.45%。
- 上述数字针对ModularRSI框架,文章未将其等同于IQuest-Q1的成绩。
- 文章提供GitHub(github.com/IQuestLab/IQuest-Q1)、Hugging Face(huggingface.co/IQuestLab/IQuest-Q1)和Blog(iquestlab.github.io)链接。