量子位消息,一款名为IQuest-Q1的大模型近日亮相。该模型采用decoder-only Transformer主干,搭配稀疏MoE架构,总参数约320B,激活参数约15B。在仓库级代码生成NL2Repo、网络安全基准CyberGym、终端Terminal-Bench 2.1、代码长程任务DeepSWE v1.1、办公场景JobBench等复杂任务评测中,IQuest-Q1均表现不俗,在同参数量模型中成绩可圈可点。
据官方披露,IQuest-Q1还参与了自身的研发迭代。一旦其提出的研发方案被人类研究者采纳,验证过的模型更新、训练资产和研究流程便会流入下一轮迭代,被后续版本复用。每一轮积累的数据流程、训练配置、评估方法和工具也会持续沉淀,转化为可复用的研发资产。
实测中,仅用一段约200字的提示词,IQuest-Q1便生成了一个可在竖屏手机上直接运行的HTML小游戏《国庆卧室保卫战》。游戏内置NPC设定与血条,玩家可用枕头攻击怪兽,回床回血,结束后还会随机掉落奶茶、炸鸡、看电影等“今日目标小彩蛋”。
更硬核的测试来自真实RL训练场景。一次训练中,Reward曲线未按预期爬升,研究人员让IQuest-Q1基于Claude Code CLI框架分析训练日志与落盘轨迹,并从代码库反向追查。最终问题被定位到RL框架接入Scaffold时的文本回传与轨迹拼接环节——推理服务在文本解码时额外插入了一个空格,导致模型生成文本与回传历史错位、前缀匹配断裂、多轮生成中断,前几轮读代码、跑命令、改代码的训练全部白费。