CMU 论文训练 4B 提议模型编辑智能体 harness,不改动求解器
CMU 的一篇论文 [Harness Learning Enables Generalizable Test-Time Adaptation](https://arxiv.org/abs/2609.35738) 用强化学习训练提议模型,通过编辑智能体的 harness 代码而非改变求解器模型的权重来改进智能体。
提议模型读取任务、当前 harness 和执行报告,然后写出代码编辑。其奖励是修订后 harness 的得分,求解器模型保持不变。
训练后的 4B 提议模型在 Reasoning Gym 的单步修订上超过其 35B 教师模型,包括训练中从未见过的任务族。在 HotpotQA 上训练的提议模型能在 MuSiQue 和 2WikiMultihopQA 上持续改进 harness。