NVIDIA Mid-Harness 将 TerminalBench-Lite 的 Pass@1 从 50.0% 提升至 68.0%
Mid-Harness 不改变生成器和 harness,在两者之间工作。它采样多条候选 shell 命令,并在执行其中一条之前加以验证。论文发现,把更多算力花在验证器上,比再抽额外样本更有用。
由 GPT-5.6 Sol 在八个采样动作中选择时,TerminalBench-Lite 的 Pass@1 从 50.0% 升至 68.0%。弱验证器从额外样本中几乎得不到提升。较小的 TMAX-9B 模型核对自己的候选时,两两比较效果最好,将强验证器蒸馏进 TMAX-9B 还能进一步带来帮助。把动作采样与轨迹采样结合起来,能以低于单独采样完整轨迹的估计 token 成本达到更高成功率。论文为 [Mid-Harness](https://academy.dair.ai/papers/mid-harness-scaling-actions-between-model-and-harness-for-terminal-agents-2609.39982)。