VeriHarness 将基础模型变为长周期智能体任务的验证器
Google 论文 VeriHarness 将同一基础模型变成承担两项工作的智能体验证器。一项通过检查工作区证据,解决采样智能体 rollout 之间存在分歧的主张。另一项质疑所有 rollout 都同意的主张,并寻找它们共同遗漏的要求。论文称,一致可能掩盖共同错误,而分歧往往指向正确选项。
在五个长周期基准上,论文报告了所测试基线中的最佳选择分数。借助有证据支持的修订,它在 Gemini 3.5 Flash 上比单次 rollout 增加 6.2 分,在 Claude Opus 4.8 上增加 6.4 分。作者还发布了约 26,000 次 rollout。论文发布在 [arXiv](https://arxiv.org/abs/2610.00972)。