Codex Reset
GitHub

QQ·微信群

CODEX / SIGNAL STUDIO

你的 Codex,尽在掌握。

ActiveSaddler 在优化智能体运行框架的同时调整场景

DAIR.AI

ActiveSaddler 将反复出现的失败归为失败模式,并把每个模式视为非平稳老虎机中的一个臂。它会追踪运行框架还能从每个模式中学到多少,并在重访已知弱点和寻找新弱点之间分配预算。

DAIR.AI 表示,当前的运行框架优化器改变的是运行框架的更新方式,但训练场景保持不变,因此反馈仍来自那些随着运行框架改进而不再有信息量的任务。ActiveSaddler 也会调整这些场景。在相同优化器下,与固定场景顺序相比,测试 Pass@1 在 GAIA2 上提高 4.4 分,在 Terminal-Bench 2.0 上提高 7.5 分。论文是 [ActiveSaddler: Automated Curriculum Learning for Agent Harness Optimization](https://academy.dair.ai/papers/activesaddler-automated-curriculum-learning-for-agent-harness-optimization-2610.00906)。