Codex Reset
GitHub

QQ·微信群

CODEX / SIGNAL STUDIO

你的 Codex,尽在掌握。

Meta Superintelligence Labs 论文描述 RL 后训练中的 Sharpening Tax(锐化税)

DAIR.AI

Meta Superintelligence Labs 报告称,当两者都获得足够样本时,带轻量测试框架的基础模型往往比它们的 RL 后训练版本解决更多智能体任务。后训练模型在 pass@1 上占优,但在 K 很大时,基础模型经常能解决后训练模型在 BFCL v4 multi-turn、ACEBench 和 WebShop 上从未解决的任务。

作者表示,后训练会把每个任务推向总是解决或从不解决,提高一致性,同时降低覆盖范围。他们把损失的测试时可扩展性称为 Sharpening Tax(锐化税)。在 42 对基础模型与后训练模型中,它出现在大多数设置里,随模型规模增长,并且可以通过少量 rollout 估计。

他们的修复方法 PTGS 在 RL 期间根据每个提示的估计难度设置其采样温度。它缴纳更小的税,并同时提高 pass@1。论文是 [Sharpening Tax in post-training](https://academy.dair.ai/papers/sharpening-tax-in-post-training-2610.01509)。