Codex Reset
GitHub

QQ·微信群

CODEX / SIGNAL STUDIO

你的 Codex,尽在掌握。

#meta-superintelligence-labs

Meta Superintelligence Labs 论文描述 RL 后训练中的 Sharpening Tax(锐化税)

在 42 对基础模型与后训练模型中,使用轻量测试框架的基础模型在样本数很大时,往往比它们的 RL 后训练版本解决更多智能体任务,而后者仍在 pass@1 上占优。作者的 PTGS 方法在 RL 期间根据估计难度为每个提示设置采样温度,从而缴纳更小的税,并同时提高 pass@1。