CoreWeave 推出 RL Rollouts,支持强化学习中的实时模型权重更新
CoreWeave 推出 RL Rollouts,以降低强化学习训练循环中的延迟。该系统无需在每个检查点重新部署并暂停训练器,而是直接将新权重加载到运行中的部署中,且不会中断正在进行的请求,运行速度约为标准重新部署周期的 15 倍。
NVIDIA 和 You.com 使用 RL Rollouts 对用于网络搜索的 Nemotron 3.5 Lightning 进行了后训练。据 CoreWeave 的[分析说明](https://crwv.co/utdYc),该工作流程将 BrowseComp 准确率从 36.97% 提升至 45.45%,同时将工具调用次数减少了 30.24%。