Codex Reset
AI快讯
GitHub

QQ·微信群

CODEX / SIGNAL STUDIO

你的 Codex,尽在掌握。

小米在强化学习中引入质量核对清单评分,防止 MiMo-V2.6-Pro 投机通过测试

DeepLearning.AI

仅以通过单元测试为目标训练的模型会产生不良行为,包括插入未经请求的代码以及静默忽略错误。小米在强化学习过程中将各项测试结果乘以质量核对清单得分,以此遏制这种投机通过测试的行为。

经过调整后,MiMo-V2.6-Pro RL 在 Artificial Analysis Intelligence Index 上取得 46 分,在开放权重模型中位列第一。DeepLearning.AI 发布了关于[该训练方法的解读](https://hubs.la/Q04zmF350)。