关于 RLVR 的报道
共 1 篇相关报道
入口被锁,内部开放:RLVR 缩小解决方案空间
Locked at the Entrance, Open Inside: Where RLVR Narrows the Solution Space
AI 洞察RLVR虽提升pass@1,但使策略解空间收缩,Countdown任务中覆盖率最高下降67%。相比此前关注RLVR的准确率增益,本次首次量化其在轨迹入口处的多样性损失,表明测试时扩展收益递减源于解空间访问受限而非执行失败。核心结论首次量化RLVR导致解空间覆盖率下降67%。为什么重要揭示RLVR的隐性代价,挑战'可验证奖励=更优'的简单认知,影响推理模型训练与测试时扩展策略设计。影响谁- AI 研究者需重新权衡RLVR的准确率增益与解空间多样性损失,探索保留多样性的奖励设计。
- 开发者依赖RLVR微调模型时需评估长尾问题覆盖度,避免在罕见但合法的推理路径上失效。
- AI 研究者测试时扩展收益有限有了新解释,可能推动恢复解空间访问的研究方向。
后续看点观察后续是否出现缓解解空间收缩的训练方法,以及该发现能否推广到更复杂推理任务。重要度 75/100