When2Think:面向高效混合推理模型的难度感知长度控制
大型推理模型在复杂任务上表现出色,但常在简单问题上浪费计算资源,在困难问题上又推理不足。When2Think是一种后训练框架,可根据每个问题的难度动态分配推理深度。该方法结合实例级难度感知奖励塑形、基于验证器的奖励以及批次标准化优势,无需训练奖励模型,也无需在线查询参考模型。在数学基准测试中,相比基础模型,AIME24上的Pass@3提升10.0%,Token使用量减少27.9%。在AIME25上,When2Think取得40.0%的Pass@3,超过了压缩方法和仅采用路由的基线。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。