可验证的隐藏动态:从已求解机制生成智能体强化学习环境
VHD-Play先求解数学模型,再将其决策过程呈现为有状态的工具,以构建智能体训练环境。因此,环境动态与轨迹评分基准来自同一模型。该流程以每个仅需几美分的成本生成了3,300个环境。使用这些环境训练Qwen3.6-35B-A3B后,其在涵盖五类环境的诊断测试中的平均智能体得分从0.204升至0.815。研究人员还报告称,模型在未见过的机制和外部基准测试上也有所提升。对比结果表明,可学习差距的大部分来自有状态交互,而非底层问题求解能力。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。