WHALE:联合优化模型权重与执行框架的简单方法
AI代理的性能同时取决于模型参数,以及负责管理上下文和控制流程的可执行框架。WHALE(Weight-Harness Alternating Learning)交替执行两个阶段:先在当前框架下更新模型,再针对更新后的模型搜索更优框架。该方法结合了在线拒绝采样微调和Meta-Harness。在搜索问答、数学推理和国际象棋谜题三个领域使用Qwen3.5-2B和4B代理进行测试时,WHALE的最佳mean@8准确率比仅优化权重、仅优化框架和Fast-Slow Training高出4.15至24.38个百分点。研究还显示,小规模交错更新在准确率和运行轨迹成本方面都优于先优化权重、再优化框架的分阶段方法。代码已在GitHub发布。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。