JEPA-TTT:面向动力学变化下规划的潜在世界模型持续测试时训练
当测试时的环境动力学与训练时不同,JEPA-TTT 会持续调整预训练、以动作作为条件的 JEPA 世界模型中的潜在动力学预测器。自监督更新会跨回合累积,同时视觉编码器和奖励头保持不变。在四个连续控制环境中的八种动力学变化下,该方法均提升了规划表现。经过 500 个测试回合后,与冻结模型相比,其自回归潜在预测误差平均降低 83%,规划表现提升 153%。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。