Dream-RSI:通过不断演化的世界实现递归式自我改进
Dream-RSI 是一个用于可扩展、递归式改进自主 AI 智能体探索策略的框架。它将历史发现树构建为回放模拟器,使策略能够通过即时、低成本的离策略反馈进行评估和优化,而无需反复执行昂贵的在线评估。改进后的策略会重新部署,以推动后续发现,形成持续自我改进的循环。在算法工程、数学优化和 GPU 内核工程测试中,Dream-RSI 在多个场景下取得了具有竞争力或更高的发现质量,同时显著降低了发现成本。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。