OmniHarness:通过符号策略学习实现可泛化的视觉生成
OmniHarness是一种利用多模态大语言模型和视觉智能体提升视觉生成泛化能力的框架。它将经过验证的执行过程抽象为符号策略,保留可复用的流程和适用条件,同时移除特定实例的输入。执行过程中的中间验证可用于策略改进和失败恢复。在下游目标确定前,系统还会自主生成并执行接近自身能力上限的练习任务。在六项基准测试、三种多模态模型骨干和三种视觉智能体框架上的实验中,OmniHarness在ComfyBench创意任务上达到95.0%的解决率,比最强基线高出27.5个百分点。冻结的策略快照还可以通过即插即用方式提升现有视觉智能体系统的表现。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。