原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.16057
立即前往原文

OmniHarness:通过符号策略学习实现可泛化的视觉生成

OmniHarness是一种利用多模态大语言模型和视觉智能体提升视觉生成泛化能力的框架。它将经过验证的执行过程抽象为符号策略,保留可复用的流程和适用条件,同时移除特定实例的输入。执行过程中的中间验证可用于策略改进和失败恢复。在下游目标确定前,系统还会自主生成并执行接近自身能力上限的练习任务。在六项基准测试、三种多模态模型骨干和三种视觉智能体框架上的实验中,OmniHarness在ComfyBench创意任务上达到95.0%的解决率,比最强基线高出27.5个百分点。冻结的策略快照还可以通过即插即用方式提升现有视觉智能体系统的表现。
行业资讯 应用 AI模型 研究 2026-09-17 00:31:01 897 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。