MaLiang-Harness:以可编程方式生成图像和视频
可执行程序能够明确控制图像和视频的构建方式,但代码成功运行并不意味着生成结果符合指定的构图、外观或运动要求。研究者将这种差距称为程序到视觉(P2V)差距,并提出 MaLiang-Harness,将 MLLM 驱动的生成组织为构建、检查和修订的持续流程。该框架把程序版本、修改历史与渲染结果关联起来,使变更可追踪、可验证。在 MaLiang-IBench 上评估 11 个闭源 MLLM、在 MaLiang-VBench 上评估 4 个模型后,研究报告 GPT-6-Astra 的生成成功率达到 100%;图像任务中有 96.0%、视频任务中有 76.9% 达到全部质量门槛。结果还显示,通用能力评分无法可靠预测视觉生成表现。项目已在 GitHub 发布。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。