原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.34309
立即前往原文

MaLiang-Harness:以可编程方式生成图像和视频

可执行程序能够明确控制图像和视频的构建方式,但代码成功运行并不意味着生成结果符合指定的构图、外观或运动要求。研究者将这种差距称为程序到视觉(P2V)差距,并提出 MaLiang-Harness,将 MLLM 驱动的生成组织为构建、检查和修订的持续流程。该框架把程序版本、修改历史与渲染结果关联起来,使变更可追踪、可验证。在 MaLiang-IBench 上评估 11 个闭源 MLLM、在 MaLiang-VBench 上评估 4 个模型后,研究报告 GPT-6-Astra 的生成成功率达到 100%;图像任务中有 96.0%、视频任务中有 76.9% 达到全部质量门槛。结果还显示,通用能力评分无法可靠预测视觉生成表现。项目已在 GitHub 发布。
行业资讯 研究 2026-09-30 10:31:09 966 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。