原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.03796
立即前往原文

LLaDA-Image:利用完全开放的训练方案构建高性能图像生成器

LLaDA-Image 是一个统一的图像生成框架,由从零开始训练的 60 亿参数 Diffusion Transformer,以及基于扩散语言模型 LLaDA2.0-Mini 的冻结视觉语言理解模块组成。系统没有从一开始就高度依赖图文配对数据,而是先通过纯图像预训练和中期训练建立强大的视觉生成先验。训练过程使用了 2.2 亿个样本,其中包括 9800 万张真实图像。蒸馏版本 LLaDA-Image-Turbo 可通过 2 至 4 个采样步骤实现快速推理。在 Qwen-Image-Bench 上,该模型在英文和中文测试轨道中均取得开源模型的最佳成绩。团队将公开模型权重、训练代码和详细训练方案。
行业资讯 AI模型 研究 开源 2026-09-04 10:01:42 164 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。