SenseNova-U1.5:迈向原生统一视觉智能
SenseNova-U1.5是一款8B-MoT多模态模型,采用无编码器、无VAE的架构,用于理解、推理和生成视觉内容。模型支持最高4K原生分辨率,并针对图像保真度、文字渲染、复杂构图、多参考图像编辑、交错生成和结构化视觉指令进行了优化。多个专用专家分别增强视觉美学、双语文字渲染、信息图生成和图像编辑能力,再通过多专家on-policy蒸馏进行整合。开发团队表示,模型在多项评测中取得改进,并计划开源包括监督微调、强化学习和on-policy蒸馏在内的训练代码。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。