MOSS-VL 技术报告
MOSS-VL 是一个面向实时交互的开源视觉语言模型系列。其解码器通过门控交叉注意力,在生成语音的同时处理输入视频帧。研究团队构建了合成交互语料,用于训练模型判断何时说话、保持沉默或修改回答。MOSS-VL-Realtime 在四项流式评测中的三项上,取得开源模型的最佳平均成绩;在 OmniMMI Proactive Alerting 上得分 66.0,明显高于最佳基线的 37.5。该模型拥有 113 亿参数,且视觉 token 不进入解码序列,因此随着视觉上下文增长,相较 Qwen3-VL-8B 在首 token 生成时间上的优势可从 2.8 倍扩大至 5.1 倍。项目已公开全部五个检查点、训练流程和实时推理代码。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。