阿里发布 Qwen3.8-Omni-Flash 多模态模型,支持百万 Token 上下文
阿里发布 Qwen3.8-Omni-Flash 原生多模态模型,可同时处理文本、图像、音频和视频,支持 100 万 Token 上下文。阿里称,该模型在 30 项评测中的平均成绩较 Qwen3.5-Omni-Plus 提升超过 26%。官方公布的改进覆盖音视频 Agent、编程、长程任务、长音视频理解和会议分析等场景。API 音频输入价格下降超过 98%,音视频输入价格下降超过 93%。阿里还开源 Qwen-MM-Plugins 和 Qwen-Live Harness,用于长流程工作和持续多模态交互。Realtime 版本可在处理音视频流的同时完成响应和工具调用,并据称能结合空间声音与视觉信息判断声源位置。相关性能数据和对比结果均来自官方测试,尚未经过独立验证。
本文来源:IT之家,仅供学习参考,版权归原作者所有。