DeepSeek 开源多模态模型 DeepSeek-V4-Flash-Vision-Exp
DeepSeek 已在 Hugging Face 以 MIT 许可证开源 V4 系列首个多模态模型 DeepSeek-V4-Flash-Vision-Exp。公开内容包括模型文件、Tokenizer、Prompt Encoding 参考实现,以及覆盖视觉编码器、MoE 和注意力机制等核心模块的最小化 PyTorch 推理实现。该实验版本除文本外还支持输入 JPEG、PNG、GIF 和 WebP 图片,可用于图片描述、识别截图文字和分析图表。DeepSeek 表示,该模型在纯文本、Agent 和推理任务上的表现与正式版 V4-Flash 持平,在视觉 Agent 基准测试中则有明显提升。公司称其多模态 Agent 能力已接近 Opus 4.8。
本文来源:IT之家,仅供学习参考,版权归原作者所有。