原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://www.ithome.com/0/996/637.htm
立即前往原文

DeepSeek 开源多模态模型 DeepSeek-V4-Flash-Vision-Exp

DeepSeek 已在 Hugging Face 以 MIT 许可证开源 V4 系列首个多模态模型 DeepSeek-V4-Flash-Vision-Exp。公开内容包括模型文件、Tokenizer、Prompt Encoding 参考实现,以及覆盖视觉编码器、MoE 和注意力机制等核心模块的最小化 PyTorch 推理实现。该实验版本除文本外还支持输入 JPEG、PNG、GIF 和 WebP 图片,可用于图片描述、识别截图文字和分析图表。DeepSeek 表示,该模型在纯文本、Agent 和推理任务上的表现与正式版 V4-Flash 持平,在视觉 Agent 基准测试中则有明显提升。公司称其多模态 Agent 能力已接近 Opus 4.8。
行业资讯 应用 行业新闻 AI模型 研究 开源 2026-08-31 20:00:04 162 阅读 阅读约 1 分钟 来源:IT之家
本文来源:IT之家,仅供学习参考,版权归原作者所有。