精选9天前498 投票
DeepSeek 发布 v4-flash-vision-exp:视觉能力开放,支持图像理解与多模态交互
DeepSeek 近日发布了全新的视觉语言模型 deepseek-v4-flash-vision-exp,该模型在原有文本能力基础上新增了图像理解功能,支持用户上传图片并进行描述、OCR、图表分析等操作。模型兼容 OpenAI 的 Chat Completions 和 Responses API,开发者可通过三种方式传入图像:Base64 编码内联、外部 URL 以及文件上传。
核心能力与使用方式
新模型支持 JPEG、PNG、GIF 和 WebP 格式,格式检测基于文件内容而非文件名或 MIME 类型。用户可以通过标准的 content 数组结构同时传递文本和图像,实现多模态对话。
三种图像传入方式各有适用场景:
- Base64 编码:适合本地文件,直接嵌入请求,但受 48 MiB 请求体大小限制。
- 外部 URL:适合网络图片,模型会自行下载,URL 长度不超过 8192 字符,图片大小不超过 32 MiB,下载需在 60 秒内完成。
- 文件上传(通过 Files API):适合大文件或需要持久化存储的场景。
官方示例提供了 Python 和 curl 两种调用方式,开发者可以快速上手。
行业意义与前景
DeepSeek 此举标志着其在大模型多模态领域的进一步布局。当前,多模态能力已成为大模型竞争的关键方向,从 GPT-4V 到 Gemini,各大厂商都在强化视觉理解。DeepSeek 以开源和性价比著称,此次推出视觉模型有望降低多模态应用的门槛,吸引更多开发者和企业用户。
值得注意的是,该模型目前标注为“exp”(实验性),意味着其性能和稳定性可能仍在优化中。不过,对于希望在中文环境下构建图像理解应用的团队来说,这无疑是一个值得关注的新选项。
未来,随着 DeepSeek 不断完善视觉模型,我们或许能看到更多基于该能力的创新应用,如智能客服、内容审核、教育辅助等。



