8 月 31 日,DeepSeek 在 Hugging Face 上线了 DeepSeek-V4-Flash-Vision-Exp,MIT License,V4 家族第一款实验性多模态模型。305B 参数,基于 V4-Flash-0731 底座,在原有语言模型上接入了视觉编码器和 Aligner,经过持续训练获得图像理解能力。 值得注意的恰恰是「多模态」这个词在这里被重新定义了。传统多模态模型的主场是视觉问答——识别图片里有什么、回答关于图片的问题。DeepSeek 给这个 Vision 版本划的赛道完全不同:官方介绍里重点强调的是 Multimodal Agent Capabilities,让 Agent 直接读取网页截图、软件界面、图表这些视觉信息,再结合工具调用继续执行任务。 也就是说,这双「眼睛」不是给人看的,是给 Agent 用的。 开源内容相当完整。模型权重、Tokenizer、Prompt Encoding 参考实现,还有一份最小化的 PyTorch 推理实现,覆盖了视觉编码器、Aligner、DFlash Attention、MoE、Hyper-Connections、DSpark 等核心模块。社区动作也快,Hugging Face 页面上已经出现了 7 个面向 llama.cpp、LM Studio、Ollama 的量化版本。 时间线上有个细节。8 月 21 日,这个模型就先上线了 DeepSeek API——当时只能调用,不给权重。开发者可以通过 API 同时输入文字和图片,图片按 Token 计费,DeepSeek Harness 0.1.1 也在同一天加了原生支持。十天之后,权重才真正放出来,本地部署和二次开发由此成为可能。 先卖 API 再开源,这个节奏本身也在说明 DeepSeek 对它的定位。 看 benchmark 更有意思。加入视觉能力之后,纯文本的 Agent 能力基本没受影响:Terminal Bench 2.1 从 82.7 涨到 83.9,DeepSWE 从 54.4 涨到 59.3,反而超过了 Opus-4.8 的 58.0。多模态 Agent 的提升更明显:ApexBench Pass@1 到 36.5,Agents' Last Exam 27.3 超过了 Opus-4.8 的 25.7,ZeroBench Pass@5 也以 35.0 压过 34.0。 但 DeepSeek 没有像某些发布会那样宣布「全面超越」。NL2Repo 上它 57.7,Opus-4.8 是 69.7,差距不小。官方措辞克制:「多模态 Agent 能力接近 Claude Opus 4.8」,而非全面超过。 把最近的几次更新串起来看,DeepSeek 正在拼一套完整的 Agent 技术栈:模型负责推理和工具调用,Harness 负责持续执行任务,Vision 则让 Agent 能直接读到电脑世界里的视觉信息。开源,是这套拼图的最后一块落子。 参考来源: DeepSeek-V4-Flash-Vision-Exp — Hugging Face
DeepSeek 开源的第一个多模态模型,不是拿来「看图说话」的
来源:开源中国
2026年09月01日 16:01
0 阅读
分享到: