8月31日,DeepSeek在Hugging Face上线了实验性多模态模型DeepSeek-V4-Flash-Vision-Exp。它重新定义了多模态,开源内容完整,先卖API再开源,多模态能力表现亮眼。
该模型是V4家族第一款实验性多模态模型,有305B参数。传统多模态模型聚焦视觉问答,而它重点是让Agent读取视觉信息并结合工具执行任务,这双「眼睛」是给Agent用的。
开源内容涵盖模型权重、Tokenizer等核心模块。社区动作迅速,Hugging Face页面已出现7个量化版本,方便开发者进行本地部署和二次开发。
8月21日先上线DeepSeek API,当时只能调用不给权重,十天后权重放出。这种节奏体现了DeepSeek对模型的定位和推广策略。
加入视觉能力后,纯文本Agent能力基本未受影响且有所提升,多模态Agent提升更明显。不过在NL2Repo上与Opus - 4.8有差距,官方措辞克制。
DeepSeek正构建完整的Agent技术栈,模型、Harness、Vision各有作用,开源是最后一块拼图,有望推动多模态技术在Agent领域的发展。
编辑观点:DeepSeek此次上线多模态模型,重新定义赛道且开源完整,虽未全面超越竞品,但多模态能力提升显著,其构建技术栈的策略值得关注,未来或在多模态Agent领域有更大作为。