CNMO科技
26-08-21 19:57 微博认证:CNMO科技官方微博

【#DeepSeek V4-Flash-Vision-Exp上线#】8月21日消息,深度求索宣布,全新的多模态视觉理解模型DeepSeek-V4-Flash-Vision-Exp正式上线DeepSeek API平台。作为一款实验性质的模型,该模型在保留文本理解、推理和Agent能力的同时,进一步加入视觉理解能力,用户可以通过API直接调用。此次更新也意味着DeepSeek进一步将多模态能力向Agent应用场景延伸,为PPT制作、网页开发以及前端创意等任务提供新的模型能力支持。

从官方公布的信息来看,DeepSeek-V4-Flash-Vision-Exp的核心特点在于兼顾文本和多模态能力。在Agent、推理、世界知识等纯文本任务中,该模型的表现与DeepSeek-V4-Flash正式版基本持平,并没有因为增加视觉能力而明显牺牲文本处理能力。而在需要理解图像内容的Agent Benchmark中,新模型相比DeepSeek-V4-Flash则实现了明显提升,多模态Agent能力已经接近Opus-4.8。

在实际应用方面,深度求索展示了多个使用案例。其中一个场景是借助Agent框架制作商业定制西藏自驾游PPT。用户可以直接提出包括路线、行程周期、目标客户以及视觉风格在内的复杂要求,模型随后结合多模态能力完成内容和视觉呈现。另一个案例则是对DeepSeek Harness官网进行二次创作,通过黑蓝深海、玻璃UI以及ASCII原子像素等视觉元素,在多轮交互后生成具有未来主义风格的开发者网站。此外,模型还可以用于制作动态前端Mini Demo,例如按照“3D黏土小怪物加入复古舞池派对”的创意生成相应的动态视觉效果。

从这些案例可以看出,此次升级的重点并不只是让模型具备“看图”能力,而是希望将视觉理解进一步融入Agent工作流程。对于需要同时处理文字、图片、网页以及代码的任务而言,模型能够理解视觉信息后,可以进一步参与内容生成、页面设计和交互开发,从而覆盖更多此前主要依靠文本模型完成效果有限的使用场景。

API服务方面,开发者可以通过设置model='deepseek-v4-flash-vision-exp'调用这一实验模型。图片在API服务中会转换为Token并按照Token计费,单张图片最多占用384个Token,整体计费价格与DeepSeek-V4-Flash保持一致。接口目前支持Chat Completions、Messages和Responses三种调用格式,并支持图文混合输入。图片既可以通过Base64内联方式传入,也可以使用外部URL或Files API进行调用,因此能够适配不同的Agent开发框架和应用场景。

与此同时,深度求索还宣布Files API正式开放,而且该API本身不收取费用。开发者可以提前将图片上传至平台,之后在API请求中直接通过file_id引用对应文件,无需在每一次请求中重复上传同一张图片。对于需要反复调用相同素材的Agent应用而言,这种方式能够减少重复传输带来的带宽开销,也有助于简化开发流程。

发布于 北京