小小白Pro
26-08-21 17:41 微博认证:数码博主

DeepSeek 今日正式上线了一款实验性多模态视觉理解模型 DeepSeek-V4-Flash-Vision-Exp,同步登陆 DeepSeek API 平台开放服务:

性能表现上,DeepSeek-V4-Flash-Vision-Exp 模型的纯文本 Agent、推理、世界知识等能力与 DeepSeek-V4-Flash 正式版持平,其中 Terminal Bench 2.1 得分 83.9,Toolathlon-Verified 得分 75.9;新增视觉理解能力后,多模态 Agent 性能实现大幅跃升,ApexBench Pass@1 得分 36.5,Agents' Last Exam 得分 27.3,整体多模态 Agent 能力已接近 Opus-4.8 水平。该模型可适配各类 Agent 框架,支持商业定制 PPT 生成、网页视觉重构、前端特效 Demo 开发等多场景应用。

API 计费与调用规则上,输入图片将转换为 token 计费,单张图片最多占用 384 tokens,定价与 V4-Flash 模型一致。接口支持 Chat Completions、Messages、Responses 三种调用格式,可便捷接入各类 Agent 工具,兼容图文混合输入,同时提供 base64 内联、外部 URL、Files API 三种图片传入方式。

Files API 现已免费开放,用户可提前上传图片至平台,再通过 file_id 在请求中引用,以节省带宽,同一张图片支持多次复用无需重复上传。

发布于 四川