DeepSeek多模态模型能否用于图片分析和图表理解?

2026-08-22 09:47 来源:新浪AI前沿速递

  一、模型核心能力与定位

  视觉输入正式开放:DeepSeek-V4-Flash-Vision-Exp支持文字+图片混合输入,能够描述图片内容、识别截图文字、分析图表等,支持的图片格式包括JPEG、PNG、GIF、WebP。

  纯文本能力不缩水:该模型在Agent、推理、世界知识等文本能力方面与DeepSeek-V4-Flash正式版持平,视觉能力的加入并未削弱原有强项。

  多模态Agent能力跃升:在需要视觉理解的Agent Benchmark上,该模型相比DeepSeek-V4-Flash实现大幅跃升,多模态Agent能力已接近Opus-4.8。

  二、图片分析与图表理解的实战表现

  专业图表解读:在Chartography等专业图表理解基准测试中表现出色,能够处理医学、工程、金融等真实专业图表,有效识别数据趋势、计算同比差值并生成文字分析报告。

  文档与截图解析:可精准识别打印体与部分手写体文字,支持解析代码报错截图、产品说明书、财务报表等场景,实现从“看懂”到“分析”的跨越。

  视觉推理具备深度:实测中能对图像逻辑进行推理判断,如图表识别后能进行完整的商业分析,指出产品增长建议,说明其并非简单OCR,而是真正的多模态理解。

  三、开发者接入与计费方式

  API调用方式:开发者可通过设置model='deepseek-v4-flash-vision-exp'访问模型,支持base64编码、图片链接和文件ID三种图片传入方式。

  成本控制突出:图片按token计费,单图最高384 tokens,价格与V4-Flash纯文本模型一致,定位为经济主力版本。

  配套免费Files API:同步上线免费的Files API,图片上传一次即可重复调用,降低了开发者的接入成本。