deepseek刚发了个DeepSeek-OCR的新模型。
这么看起来,DeepSeek v4应该是个多模态模型了。
-----
看论文,该模型的重点不在ocr,而是提出了一种新的方法,来让模型处理长上下文时占用更少的资源。大概是一张包含大量文字的图片可以用比原始数字文本少得多的“vision tokens”来表示 。因此,通过视觉语言模型 (VLM) 将文本“渲染”成图片(光学压缩),再让模型从图片中“读取”恢复出文字(解压缩),有望大幅降低处理长文本的成本 。
发布于 山东
