爱可可-爱生活
26-08-22 08:28 微博认证:AI博主 2025微博新锐新知博主

【DeepSeek长了眼:是真进化还是加了滤镜?】DeepSeek发布了实验性的多模态模型V4-Flash-Vision,这标志着这家以性价比著称的厂商正式补齐了视觉短板。核心机制很有意思:所有大图入炉前都会被自动压缩到800x800像素左右,单张图片Token消耗上限锁死在384个。这意味着一块钱能处理约2500张图,价格依然是屠夫级别。但社区评论对这副“眼镜”的清晰度意见不一。在经典的钟表识别测试中,它与Qwen等模型一样表现出“参差的智能”——有时能精准读出8:09:25,有时却在时分秒针的长度辨析上栽跟头。解剖其底层逻辑,800像素的上限确实会扼杀诸如复杂电路图、精密OCR等高分辨率需求。不过,圈内人已经玩出了“局部放大”的骚操作:让模型先看全局缩略图,再通过Tool Call调用裁剪工具查看特定坐标的高清切片。对开发者来说,这不仅仅是能看图说话那么简单。视觉能力的引入闭环了UI自动化和前端开发的反馈回路。以前模型写完代码只能盲猜效果,现在它可以自己截图、对比设计稿、发现错位并自动修正。虽然在识别小众地标等“百科常识”上还不如字节的Seed模型稳健,但作为一款侧重Agent和代码能力的Flash模型,它提供的不是无所不知的上帝视角,而是一个能帮你跑通开发闭环的实用工具。如果你追求的是高精度视觉理解,现阶段可能还得靠多级裁剪的工程化手段来弥补模型的分辨率焦虑。

发布于 中国澳门