Simon的白日梦
26-09-02 15:11 微博认证:科技博主

分享微信团队开源的多模态Embedding模型,可以把文本、图片、视频、视觉文档都Embedding到同一个向量空间。

WeMM-Embedding,微信视觉团队的通用多模态 Embedding 模型

微信视觉团队的通用多模态 embedding。同一套向量覆盖文本、图片、视频、视觉文档和交错输入,2B / 4B / 9B,支持 Matryoshka 截断。向量取最后一层 token 再 L2,暂不支持音频。2B 在 MMEB-v2 平均 77.9(图 79.6 / 视频 70.8 / VisDoc 80.7),9B 平均 80.6。MMEB-v3 全任务 2B 56.0、9B 59.5,音频项记 0。推理建议 transformers==5.2.0,也可走 Sentence Transformers、vLLM、SGLang。2B 截到 256 维,图像和视频成绩仍有全维度的 98.7%。

🔗 链接:http://t.cn/AXpHmjRA(项目)
🤗 Hugging Face:http://t.cn/AXpHmjRZ(合集)
📄 论文:http://t.cn/AXper7bm(论文)

#HOW I AI# #ai生活指南# #效率工具#

发布于 广西