跟大家汇报个成果,微信视觉团队最近开源了一个多模态模型叫 WeMM-Embedding,简单说就是让系统能同时理解文字、图片和视频,把它们放在同一个语义空间里去比较和检索。
这个模型已经在微信里大规模用了——朋友圈搜索、视频号推荐、公众号推荐、微信电商都在用,每天调用量10亿次。在国际权威榜单 MMEB-v2 上拿了第一,超过此前所有已提交的开源与闭源模型。
本次开源同步发布2B、4B、9B三个版本的模型权重、推理代码与技术报告,欢迎有需要的朋友去试试
发布于 广东
