EmbeddingGemma 2 的效果还是蛮不错的,“照藏”的照片处理管线已经加上了这个 Embedding。
虽然现在只能搜索“照藏”里的照片,但以后还会 Embedding 更多的音视频和文字数据。再写一个搜索所有向量库的语义搜索器也不是特别复杂的事情。
DINOv3 中午就加好了,图1中出现的“x15展开”效果就是利用了 DINOv3。
用两套 embedding 模型会不会冗余了呢?我觉得不算。两种模型的“相近”还是有不少区别的。DINOv3 更偏向纯视觉特征,说不定可以用来找到构图相似的两张图。而 EmbeddingGemma 2 更多还是在语义上做匹配。
发布于 广东
