← 返回总览

Tencent/WeMM-Embedding

WeMM-Embedding is a family of universal multimodal embedding models by the WeChat Vision Team at Tencent, supporting multimodal understanding and retrieval.

1,000Fork: 74语言: Python协议: NOASSERTIONGitHub ↗

📈 Star 增长趋势(本站收录历史)

02505007501K08-2908-3008-3109-01Tencent/WeMM-Embedding 2026-08-29: 888Tencent/WeMM-Embedding 2026-08-30: 930Tencent/WeMM-Embedding 2026-08-31: 989Tencent/WeMM-Embedding 2026-09-01: 1K
Tencent/WeMM-Embedding

🤖 深度介绍

它是什么

WeMM-Embedding 是腾讯微信视觉团队推出的通用多模态嵌入模型家族,主打「图文统一表征」。它能将图像、文本甚至混合内容映射到同一向量空间,直接服务于多模态检索、图文排序等场景,本质上是给大模型装上了「跨模态搜索引擎」。

核心亮点

  • 统一嵌入空间:无需分模态建模,单模型即可完成图文互检索,告别传统双塔架构的割裂感。
  • 多模态 LLM 底座:基于多模态大语言模型构建,天然理解复杂语义(如「戴墨镜的猫」),而非简单像素匹配。
  • 家族化设计:提供不同尺寸和精度版本,方便按算力与业务需求灵活选型。

为什么火

多模态检索长期被 CLIP 类模型主导,但它们在细粒度语义和复杂推理上明显乏力。WeMM-Embedding 直接复用 LLM 的推理能力,把「看图说话」升级为「理解后检索」,在学术基准和工业场景中均刷新 SOTA,且背靠腾讯微信生态,实战验证充分。

适合谁用

  • 搜索/推荐工程师:需要做图文混合排序、以图搜图或商品匹配。
  • 多模态应用开发者:想快速构建支持视觉问答的 RAG 系统。
  • 算法研究员:希望对比或借鉴多模态嵌入新范式。

快速上手

pip install transformers torch
# 加载模型(示例伪代码)
from transformers import AutoModel
model = AutoModel.from_pretrained("tencent/WeMM-Embedding-Base")
# 输入图像和文本,直接获取对齐向量
img_emb = model.encode_image("photo.jpg")
text_emb = model.encode_text("一只在草地上的狗")
similarity = (img_emb @ text_emb.T).item()

完整示例见仓库 examples/ 目录,支持 HuggingFace 一键加载。