在微信生态中,内容形态日益多元:朋友圈图文交错、公众号文章视听融合、视频流包含画面与字幕。当用户输入文字搜索时,系统如何从海量非结构化数据中精准定位?推荐算法又如何判定视频与文章是否指向同一事件?这背后的核心在于让机器理解不同形态的内容。
内容理解主要依赖两类模型:擅长复杂语义推理的大语言模型(LLM),以及将内容映射为统一数字向量的嵌入模型(Embedding)。前者如同“大脑”负责思考,后者则是在“万物”中精准检索的索引。尽管 LLM 能力强大,但其设计初衷是预测下一个词,而非度量语义相似性,且在高频检索场景下面临高昂的算力成本与延迟。因此,基于对比学习优化的专项 Embedding 模型成为业界主流,能以极低成本实现更高的搜索精度与响应速度。
基于此,微信视觉团队正式开源通用多模态嵌入模型 WeMM-Embedding。该模型包含 2B、4B、9B 三个版本,支持文本、图像、视频、视觉文档及任意多模态交错输入。在权威榜单 MMEB-v2 上,WeMM-Embedding-9B 以 80.6 分位居榜首;2B 版本得分 77.9,性能超越此前领先的 8B 开源模型。
WeMM-Embedding 性能与效率总览
前言|让不同形态的内容彼此「听懂」
文字、图片和视频在计算机底层是完全异构的数据:字符序列、像素矩阵与时间维度的组合。机器难以直接判断它们是否表达相近语义。多模态嵌入模型的核心任务,是将这些内容转换为同一向量空间中的数字序列,使语义越接近的内容,其向量距离越近。
同一语义的文字和图片向量关系
通过这种统一表示,搜索与推荐系统不再受限于单一模态。用户输入“海边日落”,系统即可跨模态检索相关图片、视频或图文内容。
早期多模态模型多采用双编码器架构,分别处理图像与文本后再对齐。然而,真实场景中的内容往往是交错的(如图文混排),双编码器难以捕捉模态间的顺序与互补关系。WeMM-Embedding 基于 Qwen3.5 多模态架构,实现了图像、视频与文字的统一联合处理。
统一建模|把图文视频放进同一条理解链路
模型将输入内容转化为 Token 序列:文字转为文本 Token,音视频转为视觉 Token,并严格保持原始顺序。对于图文交错内容,模型将其视为一条完整的多模态序列进行整体理解。
朋友圈搜索界面
为生成固定长度的统一向量,我们在输入末尾引入专用的
统一架构解决了多模态融合问题,但要适用于高精度搜索,模型还需具备区分“形似神不似”内容的能力。
两阶段训练|先建立广泛理解,再学习细微差别
WeMM-Embedding 采用两阶段训练策略:
第一阶段:广域语义构建
利用数亿规模多模态数据(涵盖自然共现图文、搜索匹配、分类及问答等任务),让模型学习将相关内容拉近、不相关内容推远。针对大规模数据中的噪声与重复问题,引入“重复感知掩码”机制,屏蔽过于相似的负样本,避免模型学习到错误信号。
WeMM-Embedding 多模态训练数据覆盖的任务与内容类型
第二阶段:细粒度区分增强
从“见得广”转向“分得细”。通过语义重采样与质量过滤,降低高频语义重复,并引入“困难负样本”(如查询红色连衣裙时,将粉色连衣裙作为负例),提升模型对颜色、属性等细微差别的辨识度。
此外,采用知识蒸馏技术,由 9B 大模型担任教师,向 2B 和 4B 小模型传授候选内容间完整的相似度分布关系,而不仅仅是正确答案。实验显示,嵌入蒸馏为 2B 模型带来 0.9 分提升,第二阶段整体优化累计提升 2.2 分,使 2B 模型在 MMEB-v2 上超越参数量为其四倍的 8B 开源模型。
精选数据、重排序监督、嵌入蒸馏等策略带来的累计收益
灵活表示|把精度与成本做成一道可调节的选择题
面对大规模检索场景,向量维度直接影响存储与计算成本。WeMM-Embedding 引入套娃表示学习(Matryoshka Representation Learning, MRL),在训练时同时优化多个维度的表现:前 64 维需独立可用,随后逐步扩展至 128、256...直至完整维度。
这种设计迫使模型按重要性排列信息:靠前维度概括核心语义,后续维度补充细节。推理时只需计算一次完整向量,业务端可根据成本需求灵活截取。实测显示,2B 模型在使用 256 维(仅为完整维度的 1/8)时,仍保留了 98.7% 的图像与视频检索性能,完美平衡了效率与精度。
不同嵌入维度下的性能保持率
开源实验|2B 超过 8B,9B 登顶 MMEB-v2
在包含 78 个数据集的 MMEB-v2 评测中,WeMM-Embedding-2B 得分 77.9,超越 Qwen3-VL-Embedding-8B(77.8);4B 版本提升至 79.2;9B 版本以 80.6 分位列第一。在图像、视频和视觉文档细分任务上,9B 版本均表现卓越。
在覆盖 190 个任务的 MMEB-v3 及 12 项公开跨模态检索基准中,WeMM-Embedding 系列模型同样表现优异。其中 2B 版本已超过所有对比开源基线,并与专有模型 Gemini Embedding 2 持平,尤其在文本检索与智能体任务上取得最高分。
WeMM-Embedding 在 MMEB-v2 上的完整评测结果
全量上线|从公开榜单走进真实业务
WeMM-Embedding 已大规模部署于微信视频号、直播、公众号、电商及朋友圈等场景,日均调用量达十亿级。模型生成的多模态表示广泛应用于候选检索、排序特征构建及跨域内容理解。
在 26 项内部任务基准测试中,2B 版本相比同规模基线从 60.9 提升至 72.0,在分类、搜索及跨域匹配等五类任务上全面领先。经过 14 次在线 A/B 测试验证,该模型对长尾内容与新发布内容的推荐效果提升显著,现已全量上线。
WeMM-Embedding 在微信内部 26 项任务上的评测结果
快速开始|三步生成多模态向量
WeMM-Embedding 已开放模型权重与推理代码,以 2B 版本为例,仅需三步即可体验:
第一步:下载代码并安装依赖
git clone https://github.com/Tencent/WeMM-Embedding.git
cd WeMM-Embedding
pip install -r requirements.txt
第二步:准备素材
准备一张图片或一段视频,并将命令中的文件路径替换为本地实际路径。
第三步:运行推理脚本
python examples/sentence_transformers_inference.py \
--model tencent/WeMM-Embedding-2B \
--image /path/to/image.jpg \
--video /path/to/video.mp4 \
--dimension 256
脚本将输出文本、图像和视频的向量表示。若不指定 dimension 参数,默认输出完整维度向量。更多部署细节请参考 GitHub 项目主页。
结语
多模态嵌入模型不仅是将内容转化为向量,更是解决多模态交错理解、细粒度相关性判断及部署成本平衡的关键技术。WeMM-Embedding 通过统一架构、两阶段训练及套娃表示学习,实现了效果与效率的双重突破。
目前,该模型已服务于微信多个核心业务场景。我们同步开放模型权重、推理代码与评测工具,期望助力更多开发者构建高效的多模态检索、推荐与智能体应用。
代码仓库:https://github.com/Tencent/WeMM-Embedding
模型集合:https://huggingface.co/collections/tencent/wemm-embedding
微信 AI
不描摹技术的酷炫,不依赖拟人的形态,微信 AI 是什么?是悄无声息却无处不在,是用技术创造更高效率,是更懂你。
微信 AI 关注语音识别与合成、自然语言处理、计算机视觉、工业级推荐系统等领域,成果对内应用于微信翻译、微信视频号、微信看一看、微信读书、微信输入法、微信搜一搜等业务,对外服务王者荣耀、腾讯视频、QQ 音乐等产品。

