字节:抖音多模态嵌入模型DME

📅 2026/8/11 11:09:04
字节:抖音多模态嵌入模型DME
标题Douyin Multimodal Embedding Model Technical Report来源arXiv, 2608.02148v1️文章简介研究问题如何在亿级索引的工业级多模态检索中同时实现双编码器的高效推理与细粒度语义判别能力主要贡献论文提出抖音多模态嵌入模型DME通过两阶段训练结合证据引导的隐式推理与交叉条件重建在保持低延迟的同时显著提升了细粒度检索性能。重点思路采用两阶段训练框架。第一阶段利用2500万大规模异构数据进行对比预训练建立统一的多模态嵌入空间第二阶段在500万高质量数据上引入语义充分性学习增强嵌入的细粒度表达能力。引入证据引导的类型化隐式推理机制。在查询端通过锚点Token定位检索相关证据如文本片段、图像区域并利用类型化的隐状态组织检索逻辑如定位、对齐、拒绝最终融合生成嵌入向量避免显式生成思维链带来的高延迟。设计交叉条件重建目标。在训练阶段利用查询嵌入作为前缀重构文档侧文本反之亦然并结合下一词预测和多词预测技术。该机制强制嵌入保留对端的细粒度语义信息确保输入内容可从嵌入中恢复但推理时不增加额外计算开销。分析总结在MMEB-v2基准测试中DME-2B和DME-9B分别取得74.8和78.4的最高分尤其在视频和视觉文档检索任务上优势明显优于同规模的其他多模态嵌入模型及推理增强基线。消融实验表明大规模对比预训练奠定了良好的几何基础隐式推理机制显著提升了视频检索效果而交叉条件重建则在所有模态上带来了均衡的性能增益验证了各组件的有效性。通过表示完整性度量发现DME嵌入具有高度的信息完备性能够从单向量中高准确率地重建自身及对端内容证明了其语义充分性。在抖音真实生产环境中离线评估显示整体得分相对提升2.92%在线A/B测试证实核心业务指标获得0.1%的生命周期增益且隐式推理仅带来毫秒级的查询编码延迟满足工业部署需求。个人观点传统对比学习缺乏细粒度监督而显式思维链推理虽精准但耗时。DME通过将推理过程“隐藏”在编码器内部的少量潜变量中并利用生成式重建作为训练时的强监督信号既保留了双编码器的高效接口又注入了大模型的细粒度理解能力。