Mage-VL震撼发布:40亿参数 codec-native 多模态模型如何颠覆实时视频理解?

📅 2026/7/31 20:31:15
Mage-VL震撼发布:40亿参数 codec-native 多模态模型如何颠覆实时视频理解?
Mage-VL震撼发布40亿参数 codec-native 多模态模型如何颠覆实时视频理解【免费下载链接】Mage-VL项目地址: https://ai.gitcode.com/hf_mirrors/microsoft/Mage-VLMage-VL 是一款 codec-native 的主动流多模态基础模型专为图像和视频理解打造其视觉编码器以紧凑的 40 亿参数规模完全从头开始训练。它旨在解决现代 VLMs 的“莫拉维克悖论”——在复杂的离线推理方面表现出色但在简单的实时流感知上速度慢且计算量大。核心特性 codec-native 架构的突破Mage-VL 摒弃了将视频解码为均匀采样帧并将密集的补丁标记通过冻结的网络预训练 ViT 的传统方式而是遵循现代视频编解码器的结构将流分离为锚定I帧和预测P帧保留每个锚定补丁并仅保留编解码器花费比特的预测帧补丁——即携带真实运动和新细节的区域。这种编解码器对齐的稀疏性使 Mage-VL 能够以传统方法 1/10 的计算成本处理实时视频流。从 scratch 训练的视觉编码器我们还发布了microsoft/Mage-ViT——来自两阶段从头开始 ViT 预训练的独立视觉编码器。这仅是ViT 预训练检查点它尚未与语言模型进行联合 VLM 训练。您可以将其用作数据高效的 codec-native 视觉编码器或作为您自己的多模态训练的即插即用 ViT。模型描述架构Mage-ViTcodec-native 视觉编码器——仅 ViT 预训练无 VLM 联合训练Codec-ViT从头开始主动流框架智能感知与响应主动流框架——Mage-ViT 将连续流增量编码为事件门和因果解码器共享的 codec-native 视觉特征。该门对每个滚动窗口进行评分并在常规内容上保持静默当它打开时解码器会发出事件条件响应。这种机制确保模型仅在关键事件发生时才进行处理和响应大大提高了实时性和效率。实际应用SoccerNet 响应时间测试在 SoccerNet 测试中Mage-VL 在 StreamMind 协议、codec-native 输入和零容忍画布匹配的条件下展现出了出色的响应时间表现。加粗部分表示列中最佳结果充分证明了其在实时视频理解任务中的优势。如果您想体验 Mage-VL 的强大功能可以通过以下命令克隆仓库git clone https://gitcode.com/hf_mirrors/microsoft/Mage-VL开始探索这一颠覆性的多模态模型。【免费下载链接】Mage-VL项目地址: https://ai.gitcode.com/hf_mirrors/microsoft/Mage-VL创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考