HMR3D: Hierarchical Multimodal Representation for 3D Scene Understanding with Large Vision-Langua...

📅 2026/8/15 13:41:43
HMR3D: Hierarchical Multimodal Representation for 3D Scene Understanding with Large Vision-Langua...
一、文章主要内容总结本文针对现有基于视觉语言模型(VLM)的3D场景理解方法存在的3D数据稀缺、空间关系建模复杂导致的特征对齐不足等问题,提出了一种名为HMR3D的分层多模态表示框架。该框架通过输入级显式对齐策略,将3D场景转化为VLM原生支持的文本描述和多视角图像,结合分层特征聚合机制,实现更有效的3D场景推理。核心流程包括:3D场景文本描述生成:利用Mask3D模型进行实例分割,提取物体类别及3D坐标,生成结构化文本,将空间关系以自然语言形式呈现;多视角图像渲染与分层特征提取:从鸟瞰图和前、后、左、右四个方向渲染图像,通过注意力机制将图像补丁级特征聚合为视图级和场景级特征,兼顾局部细节与全局上下文;多模态融合与训练:将文本描述、分层视觉特征与问题/场景上下文拼接输入VLM(基于Qwen-VL 2.5 7B微调),采用自回归生成方式训练模型。实验验证:在情境化3D问答数据集SQA3D和通用3D问答数据集ScanQA上均实现SOTA性能,消融实验验证了文本描述、多视角图像及分层聚合机制的互补性和有效性。二、文章创新点输入级显式对齐策略:摒弃传统将3D特征投影到VLM嵌入空间的隐式对齐方式,通过文本描述(物体坐标+空间关系)和多视角图像,让VLM在原生模态中推理,避免几何信息丢失;分层多模态表示