文章主要内容总结本文提出了一种名为KptLLM++的新型多模态大语言模型,专门用于通用关键点理解(Generic Keypoint Comprehension)。该模型旨在解决现有多模态大语言模型(MLLMs)在细粒度语义信息(如对象关键点的精确识别与分析)上的不足,通过整合视觉和文本模态,结合用户定义的指令,实现对关键点的语义理解与精确定位。KptLLM++基于“先识别后检测”(identify-then-detect)范式,先解析关键点的语义,再通过结构化的思维链推理机制定位其精确位置。为提升性能,模型在超过50万样本的大规模数据集上训练,涵盖多样的对象、关键点类别、图像风格及复杂遮挡场景。实验表明,该模型在多个关键点检测基准测试中达到当前最优性能,为细粒度图像理解和人机交互提供了统一解决方案。创新点提出通用关键点理解新问题:首次系统研究“通用关键点理解”任务,涵盖三个子任务——关键点语义理解、基于视觉提示的关键点检测(类别无关姿态估计)、基于文本提示的关键点检测(开放词汇关键点检测),增强了MLLMs在关键点级细粒度图像理解上的能力。设计KptLLM++框架:采用“先识别后检测”策略,结合大语言模型的常识知识与视觉、文本特征,统一语义理解与精确定位,通过结构化思维链推理解决视觉模糊场景(如区分左右肢体)的歧义问题。性能与语义能力的突破:通过大规模数据集训练,KptLLM++在多个基准测试中超越现有纯视觉模型和视觉-语言模型,同时具备独特的关键点语义解释能力,展现出更强