动作识别大模型

📅 2026/8/2 13:42:12
动作识别大模型
70B 参数以内「动作识别」模型选型截止 2026 年 8 月开源先区分两条路线选型最重要前提纯动作分类闭集 / 给定类别、不需要自然语言描述专用视频基础模型 通用 Video-LLM开放集动作识别、视频问答、动作时序描述、自然语言输出选视频大语言模型VideoLLM所有模型参数均70B不含 72B/70B 档位一、【首选路线 1专用视频基础模型分类任务天花板】适合安防行为识别、体育动作分类、Kinetics/UCF101 微调、特征提取、零样本动作检索 综合最强InternVideo2-6B智源参数6B优势时序建模业内标杆原生针对视频运动预训练K400 零样本 / 微调指标碾压同规模通用多模态模型支持动作特征抽取、时序定位、视频检索基准K400 Finetune Top192.1%细粒度动作区分强运动模糊、快速动作鲁棒性优于 Qwen/LLaVA 系列缺点不是对话模型无法直接自然语言问答只能输出特征 / 分类结果需要自己封装 LLM 做上层理解适用离线动作数据集训练、视频特征库、工业行为分类备选轻量InternVideo2-1B算力紧张首选性价比极高次选ViCLIPInternVideo 衍生主打零样本开放集动作检索不需要微调直接文本 - 视频动作匹配适合不知道动作类别、开放词汇检索场景二、【首选路线 2通用 Video-LLM开放集 自然语言动作理解绝大多数开发者需求】适合输入视频 → 自然语言输出「识别动作、先后顺序、细粒度动作差异、多人动作」零样本直接推理不用重新训练分类头 综合第一中文 时序动作均衡Qwen2.5-VL-7B-Instruct阿里通义千问参数7B优势 ✅ 中文理解最强社区生态最完善、推理框架vLLM/llama.cpp全面支持 ✅ 动态帧采样原生支持长视频连续动作序列识别稳定幻觉相对可控 ✅ 商用友好开源协议硬件门槛低单卡 24G 可 4bit 量化运行短板极高速细微动作类似动作区分略弱于 InternVideo2纯零样本分类基准弱于专用视频模型最佳场景通用视频动作问答、监控画面行为描述、人机交互视频分析 时序运动理解专项更强LLaVA-OneVision-2 7B参数7B优势改进时序注意力机制跳跃动作、高速运动、短时连续动作识别显著优于原版 LLaVA-Video、早期 Qwen-VL JumpScore 运动基准大幅领先擅长区分细微相似动作挥手 / 拍打、慢跑 / 快走短板中文能力弱于 Qwen长视频上下文容易丢失时序信息 动作识别专项微调版学术场景LLaVAction-7B基于 LLaVA-Video 专门在 EPIC-KITCHENS 动作数据集微调厨房、人手操作、精细交互动作效果极强。 缺点通用场景泛化一般只适合近距离人体手部动作。进阶备选VideoLLaMA3-7B音频 视频多模态如果你需要结合声音辅助动作识别尖叫、撞击 行为优先选它纯视觉动作略逊 OneVision2三、如果算力充足上限更高仍然 70BInternVideo2-Chat-34B34B 视频对话模型融合 InternVideo 强大时序编码器 语言头70B 以内视频时序理解天花板高速运动、多人复杂动作序列最强。 缺点显存要求高4bit 至少 32G 显存推理成本高于 7B 模型。最简选型速查表直接对照场景选表格使用场景最优模型闭集动作分类、数据集微调、视频特征提取InternVideo2-6B零样本开放集动作检索无训练数据ViCLIP中文环境、视频动作自然语言问答通用项目最常用Qwen2.5-VL-7B-Instruct大量高速运动、细微动作区分体育、格斗、肢体动作LLaVA-OneVision-2 7B手部精细操作、厨房 / 装配动作识别LLaVAction-7B需要音频 视频联合识别动作VideoLLaMA3-7B不差算力、追求 70B 以内动作理解极限InternVideo2-Chat-34B重要避坑提醒不要混淆「图像多模态模型」和原生视频模型普通静态 VLLLaVA1.5、Qwen-VL 初代只是抽多张图没有时序建模动作识别效果很差务必选原生 Video 版本。通用 Video-LLM 做大规模标准化动作分类任务性能永远低于 InternVideo 这类专用视频基础模型优先区分任务不要盲目用对话大模型做分类。开放集工业落地最佳组合方案InternVideo2(特征提取动作候选) Qwen2.5-VL-7B(自然语言校验、动作描述、逻辑推理)如果你告诉我是否需要中文、显卡显存、是做分类还是视频问答、是否允许微调我可以直接给出唯一最优选择 推荐推理参数采样帧数、量化方案。