从『分割』到『理解』SAM3 到底看懂了什么开放词汇与全实例分割的真相【免费下载链接】sam3项目地址: https://ai.gitcode.com/hf_mirrors/facebook/sam32025 年底Meta 放出 Segment Anything 家族第三代模型 SAM 3同期还有 SAM 3D。社区的第一反应几乎都是同一个疑问一个分割一切的工具模型凭什么被冠以开始理解世界的说法从 CSDN 的万字硬核解读到智源社区报道的30 毫秒处理 100 个检测对象、性能提升 2 倍再到 36 氪以ICLR 2026 重磅为题的报道舆论焦点一致落在了两个关键词上开放词汇Open-Vocabulary与可提示概念分割PCS。但理解这个词究竟是营销话术还是模型架构里真金白银的能力本文以仓库真实配置与官方 README 为证据逐层拆开 SAM3 的架构与任务定义回答三个问题它凭什么敢说开放词汇存在性判断在代码里长什么样以及——实测下来它到底看懂了什么、又没看懂什么。一、从『分割』到『理解』SAM3 的任务升级要判断理解是真是假先要看任务定义是否发生了变化。仓库 README.md 开篇给出了 SAM 3 的官方定位SAM 3 is a unified foundation model for promptable segmentation in images and videos. It can detect, segment, and track objects using text or visual prompts such as points, boxes, and masks.关键变化在其后的两句相比前代 SAM 2SAM 3 引入了穷尽式分割能力——用一句短语或若干示例exemplars作为提示把图像中所有匹配该开放词汇概念的实例全部找出来并且官方在自建基准SA-CO上声称达到了人类水平的 75%–80%该基准包含27 万个独立概念是现有同类基准的50 倍以上。这背后是任务范式的切换范式全称SAM 2SAM 3PVSPromptable Visual Segmentation✅ 交互式分割单实例✅ 兼容即 TrackerPCSPromptable Concept Segmentation❌✅ 概念驱动的全实例分割PVS 时代模型回答的问题是我点的这个位置属于哪个物体PCS 时代问题变成了图像里所有属于这个概念的东西在哪里。前者是几何定位后者是概念检索——这正是社区把 SAM 3 描述为从分割走向语义理解的事实基础。二、开放词汇的能力来源CLIP 文本塔与『概念即提示』开放词汇不是营销词它在仓库配置里有非常具体的落点。tokenizer_config.json 显示SAM 3 使用CLIPTokenizer词表来自 vocab.json49408 个 BPE token并设置do_lower_case: true、model_max_length: 32——即文本提示最长 32 个 token。config.json 中text_config给出了完整规格一个 24 层、隐藏维度 1024、投影维度 512 的clip_text_model。这意味着三件事提示词不再需要注册。传统分割模型只能输出训练时定死的类别SAM 3 用 CLIP 式文本编码器把任意英文短语映射到与视觉特征对齐的向量空间laptopdialear这类未在分割训练中显式见过的词只要 CLIP 语言侧能理解就能成为分割条件。这就是开放词汇的本质词汇量由 CLIP 的词表与语义空间决定而非由分割标注决定。文本只是其中一种提示模态。README 同时支持用图像示例exemplars作为概念提示——同一概念既可以用ear这个词表达也可以用一张耳朵图片表达两条路径都通向同一个概念表征。能力的边界也写在配置里。32 token 上限意味着短语级提示而非自由文本英文 BPE 词表 小写化意味着直接喂中文提示效果存疑社区多篇镜像部署文章都在强调使用英文 Prompt恰恰印证了这一点。三、存在性判断一个use_presence_token背后的事实社区报道反复提到 SAM 3 具备存在性判断能力——即模型不仅能分割目标还能回答这个概念在场景里存在还是不存在。如果只在论文里出现这确实容易被当作话术但在 config.json 的detr_decoder_config中有一个直白的开关num_queries: 200, use_presence_token: trueSAM 3 的检测主干是一个概念条件下的 DETR 式解码器200 个 query 在文本或视觉示例条件的引导下各自预测是否存在匹配实例 对应框/掩码。use_presence_token: true正是为每个 query 配备存在性判定的实现——模型输出里天然携带该位置是否命中概念的信号从而支持场景中没有这个概念 → 返回空集的负例回答。配套参数进一步佐证了检测 分割一体的架构事实det_nms_thresh: 0.1实例去重 NMS、score_threshold_detection: 0.5、new_det_thresh: 0.7视频中新实例准入阈值、max_num_objects: 10000。换言之穷尽式全实例分割 存在性判断不是一个宣传口号而是检测器架构直接产出的行为凡是得分越过阈值的概念实例都被枚举出来没有匹配则输出不存在。智源社区报道的100 个检测对象 30 毫秒也正是这套检测管线效率的体现。四、架构真相一个统一模型里的四套子系统把 config.json 完整读一遍会发现 SAM 3 的 checkpointmodel.safetensors 权重约 3.4GBmodel_type: sam3_video同时承载了四套能力这是统一基础模型的真正含义1. 概念检测器PCS 的引擎detr_encoder_configdetr_decoder_config各 6 层geometry_encoder_config3 层roi_size: 7负责把检测框编码为几何条件mask_decoder_confignum_upsampling_stages: 3负责把 query 解码为 288×288 低分辨率掩码。整体构成文本条件检测 → 几何引导 → 掩码细化的完整链路。2. Hiera 风格多尺度视觉骨干vision_config.backbone_config显示model_type: sam3_vit_model32 层、隐藏维度 1024、patch 14、窗口注意力 24image_size: 1008。骨干输出 3 个尺度的特征图backbone_feature_sizes: [[288,288],[144,144],[72,72]]配合scale_factors: [4,2,1,0.5]构成 FPN多尺度设计直接服务小目标穷尽检测——这也是全实例能覆盖细小物体的工程前提。3. 视频追踪器PCS 的视频形态tracker_config中可以看到一整套视频记忆机制memory_attention4 层、num_maskmem: 7、max_cond_frame_num: 4、enable_occlusion_spatial_embedding遮挡空间嵌入、enable_temporal_pos_encoding_for_object_pointers目标指针的时序位置编码以及hotstart_delay: 15等热启动启发式参数。README 还专门提醒流式推理关闭了去重/去伪的 hotstart 启发式因为需要未来帧做判断因此预加载式推理质量优于流式——这是值得工程团队注意的细节。4. PVS 兼容层SAM 2 的即插即用升级README 明确说明 Sam3Tracker/Sam3TrackerVideo 是updated version of SAM2保持 API 不变、可直接替换。也就是说老 SAM 2 工作流不用改代码就能用上更强的主干——这是工程迁移成本被刻意压低的证据。五、『理解』是营销话术还是技术实质现在可以正面回答标题里的问题了。基于上面的架构证据我的判断是SAM 3 的理解是任务级、可操作的概念理解不是认知级的语义理解但它的确是一次有架构支撑的实质性跃迁。支持实质的证据链很清晰存在性判断use_presence_token 得分阈值模型能输出有/没有的明确答案而不是尽力分割出一个东西穷尽枚举多 query NMS 的检测管线模型能回答这类概念有 N 个并把它们全部分割出来实例归因正/负框组合提示README 中handle 负框排除烤箱把手的用例说明模型能区分这个实例是否属于概念具备概念级推理的最小形态跨模态一致性文本与视觉示例指向同一概念表征说明语义空间是共享的。必须划清的边界同样明确词汇即边界能力上限是 CLIP 词表49408 个英文 BPE token 32 token 短语。中文直接提示基本不可用抽象概念幸福速度在架构上就不存在可分割的实例对应物——它理解的只能是可被视觉实例化的名词性概念无场景推理它不会像多模态大模型那样解释为什么、描述关系或生成叙述。它是概念检索器 精确掩码器的合体而不是图像理解助手许可约束仓库 LICENSE 显示 SAM 3 采用 2025 年 11 月 19 日更新的SAM License非 Apache 2.0且 README 的 Hugging Face 门控字段要求提交姓名、国籍、单位等个人信息——商用与再发布前必须逐条核对条款。结论说SAM 3 理解了世界是夸大说SAM 3 从分割工具进化为概念检索器则是准确的描述。这中间的差距恰恰是技术写作应该讲清楚的。六、实测验证哪些场景它真的『看懂』了仓库 README.md 给出了可以直接照做的官方用例与其空谈能力强不如逐条看它验证了哪种理解能力。场景一穷尽式多实例——ear耳朵inputs processor(imagesimage, textear, return_tensorspt).to(device) outputs model(**inputs) results processor.post_process_instance_segmentation(outputs, threshold0.5, ...)[0] print(fFound {len(results[masks])} objects)对一张 COCO 猫图输入ear模型返回所有耳朵实例而不是 SAM 2 那样需要你点一下。这是按概念枚举能力的直接验证。场景二同类聚合——dial旋钮对厨房图片输入textdial模型把所有旋钮一次性找齐。这里验证的是同义词/同概念聚合一个概念对应多个形态不同的实例模型通过语义空间而非外观模板完成归并。场景三排除性推理——handle 负框text handle oven_handle_box [40, 183, 318, 204] # 负样本框烤箱把手区域 input_boxes [[oven_handle_box]] input_boxes_labels [[0]] # 0 negative这是最能体现理解边界感的用例模型需要先判断哪些手柄属于handle概念再结合负框排除指定实例最终分割锅的手柄但排除烤箱手柄。存在性判断 实例归因在此合流。场景四跨帧概念追踪——视频personSam3VideoModel输入一个文本提示 person即自动检测并跟踪视频中所有人预加载模式 51 帧、输出object_ids/scores/boxes/masks。README 还给出流式推理接口且明确警告流式模式会因缺少未来帧而产生更多误检与重复轨迹——这本身就是对它理解了时间一致性的坦诚限定。至于哪些场景它没看懂社区情报同样给出了信号多篇部署文章反复强调英文 Prompt中文兼容性需处理C#/ONNX 部署文章C# 与 OnnxRuntime 部署实践 之外社区大量讨论都在做 TensorRT、8bit 量化等工程兜底。当你要问它左边的红色按钮、戴帽子的第一个人这类属性 关系 数量限定的复合问题时32 token 的短语式提示和 CLIP 语义空间就不够用了——这不是它的失败而是它能力的准确边界。写在最后SAM 3 的真实贡献是把三件过去割裂的事装进了一个模型开放词汇的概念检索、穷尽式的全实例分割、以及跨帧的自动追踪并以use_presence_token这类架构细节把存在性判断从论文修辞变成了可复现的模型行为。它没有变成会说话的 AGI但它在看懂图里有什么这件事上确实走出了 SAM 2 时代指哪打哪的舒适区——这足以让所有以分割为基座的应用内容审核、电商检索、自动驾驶数据标注、医学影像辅助重新评估自己的流水线。理解 SAM 3 的正确姿势不是跟着它开始理解世界的口号激动而是像读配置文件一样逐字段确认它把哪种理解做成了架构又把哪种理解留在了边界之外。【免费下载链接】sam3项目地址: https://ai.gitcode.com/hf_mirrors/facebook/sam3创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考