深入解析SingGuard-NSFA-9B:NSFA分类体系如何覆盖185种Agent风险变体

📅 2026/8/17 17:32:02
深入解析SingGuard-NSFA-9B:NSFA分类体系如何覆盖185种Agent风险变体
深入解析SingGuard-NSFA-9BNSFA分类体系如何覆盖185种Agent风险变体【免费下载链接】SingGuard-NSFA-9B项目地址: https://ai.gitcode.com/hf_mirrors/inclusionAI/SingGuard-NSFA-9BSingGuard-NSFA-9B是蚂蚁集团AI安全实验室开源的Agent安全护栏模型核心亮点在于其自研的NSFANot-Secure-For-Agents分类体系将智能体运行中的安全威胁细化为185种风险变体以输入护栏与输出护栏双视角实时拦截。该模型支持133种语言单次检测仅约50毫秒多语言基准F1超过94%。本文面向新手从零讲清NSFA分类体系的设计逻辑、185种风险变体如何划分以及普通开发者如何快速上手这款Agent安全护栏。为什么Agent系统需要专属的安全护栏传统大模型安全主要管“说什么”而Agent系统会真正执行操作——调用工具、读写数据库、发起网络请求。一旦用户输入或模型输出被恶意利用就可能直接造成资产损失。SingGuard-NSFA-9B的作用就是在Agent执行动作之前对输入输出做一次“安全体检”把危险请求挡在门外。护栏检查什么输入护栏与输出护栏输入护栏Query-side检查用户发来的查询拦截提示注入、恶意代码请求等攻击守护5大风险域、160种风险变体。输出护栏Response-side检查模型生成的回答防止Agent“自作主张”执行危险动作或泄露敏感信息覆盖2大风险域、25种风险变体。NSFA分类体系是什么185种风险变体如何划分 NSFA是“Not-Secure-For-Agents”的缩写即“对Agent不安全”的风险清单。它是一套基于CIA三元组机密性Confidentiality、完整性Integrity、可用性Availability的层级化分类体系并与三份OWASP安全指南交叉验证最终沉淀出185种风险变体160种输入侧 25种输出侧。输入护栏5大风险域覆盖160种风险变体一级风险域Level-2 风险数Level-3 变体数对应CIA属性提示注入与越狱Prompt Injection Jailbreak技术型风险域贯穿全部属性贯穿全部恶意代码与网络攻击Malicious Code Cyberattack目标型风险域部分完整性敏感信息窃取Sensitive Information Stealing目标型风险域部分机密性危险操作与工具滥用Dangerous Operations Tool Abuse目标型风险域部分完整性资源滥用Resource Abuse目标型风险域部分可用性合计24160—其中提示注入与越狱是唯一的技术型风险域因为它可以服务于任何恶意目标横跨全部CIA属性其余四个是目标型风险域各自对应一项CIA属性逻辑非常清晰。输出护栏2大风险域拦截25种风险变体一级风险域Level-2 风险数Level-3 变体数危险动作生成Hazardous Action Generation含于其中含于25种敏感信息泄露Sensitive Information Leakage含于其中含于25种合计425也就是说Agent“做坏事”和“说漏嘴”这两类输出风险都被拆解到可枚举、可审计的具体变体层级方便安全团队逐条核对与处置。双模式检测机制实时分类 生成式推理 ⚡SingGuard-NSFA-9B采用“双模式”设计兼顾线上拦截速度与离线审计可解释性对比维度实时分类模式在线拦截生成式推理模式离线审计核心原理冻结主干 领域MLP分类头SFT模型生成思维链分析单样本延迟约45~57msA100相对较慢输出内容各风险域的概率分数思维链分析 结构化风险标签适用场景高吞吐线上流量实时筛查合规审计、事件调查、人工复核在线模式中冻结的骨干网络输出最后一层嵌入喂给多个轻量级MLP分类头并行打分一次前向传播即可完成检测这正是它能做到约50毫秒实时拦截的原因。你可以根据自身风险容忍度为每个风险域单独设置置信度阈值。实战表现133种语言的多语言护栏验证 SingGuard-NSFA提供了0.8B、2B、4B、9B四个尺寸的模型本仓库为9B版全部在自建的多语言基准上取得超过94%的F1并比最强竞品护栏高出6~12个F1百分点。三大评估基准如下基准名称样本数正:负比风险域变体数语言数NSFA_Query_Multilingual63,43129,474 : 33,9575160133NSFA_Response_Multilingual29,97214,314 : 15,658225133NSFA_CrossSource_Query_Multilingual3,4352,315 : 1,1205—133特别值得一提的是跨来源基准它改编自AgentDojo、InjecAgent、AgentHarm、AgentDyn、ATBench五个公开Agent安全数据集与训练数据完全独立能更真实地反映护栏的泛化能力。快速上手仓库文件与分类头说明 克隆仓库后你会看到如下结构详见README.mdmodel.safetensors9B骨干模型权重nsfa_heads/7个预训练分类头文件config.json模型架构配置基于Qwen3.5chat_template.jinja对话模板tokenizer_config.json分词器配置内含risk、analysis等专用标记7个分类头分别管什么nsfa_heads/目录下的7个.pth文件对应两类任务Query侧5个头NSFA-Prompt_Injection_and_Jailbreak_head.pth、NSFA-Malicious_Code_and_Cyberattack_head.pth、NSFA-Sensitive_Information_Stealing_head.pth、NSFA-Dangerous_Operations_Tool_Abuse_head.pth、NSFA-Resource_Abuse_head.pthResponse侧2个头NSFA-Hazardous_Action_Generation_head.pth、NSFA-Sensitive_Information_Leakage_head.pth调用时用户查询用untrusted_input包裹模型回答用untrusted_output包裹模型即可判断是否存在风险具体的推理示例代码可参考README.md中的使用章节。可扩展设计为你的Agent添加新风险类型 SingGuard-NSFA的架构天然支持扩展新增风险域无需重训整个模型只需在冻结的骨干上训练一个额外的轻量分类头即可不会影响既有检测能力。官方实验显示给Llama Guard 3挂上NSFA分类头后查询检测F1提升17.6个点跃居外部护栏榜首在9B骨干上训练一个内容安全头即可在内容审核基准上接近SOTA水平0.8B小模型适合边缘设备部署同时保持94%以上的F1。这意味着团队可以按需定制专属风险域比如内部业务流程特有的风险类型。需要注意的局限 单轮文本检测无法覆盖多轮对话中的渐进式目标劫持、级联工具调用失败等轨迹级威胁不支持多模态图片、音频、视频中的威胁暂不在范围内聚焦操作安全NSFA管的是Agent“做什么”色情、暴力等纯文本内容审核不在此列可通过扩展头实现。总结 ✨SingGuard-NSFA-9B用一套严谨的NSFA分类体系把Agent安全从“凭感觉”变成“可枚举、可审计”185种风险变体、双模式检测、133种语言支持、约50毫秒实时拦截再加上即插即用的分类头扩展机制让它成为Agent安全护栏中值得一试的完整方案。对于刚接触Agent安全的开发者从阅读README.md和nsfa_heads/目录开始是最快的入门路径。【免费下载链接】SingGuard-NSFA-9B项目地址: https://ai.gitcode.com/hf_mirrors/inclusionAI/SingGuard-NSFA-9B创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考