标题SingGuard-NSFA: Extensible Guardrails for Agentic AI via Generative Reasoning and Real-Time Classification来源arXiv, 2607.13081v1️文章简介研究问题如何系统性地防御从文本生成转向实际操作的智能体AI所面临的注入、数据窃取及工具滥用等运营级威胁主要贡献论文提出SingGuard-NSFA框架包含基于CIA三元组的NSFA风险分类体系、覆盖133种语言的大规模基准测试以及结合生成式推理与实时分类的双模式护栏模型。重点思路构建NSFA风险分类法基于机密性、完整性、可用性CIA原则将185种风险变体分层组织区分攻击技术与目标并与OWASP指南交叉验证涵盖查询侧和响应侧威胁。建立多语言基准套件构建包含9.3万自建样本和3400跨源样本的评估集覆盖133种语言针对用户查询和智能体响应进行平衡的正负样本分布填补非英语环境下的评估空白。设计双模式检测架构采用生成-判别联合训练策略。首先对基座模型进行监督微调以实现可解释的思维链推理随后在冻结的主干网络上训练轻量级判别式分类头支持低延迟实时检测。实现可扩展性与低延迟分类头独立于主干网络新增风险只需训练新头而无需重训模型。实时分类模式通过单次前向传播输出风险概率延迟控制在50毫秒左右满足在线拦截需求。分析总结性能全面领先在所有三个多语言基准测试中SingGuard-NSFA各尺寸模型0.8B至9B的二分类F1分数均超过94%优于最强竞品6至12个百分点且在跨源评估中保持了更均衡的精确率与召回率。实时检测高效判别式分类模式在保持高精度的同时推理延迟仅为45-57毫秒远低于生成式模式的数秒级延迟且即使扩展至5万个分类头延迟增加也微乎其微证明了其优秀的可扩展性。具备通用插件能力消融实验显示将该分类头架构应用于其他护栏模型如Llama Guard 3能显著提升其在代理安全风险上的检测性能证明该模块可作为通用插件增强现有安全系统。细粒度风险识别除了二分类模型还能准确识别具体的NSFA一级风险域生成式推理模式在复杂风险的多标签识别上表现尤为出色为离线审计提供了清晰的逻辑依据。个人观点论文从“内容安全”向“操作安全”的范式转变不仅提出了系统化的CIA风险分类更通过“冻结主干轻量分类头”的架构解决了安全性与实时性的矛盾。