[论文学习]JBShield:通过激活概念分析与操纵防御大语言模型越狱攻击
JBShield: Defending LLMs from Jailbreak Attacks through Activated Concept Analysis and Manipulation (USENIX Security 2025)
论文重点
本文基于线性表征假说(Linear Representation Hypothesis, LRH),系统揭示了大语言模型越狱攻击的内…
2026/8/16 23:25:51