[论文学习]X-Boundary:为LLM建立精确安全边界以抵御多轮越狱攻击
X-Boundary: Establishing Exact Safety Boundary to Shield LLMs from Multi-Turn Jailbreaks (ACL 2025)
论文重点
本文针对大语言模型(LLM)在多轮对话场景下面临的越狱攻击难题,提出了一种名为X-Boundary的新型防御框架。该方法从模型可解…
2026/8/18 12:47:24