[论文学习]Latent Fusion Jailbreak: 融合有害与无害表征以诱导大语言模型产生不安全输出
Latent Fusion Jailbreak: Blending Harmful and Harmless Representations to Elicit Unsafe LLM Outputs (LFJ, 2026)
论文重点
本文提出了一种名为潜在融合越狱(Latent Fusion Jailbreak, LFJ) 的新型白盒攻击方法,通过将有害查询与结构…
2026/8/18 12:29:02