Anthropic GRAM:给AI模型的危险知识装一个“可拆卸开关“——一次训练,任意裁剪

📅 2026/8/13 8:39:42
Anthropic GRAM:给AI模型的危险知识装一个“可拆卸开关“——一次训练,任意裁剪
问题的根源AI 知道的太多我们关不掉前沿大模型在训练时不可避免地会学到双重用途知识——既能用于正当目的也能被滥用的知识。比如网络安全知识能做渗透测试也能写攻击代码病毒学知识能辅助疫苗研发也能指导生物武器设计化学合成知识能优化制药工艺也能用于合成违禁物质目前业界的做法是什么拒绝训练refusal training和输入/输出分类器。但这些方法都是在行为层做拦截模型的底层知识纹丝不动。一旦被 jailbreak 绕过该输出的危险内容一个不少。那为什么不直接训练两个模型——一个全能版给内部使用、一个安全版对外发布因为贵。前沿模型的单次训练成本已经到数千万美元级别。每多训一个模型就是一套完整的算力账单。Anthropic 与 AE Studio 合作提出的GRAMGradient-Routed Auxiliary Modules梯度路由辅助模块解决的就是这个矛盾一次训练任意裁剪。GRAM 怎么做的三步拆解第一步在 Transformer 的每一层插入辅助神经元标准 Transformer 由多层堆叠而成。GRAM 的做法是在每一层都额外插入一组神经元按知识类别分组称为模块。举个例子假设我们要管控 4 类双重用途知识模块 A网络安全模块 B病毒学模块 C化学合成模块 D其他敏感领域这些模块物理上嵌入模型权重中可以被单独激活或删除。标准 Transformer 层 [Attention] → [FFN] → [LayerNorm] GRAM 改造后 [Attention] → [FFN Aux Module A Aux Module B ...] → [LayerNorm]第二步数据打标梯度路由训练数据需要打上标签general通用文本或dual_use:virology特定类别。前向传播无论什么数据模型都正常使用全部参数做预测。这意味着模型能学到双重用途知识——这是故意为之因为我们需要模型在授权场景下具备完整能力。反向传播关键通用文本 → 所有参数正常更新双重用途文本 →冻结主干网络只更新对应模块的权重用伪代码表达forbatchindataloader:inputs,labels,categorybatch# 前向传播全参数参与outputsmodel(inputs)losscross_entropy(outputs,labels)# 反向传播根据类别选择性更新loss.backward()ifcategorygeneral:optimizer.step()# 更新全部参数elifcategorydual_use:virology:# 只更新 virology 模块冻结其余optimizer.step(modulevirology)elifcategorydual_use:cybersecurity:optimizer.step(modulecybersecurity)实际实现中这是通过对非目标模块的梯度置零来实现的。第三步训练后按需裁剪训练完成后你得到了一个包含所有模块的完整模型。部署时对外 API删除敏感模块 → 得到一个安全模型内部红队保留所有模块 → 得到一个全能力模型特定合作伙伴保留部分模块 → 得到一个定制能力模型4 个模块 2^4 16 种能力组合全从一次训练中产生。实验结果从玩具到 5B 参数都成立实验 1合成童话数据集概念验证在一个儿童故事模型上训练 GRAM按主题动物、魔法、太空等划分模块。删除任意模块后模型对该主题的表现几乎等同于一个从未见过该主题的独立训练模型。实验 2真实数据网页文本 代码 论文 × 4 类双重用途领域删除模块后关联能力被移除的效果等同于从未训练过该数据通用性能代码能力、语言理解等不退化对抗性微调试图恢复被删除的知识 → GRAM 的抵抗力与数据过滤方法持平而传统的遗忘学习unlearningbaseline 轻易被逆转实验 3扩展性验证50M → 5B 参数7 个模型规模GRAM 在每个规模上都匹配数据过滤的性能关键发现随着模型规模增大模块开启与模块关闭的性能差距越来越大这意味着模型越大绕过保护越难、成本越高为什么这比拒绝回答强方法知识还在吗能被 jailbreak 吗成本拒绝训练还在能绕过低输入/输出分类器还在能绕过中数据过滤训前删除不在不能高不能恢复遗忘学习unlearning被抑制但可恢复能恢复中GRAM模块删除后不在不能一次训练按需组合GRAM 的核心洞察是在训练阶段就把知识的归属标记清楚而不是训完了再想办法擦除。局限与现实的差距这篇论文本身也很坦率未在前沿规模测试。5B 参数离 GPT-4/Claude 4 的规模还有数量级差距。评估指标是 next-token prediction不是真实下游任务写攻击代码、设计合成路线等。有些知识可能是不可分离的——某些双重用途知识与通用推理能力纠缠太深任何方法都无法干净剥离。另外GRAM 要求训练数据提前标注类别这对训练数据管道的工程能力提出了更高要求。写在实际应用之前GRAM 不是一个明天就能部署到生产环境的方案但它指明了一个方向AI 安全不应该只在行为层做文章而应该下探到模型参数层做结构化的能力管控。如果你在做模型安全相关的工作可以从这几个点入手梳理你模型训练数据中的敏感知识域——先把类别定义清楚评估当前的拒绝训练和分类器方案的 jailbreak 鲁棒性——大概率比你想象的脆弱关注参数级能力控制的研究进展——GRAM 之外representation engineering、circuit-level intervention 也是值得关注的方向至少下次做安全方案评审时你不会只能说我们加了 RLHF 和内容过滤器。参考Anthropic, “An off switch for dual-use knowledge in AI models”, 2026. https://www.anthropic.com/research/off-switch-dual-use