从 Claude Mythos 到 GLM-5.3红队盯上所有模型开源框架的全模型适配时代来了【免费下载链接】Claude-Redclaude-red is a curated library of offensive security skills designed for the Claude skills system. Each skill is a structured SKILL.md file that primes Claude with expert-level methodology for a specific attack surface — from SQLi to shellcode, EDR evasion to exploit development.项目地址: https://gitcode.com/GitHub_Trending/cl/Claude-Red大模型安全正在经历一个微妙但关键的转折红队的靶子不再只是某个最强的模型。过去几个月行业新闻密集到近乎饱和——Anthropic 把旗下最强 Claude 交给红队测试半年挖出十二万漏洞Claude Fable 5 发布 24 小时即被攻破从发布到被下架只撑了 72 小时某模型厂商声称自己的护栏0% 中招红队实测的绕过率却高达 80%甚至连国产阵营也没能幸免Anthropic 的红队盯上了能力追平 Mythos 的 GLM-5.3结论是拒绝护栏形同虚设。这些事件叠加在一起指向同一个信号安全评测不再是对单一旗舰模型的事后验尸而是正在成为所有模型的常规体检。随之而来的是红队工具链本身的范式迁移——从绑死某一厂商 API 的测试脚本走向方法论即技能、技能即资产、一套方法论适配所有模型的开放框架。本文结合 Claude-Red 这个开源项目拆解这场迁移的技术路径与趋势含义。一、从发布即翻车到红队前置模型安全进入常态化对抗先看几组值得玩味的事实。Fable 5 的例子极具代表性被官方称为最强的模型24 小时内就被研究者找到逃逸路径72 小时后被迫下架。这暴露了一个残酷现实——离线安全评测与真实对抗之间存在巨大鸿沟。厂商内部测试通过不代表外面攻不破0% 中招的自我声明与红队实测的 80% 绕过率之间的落差说明仅靠内部对齐与护栏压测无法覆盖攻击者的创造性。同样耐人寻味的是 GLM-5.3 的遭遇能力维度已经追平 Claude Mythos却在安全维度被红队点名——拒绝护栏成了摆设。这打破了一个常见误区能力强 ≠ 安全。能力越强的模型往往越擅长理解并执行复杂指令也就越容易被越狱指令、角色包装、多轮诱导等手法穿透。当能力排行榜与安全排行榜开始出现明显错位安全评估就从一个学术话题变成了实实在在的工程问题与采购决策问题。红队为什么能连续命中这么多模型答案藏在攻击面的多样性里。仅就提示词注入这一类就有直接注入、间接注入恶意内容藏进网页/文档/RAG 语料、多模态注入指令隐藏在图片、PDF、语音转录里、编码混淆、角色扮演、多轮语境操纵等十余种变体。而模型越是接入工具调用、Agent 编排、RAG 检索攻击面就越从文本输出扩展到工具越权、数据泄露、供应链投毒。面对这种变体爆炸人工逐个尝试已经不现实自动化、可回归、可量化的红队框架成为刚需。二、Claude-Red 的真实形态不是脚本库是方法论技能库先说清楚一个关键事实社区里热传的 Claude-Red 有多种叙事其中一类文章把它描述为基于 Python Anthropic SDK 的 API 红队测试框架。而本文基于的 Claude-Red 仓库走的是另一条更本质的路线——它是一套为 Claude Skills 系统设计的攻击技能库78 个SKILL.md文件、23 个分类从 SQLi 到 shellcode从 EDR 逃逸到漏洞利用开发每个文件都是一份让 Claude 变成领域专家的方法论。技能即方法论SKILL.md 的结构化设计每个技能都是一个独立的SKILL.md遵循 CONTRIBUTING.md 定义的统一格式。YAML frontmatter 中的name与description是触发匹配的关键——Claude 根据对话内容自动加载匹配的技能--- name: offensive-sqli description: SQL injection testing skill for offensive security assessments and bug bounty hunting. Covers error-based, UNION-based, boolean/time-based blind, out-of-band, second-order, NoSQL, GraphQL, WebSocket, and JSON-operator SQLi. Includes WAF bypass techniques, database-specific exploitation (MySQL, MSSQL, PostgreSQL, Oracle), cloud-native attack paths, ORM CVE tracking, and SQLmap automation... ---以 Skills/web/offensive-sqli/SKILL.md 为例正文不是零散的 payload 堆砌而是完整的操作工作流先映射所有到达数据库的输入向量URL 参数、POST body、Cookie、Header、API 过滤器、WebSocket 消息再插入探测载荷错误型/布尔盲注/时间盲注逐级递进识别数据库类型、枚举 schema、提权或 RCE最后输出带修复建议的结论。这种Quick Workflow → Detection → 各阶段技法 → 防御视角 → Engagement Cheatsheet的结构本质上是把资深攻击者的经验固化成可复用的标准作业程序。按需加载不给模型背多余的上下文这个设计还有一个非常工程化的细节技能按对话触发词按需加载。你讨论 SQL 注入就加载offensive-sqli你进入无线渗透阶段再加载offensive-wifi-recon。Claude 不为用不到的技能付出上下文成本——78 个技能全部注入会撑爆上下文窗口按需加载则让全副武装与轻装上阵可以兼得。配合 install.sh 的--category web、--dry-run等参数安全团队可以只部署当前项目用得到的分类。从版本演进看这种深度优先、单点聚焦的策略相当激进CHANGELOG.md 显示 v0.1.0 只有 37 个技能v0.3.0 已到 78 个技能、23 个分类且 roadmap 仍在向 AD 拆分、云身份、Web 进阶等方向扩张。其中offensive-deserialization从 183 行重写到 600 行、offensive-ssti扩到 758 行并覆盖 10 模板引擎——技能不是目录条目而是被持续打磨的深度内容资产。三、从Claude 专属到全模型适配开放框架的扩展路径Claude-Red 的名字里带着 Claude但它的扩展路径恰恰说明了全模型适配是怎么发生的。关键在于一个事实这套技能库的价值载体是方法论文本而不是某个厂商的 API 调用。Claude Skills 系统只是宿主之一方法论本身对模型是中立甚至无感的。这一点从仓库的安装方式可以看得很清楚——除了克隆到~/.claude/skills/claude-red的标准玩法README 还给出了通用接入方式cat Skills/web/offensive-sqli/SKILL.md | claude --system-file -把SKILL.md作为 system 上下文喂给模型本质上与具体模型解耦同样的技能文件喂给 Claude、喂给支持系统提示词的其它模型、喂给本地开源模型得到的都是同一套攻击方法论。这背后是一个重要趋势红队能力的载体正在从依赖特定 SDK 的测试脚本转向可移植、可复制、可对话加载的方法论资产。SkillAttack 这类面向 Agent Skill 的自动化验证框架的出现进一步印证了这一点——技能本身成了被测对象也成了攻击与防御争夺的新前线。换句话说从Claude Mythos 专属到GLM-5.3 也能被同一套方法论覆盖开源框架的适配路径不是给每个模型各写一套代码而是把攻击知识结构化为模型无关的技能层。模型可以换、SDK 可以换但 SQL 注入的手工探测序列、EDR 逃逸的 hook unhooking 步骤、无线攻防的握手抓包流程这些跨模型成立的攻击知识不变。四、模型选型与安全评估合流安全分正在变成第一道门槛GLM-5.3 事件最有信息量的部分是它把安全评测直接推到了模型选型面前。能力追平 Mythos 的模型若拒绝护栏是摆设那么任何严肃的企业都不敢在无护栏场景下直接上线它。这意味着安全不再是被动的合规检查而是选型的否决性指标。榜单思维正在从单一能力维度转向能力 安全 成本的多维坐标系。红队测试必须可回归、可量化。社区对 Claude-Red 类框架的讨论中反复出现的 ASR攻击成功率、ASL平均伤害等级、误拒率三大量化指标本质上是要把这个模型越狱难不难变成可以跨版本、跨模型对比的数字。评测要逼近真实业务场景。无论是提示词注入、系统指令泄露、越狱变体、敏感信息泄露还是 Agent 场景下的工具越权脱离业务场景的通用基准已不足以支撑选型决策——这正是一系列社区文章强调场景贴合产品、避免系统提示词污染、支持定期回归与基线对比的原因。Claude-Red 中的 Skills/ai/offensive-ai-security/SKILL.md 给出了这套思路的完整落地形态。它把 AI 攻击面的底层机制拆得很透指令跟随与歧义指令与数据的边界模糊、数据依赖训练数据与输入数据的双重投毒面、黑盒不透明性、外部系统集成带来的过度代理excessive agency、输出处理不当、供应链风险等。围绕 OWASP LLM Top 10它提供了可直接执行的检测流程——比如间接注入的七步法映射工具权限 → 映射可注入数据源 → 提取系统提示词 → 探测语义/令牌级授权 → 注入更具说服力的提示 → 让模型读取源并观察动作 → 迭代精化以及 RAG 专属攻击向量库租户隔离、embedding 投毒、检索合并滥用、多模态通道隐藏指令、工具调用 schema 验证绕过等新面。攻击技法之外它还给出了防御侧的 fail-closed 清单系统/开发者/用户角色严格分离、工具域白名单、JSON Schema 严格校验、敏感模式前后置过滤、高风险操作人工介入、网络出口管控、日志脱敏——红队与蓝队的知识第一次被装进同一份方法论里。配合 Skills/utility/offensive-reporting/SKILL.md 的报告规范CVSS v3.1/v4.0 评分、证据卫生、风险叙事、复测纪律一个完整的闭环浮出水面自动化执行 → 量化评分 → 结构化成因 → 可回归基线 → 支撑选型与上线决策。这正是模型选型与安全评估合流所需要的工程底座。五、趋势预判红队正在变成模型发布的标准流水线把最近的信号串起来可以清晰地看到三条正在成形的趋势其一安全评测将从发布后补救前置为发布前关卡。Fable 5 的 72 小时下架教训说明靠用户反馈发现漏洞的代价太高。未来的模型发布流程大概率会像今天的软件 CI 一样把自动化红队压测作为上线门禁——这也解释了为什么社区中大量讨论把 CI/CD 集成、断点续跑、版本回归作为 Claude-Red 类框架的标配能力。其二红队能力将全面资产化、技能化。与给每个模型写一套专属测试脚本相比把攻击方法论沉淀为模型无关、可复用、可持续迭代的技能文件是成本与效率的最优解。Claude-Red 的 78 个技能之所以按攻击面而非按模型组织正是因为攻击面是稳定资产而模型是快速迭代的变量。其三安全分数将成为模型竞争的新主战场。当能力差距被快速抹平GLM-5.3 追平 Mythos 就是注脚差异化竞争点将转向同样能力下谁更安全、谁更可控。谁能提供可证明、可量化、可复现的安全基线谁就掌握选型话语权。对开源社区而言这意味着像 Claude-Red 这样的技能库不只是工具更是这场安全竞赛的度量衡基础设施。红队盯上所有模型的时代本质上是AI 安全从少数研究者的手艺变成整个行业的工程纪律的时代。而开源框架们给出的答案很一致不押注任何单一模型把方法论本身做成开放的资产。这套思路是否真的能经受住 Mythos、GLM-5.3 们一代代迭代的考验将是接下来最值得观察的技术叙事之一。【免费下载链接】Claude-Redclaude-red is a curated library of offensive security skills designed for the Claude skills system. Each skill is a structured SKILL.md file that primes Claude with expert-level methodology for a specific attack surface — from SQLi to shellcode, EDR evasion to exploit development.项目地址: https://gitcode.com/GitHub_Trending/cl/Claude-Red创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考