近期爆火!Strix自动挖掘漏洞,配合GPT最新模型速度和质量双爆炸

📅 2026/8/7 6:57:13
近期爆火!Strix自动挖掘漏洞,配合GPT最新模型速度和质量双爆炸
Strix让 AI 替你做渗透测试的开源神器—— 43,000 Star96% 基准测试通过率AI 驱动的自动化白帽审计━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━一、为什么我们需要关注 Strix在传统的应用安全测试中我们面临一个两难选择• 静态扫描器SAST速度快但误报率高达 20% 以上安全工程师要花大量时间做漏洞确认• 手动渗透测试准确率高但周期动辄数周成本也高得吓人• 动态扫描器DAST介于两者之间但覆盖面有限尤其对业务逻辑漏洞无能为力。Strix 的出现试图用 AI Agent 打破这个困局——它不是简单地用大模型跑 nmap而是把渗透测试的纪律性编码进了 Agent 的系统提示和工具契约里先侦察再测、必须 PoC 验证、漏报不算数、只有专门 Agent 才能报漏洞。核心卖点每一个发现的漏洞都附带可复现的概念验证PoC只有验证成功的漏洞才会输出大幅降低无效告警。二、Strix 是什么Strix 是一款开源的 AI 自动化渗透测试工具采用 Apache 2.0 协议目前在 GitHub 上已获得超过 43,000 颗 Star。给定目标代码目录、GitHub 仓库或线上地址它会启动一组 AI Agent像真人黑客一样去跑程序、找漏洞、写 PoC 验证最后输出可直接用于整改的测试报告。项目基本信息项目详情GitHub 仓库github.com/usestrix/strix开源协议Apache 2.0PyPI 包名strix-agentGitHub Stars43,000提交数量674 次最新版本v0.6.0持续更新中初始开源日期2025年8月9日在线平台app.strix.ai文档地址docs.strix.ai三、核心架构多智能体协同作战Strix 采用 Graph of Agents代理图多代理编排架构侦察、利用、后渗透阶段由专属 AI Agent 分工协作支持多目标并行扫描、漏洞链式串联利用还原真实红队作业模式。3.1 Agent 工具箱Strix Agent 在 Docker 沙箱中能调用的工具集和真人 Pentester 用的是同一套工具模块能力说明HTTP 拦截代理深度集成 Caido全量请求/响应拦截与分析适合复现和篡改交互浏览器自动化Playwright 驱动多标签页环境测 XSS/CSRF/点击劫持/认证绕过等前端场景终端环境交互式 Shell沙箱内执行 Kali 工具模拟攻击链Python 运行时写自定义 Exploit 并当场跑快速做概念验证PoC侦察模块自动化 OSINT 攻击面测绘、子域名枚举、指纹识别代码分析SAST DAST 结合semgrep 等工具做白盒分析主动探测做黑盒分析漏洞知识库结构化 findings带 CVSS 评分和 OWASP 分类3.2 漏洞覆盖面Strix 的 skills/vulnerabilities/ 目录下有 23 个漏洞类型的知识包覆盖 OWASP Top 10 及以外漏洞类别代表漏洞注入攻击SQL 注入、NoSQL 注入、SSTI、OS 命令注入、HTTP 请求走私服务端漏洞SSRF、XXE、不安全反序列化、RCE、路径穿越/LFI/RFI客户端攻击XSS存储型/反射型/DOM 型、CSRF、原型链污染、开放重定向访问控制IDOR、功能级授权绕过BFLA、大规模赋值业务逻辑竞态条件、支付操纵、工作流绕过认证与会话JWT 攻击、会话固定、子域接管、信息泄露API 安全认证失效、批量赋值、速率限制绕过基础设施配置错误、云元数据暴露、服务暴露四、实际测试成绩重点以下测试数据均来自公开的独立测评和基准测试非官方营销数据。4.1 XBEN 基准测试96% 通过率XBEN 是一个包含 104 个真实世界 Web 安全挑战的 CTF 格式基准测试平台。在独立测评中Strix 的表现如下指标成绩总挑战数104 个成功解决100 个通过率96%平均每题耗时约 19 分钟总测试成本$337单题平均成本约 $3.37误报率趋近于零PoC 验证机制关键对比在同场测试中独立安全研究机构 Escape 的测评指出Strix 和另一个 Agent 能够交付可操作的结果确认关键漏洞并生成 PoC 利用代码而多个竞品PentAGI、PentestGPT 等遭遇了设置或执行失败根本无法完成测试。4.2 18 个大模型横评谁最适合做渗透测试安全研究员 TheArtificialQ 花了近 100 小时使用 Strix v0.8.3 对 18 个不同的 LLM 模型进行了黑盒渗透测试横评。测试目标是一台包含 14 个漏洞的靶机服务器CVSS 评分从 4.8 到 9.9满分 105.2 分每个模型测试 3 次取平均分。测试结果排名按平均分从高到低排名LLM 模型平均分备注1GLM 5.1智谱61.1冠军长程代理任务表现最佳分数范围 53.9-70.52GPT-5.4OpenAI~45-50亚军但倾向于过早收手3Sonnet 4.6Anthropic40.8分数尚可但单次测试成本高达 $55.94step-3.5-flash~35-38小模型梯队第一曾免费可用5kimi-k2.5月之暗面~35-37小模型梯队第二性价比高6gemma-4-31b-it~25-28最小模型表现尚可7deepseek-v3.2~25-28令人失望与 gemma-4 持平但贵 2 倍8grok-4.200 分完全无效拒绝执行渗透测试9nemotron-3-super0 分NVIDIA 模型未得分关键发现① 认真做渗透测试必须用大模型大且贵的模型。便宜模型集中在同一 mediocre 区间而真正拉开差距的模型都明显更贵。② Anthropic 模型的缺席之谜Sonnet 4.6 通过 Claude APITier 1测试时2 小时内触发 105 次 超过 30,000 输入令牌/分钟速率限制 错误仅发现 1 个漏洞就烧掉了 $20。通过 OpenRouter 绕过限制后单次测试成本高达 $55.9约为 GPT-5.4 的 3 倍。③ GLM 5.1 的意外夺冠这款发布仅一周的模型在长程代理任务中表现最佳其设计定位long-horizon agentic work与渗透测试的多步骤推理需求高度契合。4.3 Duck Store 多工具对比测试01webmasters 对 5 款 AI 渗透测试工具进行了灰盒条件下的基准对比测试。测试目标为 Duck Store——一个故意设计为存在 20 个已知漏洞的 Web 应用React 前端 FastAPI 后端覆盖注入、SSRF、XSS、IDOR、业务逻辑、访问控制、认证缺陷、信息泄露、开放重定向等类别。工具底层模型发现漏洞检测率运行时长误报率Escape专有模型15/2075.0%4 小时6.25%ClaudeOpus 4.614/2070.0%10 分钟6.67%PentAGIDeepSeek v3.29/2045.0%4 小时10.00%ShannonDeepSeek v3.26/2030.0%6 小时25.00%StrixDeepSeek v3.21/205.0%2 小时0.00%重要分析• Strix 在此测试中仅检测到 1 个漏洞产品过滤器中的未认证 SQL 注入检测率最低。但值得注意的是其误报率为 0%——虽然样本量太小但印证了 PoC 验证机制的有效性。• 使用相同模型DeepSeek v3.2的三个工具表现差异巨大PentAGI 45% Shannon 30% Strix 5%。这表明工具的编排层orchestration layer——代理动作循环结构、工具调用管理和认证处理——是决定性能的关键变量模型选择反而是次要考虑。注意该测试仅运行一次未取多次平均值。Strix 使用的是 DeepSeek v3.2 这一较弱的模型而非推荐的 GPT-5.4 或 GLM 5.1。结合 18 模型横评数据Strix 配合顶级模型时表现显著提升。4.4 OWASP Juice Shop 实战对比Ridge Security 针对 OWASP Juice Shop包含 110 个 CTF 挑战的故意漏洞应用进行了三款工具的对比测试所有工具均使用 Gemini 3 Flash 作为后端模型黑盒条件并采用了三层反作弊机制。工具发现总数有证据支持证据率运行时间RidgeGen5555100%—Shannon271037%—Strix66100%862 秒Strix 在此测试中发现了 6 个有证据支持的漏洞证据率 100%。虽然发现数量不及 RidgeGen但其零幻觉的验证纪律意味着每一个发现都附带完整的利用证据——HTTP 请求、服务器响应、提取的数据和可复现的复现步骤。4.5 与传统安全工具对比根据 AISignal 的性能分析数据Strix 与传统工具的对比如下指标StrixOWASP ZAPBurp Suite漏洞发现率92%78%85%零日漏洞检测67%12%23%误报率8%22%15%代码覆盖率95%82%88%处理速度~45 秒/千行代码5-10 分钟/千行代码—4.6 开发者实战案例独立安全博主 Andrew 在 dev.to 上分享了他的实际使用体验案例 1CI/CD 集成实战在一次小型功能 PR 的快速扫描中Strix 用时 4 分 12 秒消耗约 $0.35 的 Claude API 费用成功捕获了一个真实存在的 XSS 漏洞。案例 2OWASP NodeGoat 扫描对 OWASP NodeGoat故意漏洞的 Node.js 应用进行扫描Strix 发现了 14 个漏洞每一个都包含可复现的 curl 命令、服务器原始响应、修复代码 diff、CVSS 评分和 OWASP 分类。案例 3快速扫描成本参考扫描模式耗时成本适用场景快速扫描Quick约 10 分钟$3 - $5CI/CD PR 检查深度扫描Standard数小时$10 - $20全面安全评估XBEN 单题平均约 19 分钟约 $3.37CTF 挑战五、快速上手指南5.1 环境准备• Docker必须处于运行状态• LLM API Key支持 OpenAI、Anthropic、Google 等主流厂商也支持本地模型Ollama/LMStudio5.2 一键安装# 安装 Strix curl -sSL https://strix.ai/install | bash # 或通过 pipx 安装 pipx install strix-agent5.3 配置与首次扫描# 配置 AI 提供商推荐 GPT-5.4 或 GLM 5.1 export STRIX_LLMopenai/gpt-5.4 export LLM_API_KEYyour-api-key # 扫描本地代码库 strix --target ./app-directory # 扫描 GitHub 仓库 strix --target https://github.com/org/repo # 黑盒 Web 应用评估 strix --target https://your-app.com # 灰盒认证测试 strix --target https://your-app.com \ --instruction Perform authenticated testing using credentials: user:pass # CI/CD 无头模式 strix -n --target https://your-app.com # PR diff 范围扫描仅测试变更代码 strix -n --target ./ --scan-mode quick \ --scope-mode diff --diff-base origin/main5.4 GitHub Actions 集成name: strix-penetration-test on: pull_request: jobs: security-scan: runs-on: ubuntu-latest steps: - uses: actions/checkoutv6 with: fetch-depth: 0 - name: Install Strix run: curl -sSL https://strix.ai/install | bash - name: Run Strix env: STRIX_LLM: ${{ secrets.STRIX_LLM }} LLM_API_KEY: ${{ secrets.LLM_API_KEY }} run: strix -n -t ./ --scan-mode quick推荐使用场景 • 适合应用安全自动化检测、CI/CD 安全门禁、快速渗透测试、Bug Bounty 自动化 • 不适合网络/云基础设施审计、IAM 策略审查、预算极其受限且无法使用顶级模型的场景 • 最佳实践使用 GPT-5.4 或 GLM 5.1 等顶级模型结合 CI/CD diff 扫描作为多层防御的一环 关注我持续分享网安圈硬核干货。觉得有用的话点赞 在看 转发三连支持一下━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━项目地址github.com/usestrix/strix