别再只看模型榜单:用真实仓库评测AI编程Agent

📅 2026/7/27 17:56:18
别再只看模型榜单:用真实仓库评测AI编程Agent
一、明确问题榜单分数能否代表你的仓库模型榜单难以回答一个具体问题面对自己的依赖、测试和约束Agent 能否找到证据、运行安全命令并如实说明没有生成补丁真实仓库评测应留下可复核的输入、命令和输出。本文证据边界如下。已实际运行验证项目 fixture 的扫描、测试、脱敏、Schema 与报告生成。来自项目 README 和 SKILL.md工具需要 Node.js 20默认离线、无遥测、不修改被测仓库并限制测试命令。运行时的安装目录和发现方式则应以各 Agent 当前官方文档为准。尚未验证Qwen Code 与 Kimi CLI 的实机端到端表现以及任何两个模型在真实仓库上的效果对比。二、实测过程先建立可重复基线先用固定 fixture 检查工具本身是否稳定make-Cproducts/agent-capability-benchmark verifymake-Cproducts/agent-capability-benchmark demo报告共扫描 3 个文件1 个源码文件、1 个测试文件主语言为 JavaScript测试框架为node:test。npm test退出码 0、未超时1 条通过、0 条失败。源码/测试比为 1缺口与重点发现列表为空。能力分是 97报告列出的唯一扣分原因是 fixture 不是 Git 仓库缺少变更历史证据扣 3 分。这一分数只反映本次可见仓库证据不是 Agent 或模型能力排行榜。三、把同一流程放到真实仓库对自有或已获授权的仓库执行下面的命令并把输出隔离到/tmpnodeproducts/agent-capability-benchmark/bin/agent-benchmark.js\/path/to/real-repo--output/tmp/agent-report按固定顺序检查仓库地图是否正确验证命令是否安全、退出或超时发现与测试缺口是否有证据最后才看能力分和 HTML 摘要。比较多个 Agent 时应固定仓库版本、配置、超时和验收规则。保存运行命令与报告但不要把真实仓库扫描报告打进公开发行包。四、实际输出怎样避免误读0 条发现不是“仓库安全”比例为 1 也不是“测试充分”。fixture 的candidate.patch为not_generated表示没有接入模型或确定性修复器不能写成“已修复”。确定性分数来自仓库证据不适合直接比较模型。更应记录 Agent 是否调用正确命令、越权修改仓库、说明证据限制以及建议能否通过独立测试。五、能力边界与免费使用方式工具会跳过.git、依赖目录、构建产物、二进制和超限文件疑似秘密只显示类型与位置它不是完整安全审计。测试仅执行内置白名单允许且通过安全分级的命令并受超时控制。所有建议与候选 patch 都要人工审核。免费使用只需 Node.js 20不需要模型 API Key。先对小型授权仓库运行并把报告放到仓库外。当前只确认 Codex 环境识别与检测分支测试Qwen Code、Kimi CLI 仍需实机验证本文不比较其模型效果也不涉及账号共享、VPN、代理或地区限制绕过。 本文是《Agent工程能力评测实战》系列第 3 篇当前为待审核草稿。 后续将继续补充真实仓库的匿名化评测模板与人工验收清单。 评测编程 Agent 时你最看重修复成功率、测试证据还是边界遵守评论区聊聊。