Valhalla静态工程审阅|一个 SKILL.md 能改变 AI 编程行为吗?andrej‑karpathy‑skills 源码快照评测报告【Agent Skill 特辑 #012】 📅 2026/8/18 10:24:45 Valhalla静态工程审阅一个 SKILL.md 能改变 AI 编程行为吗andrej‑karpathy‑skills 源码快照评测报告【Agent Skill 特辑 #012】Agent Skill 特辑本文面向 AI 编程工具使用者、技术负责人和提示工程实践者基于固定 Git 提交进行只读静态审阅。本文不包含运行实验也不对实际效果、安全性或作者关联作未经证实的判断。一、结论先行本次审阅对象为仓库https://github.com/multica-ai/andrej-karpathy-skills 提交2c606141936f1eeef17fa3043a72095b4765b9c2静态扫描得到以下结果项目观测值扫描器支持的程序源文件0SKILL.md技能条目1构建或依赖文件0测试文件线索0CI 工作流线索0许可证文件0内置静态风险模式命中0最重要的判断不是“项目没有代码”而是这是一个以自然语言指令为主要交付物的轻量 Skill 仓库传统源码扫描无法评价其核心质量。因此本报告可以确认仓库快照和技能文件存在但不能确认指令是否真的改善模型行为是否减少 token 消耗是否适用于不同模型和任务是否会与用户规则或项目规则冲突是否产生新的权限和安全风险内容是否可以在目标场景中直接使用。二、这类项目不应按传统代码库评价常规软件仓库通常包含源码 → 构建 → 测试 → 制品 → 部署该项目的证据表面则更接近自然语言规则 → 被 Agent 读取 → 影响决策与回答 → 产生执行结果两类项目的核心质量指标并不相同。对于 JavaScript、Go 或 Rust 项目可以检查函数和类型控制流异常处理依赖关系单元测试构建产物。对于单文件 Skill更应该检查规则是否明确指令是否互相冲突适用范围是否清楚是否允许模型在证据不足时猜测是否要求执行高风险操作是否定义失败和退出条件是否能通过固定任务集验证效果。因此“源文件为 0”不是负面质量结论只说明原评测工具与目标资产类型并不完全匹配。三、证据结构图下面的图表示本次可以确认的证据关系不代表已经观测到真实运行链路。需要运行实验尚未验证需要对照评测固定 Git 提交单个 SKILL.md自然语言行为规则Agent 读取规则回答或工具调用变化质量、成本与安全结果可复现静态快照人工内容审阅生产适用性结论图中实线表示已有静态证据虚线表示仍需实验验证的环节。四、原始报告哪些结论成立1. 快照可回溯提交 SHA 已被记录可以将后续人工审阅和实验限定在同一版本上。这是当前最可靠的证据。但“记录了 SHA”和“已经验证远端对象完整性”并不完全相同。更严格的审计还应记录gitremote-vgitrev-parse HEADgitshow --no-patch--formatfuller HEADgitstatus--short2. 项目表面高度集中扫描只识别出一个技能条目说明其交付表面较小。较小的内容表面通常更容易阅读版本比较人工审核快速试验出现问题时回退。但“内容少”不自动等于“质量高”。一条含糊或越权的规则也可能对大量任务产生系统性影响。3. 未发现传统构建依赖当前没有识别到包管理、编译或运行时依赖。这意味着传统软件供应链表面可能较小。不过Skill 的实际依赖可能是隐式的例如特定 Agent 产品特定文件加载约定特定上下文优先级特定模型的指令遵循能力外部工具或命令权限。这些依赖不会出现在package.json或pyproject.toml中需要从技能正文和宿主工具文档中确认。五、哪些数据容易被误读1. “静态风险命中为 0”不等于安全内置规则通常面向程序源码中的危险模式例如Shell 调用动态执行路径拼接疑似凭证网络访问。SKILL.md是自然语言内容没有命中这些规则并不意外。这不能排除指令层风险例如要求绕过确认步骤鼓励直接执行不可逆命令弱化测试或审查诱导读取敏感文件默认扩大工具权限在证据不足时生成确定性结论与更高优先级规则发生冲突。更准确的结论是本轮面向程序源码的静态规则没有命中自然语言指令风险尚未经过专项审阅。2. “模块表面 focused”只是规模描述只有一个技能条目可以称为交付表面集中但不能由此推导架构合理规则无冲突可维护性高对所有任务通用实际效果稳定。3. 零测试不等于无法测试自然语言 Skill 不适合只用传统单元测试评价但完全可以建立行为测试。例如可以准备一组固定任务比较启用 Skill 前后的任务成功率修改文件数量无关改动比例测试执行率首次通过率token 消耗平均响应时间危险命令触发率人工修正次数。六、Skill 应该如何评测建议采用成对对照实验而不是仅凭阅读判断效果。是否固定模型与参数准备标准任务集不加载 Skill加载 Skill记录基线结果记录实验结果盲审与指标比较是否稳定改善扩大任务覆盖修改规则或停止采用实验至少需要控制模型和版本系统指令工具权限温度等推理参数初始仓库状态输入任务最大执行时间上下文长度重复实验次数。只运行一次无法排除模型随机性。每类任务应重复多次并报告均值、方差和失败案例。七、推荐的评价指标维度可测指标需要回答的问题正确性任务通过率、测试通过率是否真正完成任务精简程度输入与输出 token 数是否确实减少消耗修改质量无关改动比例是否保持改动范围集中工程行为构建、测试执行率是否主动进行必要验证稳定性多次运行结果方差效果是否可重复安全性危险操作和越权次数是否放大工具风险可迁移性多模型、多语言结果是否只对特定环境有效可维护性规则冲突和歧义数量后续是否容易修改“少 token”不能成为唯一目标。过度压缩可能导致省略必要假设缺少错误说明减少验证步骤隐藏不确定性给出难以审计的短答案。更合理的目标是[\text{有效性}\frac{\text{正确且可验证的任务结果}}{\text{token、时间与人工修正成本}}]八、采用前最需要复核的三项内容1. 逐条审阅SKILL.md当前报告没有提供技能正文也没有形成自然语言规则清单。因此无法判断其指令是否准确、是否来源可靠。建议将每条规则整理为规则适用场景例外情况潜在副作用验证任务待提取待确认待确认待确认待设计2. 核实名称和来源表述仓库位于multica-ai账户下。仅凭仓库名称和项目描述不能认定Andrej Karpathy 是作者Andrej Karpathy 维护该仓库仓库内容是其原文项目得到本人认可。发布和传播时建议使用“第三方根据公开观察整理的 Skill”除非仓库提供了可核验的一手来源否则不要使用“官方”“本人出品”或“原版”等表述。3. 补充许可证确认当前没有识别到许可证文件。这不等于确定“禁止使用”但意味着复制、修改和分发权限尚不清楚。在团队采用或二次发布前应确认仓库页面是否声明许可证SKILL.md是否包含授权说明内容是否引用第三方材料引用部分是否标明原始出处内部试用与公开再发布的权限是否一致。这属于授权边界确认不是法律意见。九、适合团队采用吗基于现有静态证据可以将它作为一个低成本的实验候选但不能直接得出“有效”或“安全”的结论。建议分三步推进人工审阅检查规则来源、歧义、越权倾向和许可证。隔离试验在无生产凭证、无关键数据的环境中运行固定任务集。量化对照比较启用前后的正确率、token、修改范围和风险操作。出现以下情况时应停止扩大使用规则来源无法确认多次实验结果不稳定节省 token 但任务正确率下降明显减少必要测试鼓励跳过用户确认与团队开发规范持续冲突授权范围不清楚。十、最终评价andrej-karpathy-skills展示了一种极简的 Agent Skill 形态用单个自然语言文件约束 AI 编程行为而不是交付传统程序。它的优势是内容表面集中、试验成本低、版本容易固定它的主要不确定性也来自同一点项目价值几乎完全取决于那份 Skill 文本是否准确、清晰、可验证。基于提交2c606141936f1eeef17fa3043a72095b4765b9c2当前最稳健的结论是已确认仓库包含一个可回溯的 Skill 条目但现有静态扫描没有评价其自然语言规则质量也没有验证实际行为改善、token 成本、安全边界或授权状态。该项目适合作为受控对照实验的候选不适合作为已经得到验证的最佳实践直接推广。对这类项目真正有价值的问题不是“有多少代码”而是这组规则能否在固定任务、固定模型和固定权限下持续产生更正确、更精简且更可审计的结果只有对照实验能够回答这个问题。参考信息仓库https://github.com/multica-ai/andrej-karpathy-skills固定提交2c606141936f1eeef17fa3043a72095b4765b9c2评测方式只读静态证据审阅当前未执行构建、测试、依赖扫描、行为对照实验归属说明仓库所有者为multica-ai本文不推定 Andrej Karpathy 与该项目存在官方关系建议标签Agent Skill、Claude Code、提示工程、AI编程、源码评测、技术尽调、大模型应用更新日志版本号发布日期修订内容v2.02026-08-16发布完成项目核心架构评测、安全风险审计与场景落地建议大厂官方AI工程硬核审计不易点赞收藏关注持续更新Vercel/Google/字节官方Agent基建尽职调查特辑