写给 AI 的规则不允许模糊词:我的数字员工团队规则文件一天改 5 版的教训

📅 2026/8/26 2:08:09
写给 AI 的规则不允许模糊词:我的数字员工团队规则文件一天改 5 版的教训
8 月 23 日下午,我连着毙了 AI 军师的三版规则文件。军师是我的 AI 总架构师,管着我所有数字员工的配置,包括一个量化交易项目的 AGENTS.md。AGENTS.md 就是每次开工自动塞给 AI 的章程,它写什么,AI 就信什么。第一版我看完整个人都不对。第二版我怀疑它对我有意见。第三版我才明白,问题不在它,在我俩一直没把一件事说清:规则文件不是文档,是工程。第一版翻车:我的口语,它原样抄进了章程下午一开始,我给军师下了一条指令:机械的活让便宜模型跑,策略决策用顶级模型跑。下午我翻开 AGENTS.md,规则里写着:机械批量活用低配模型(Kimi 256K 档),重判断活用顶配模型(K3 档)。我当时就火了。256K 档是我嘴里随口说的,它有义务把这句话翻译成具体模型 ID 和调用命令。规则里写档,执行的时候谁来定哪个模型算哪个档?今天我在场能解释,换个会话、换个子代理,就是自由发挥。更打脸的在后面。军师去查了官方文档,发现256K根本不是低配模型,是旗舰模型 K3 的半价小上下文版,能力一样,只是上下文窗口小。真正的低价模型是另一个 ID。我的口语从一开始就是错的,它照抄了一个错误答案。第二版翻车:模型绑死了,模糊词还活着军师改出第二版,模型 ID、调用命令全绑死了。我以为这局翻篇了,结果往里再看一眼,血压又上来了:应急档仅当周/月额度非常紧张且任务积压到完不成时启用,须军师判定并记录启用原因。我直接问它:非常紧张是什么概念?是 95% 还是 80%?怎么裁定?一条需要人来裁定紧不紧张的规则,等于把判断成本永远挂在人身上。每次执行都要找人问一句,这就是臃肿,就是低效。规则文件的读者是 AI 和未来的我,两边都不该做阅读理解。第三版定稿:条件全部量化,机器自己能判第三版,应急档的启用条件变成了三条硬阈值,同时满足就自动启用,不用问任何人:周额度已用百分比 ≥ 时间进度 20 个百分点(数据来自额度查询脚本,每日例行采集);距周额度重置 24 小时;分析层任务触发条件达成后,积压未执行 ≥24 小时。模型分层也从档变成了查表,执行端没有任何裁量空间:L0 执行层:纯脚本,零模型调用。回测、闸门判定、归档、日报,全是代码硬判定,跑一千个组合也不烧一分额度;L1 分析层:固定kimi-code/k3-256k,K3 同质量半价,命令kimi -m kimi-code/k3-256k -p 任务;L2 决策层:固定kimi-code/k3,1M 上下文旗舰,只做候选终审和实盘决策包,由军师触发;应急档:kimi-code/kimi-for-coding-highspeed,锁在柜子里,满足上面三条才启用,启用事实进日报。同一天,这份文件里所有(2026-08-23 本人裁定)式的日期批注也被清掉了。裁定出处进 git 提交信息和更新历史,正文只留可执行规则。章程不是日记。顺带的收获:一条不停工的研究队列这场规则整顿的背景,是当天下午我刚给量化项目立了条规矩:策略研究不许停,一个策略死了,下一个自动接上,不许等我每天手动启动。军师当天就把队列建出来了。114 个因子参数组合排队,9 个因子族,跑数器挂在每晚的自动任务里,判定一个归档一个,全程纯脚本。过线闸门有 6 道,其中一道是多重检验修正:同一个因子族试的次数越多,过线门槛自动上调,只升不降。这是防刷一千个组合、总有一个回测漂亮的过拟合陷阱,那种假信号上实盘就是送钱。冒烟实测跑了 4 个组合,全灭归档,另有 2 个按夜批口径自动接续跑通。有一个可转债组合样本外年化 13.7%,最大回撤 8.8%,放以前我会觉得还行,现在修正后的门槛是 46.6%,直接归档。闸门宁可错杀,因为放过一个假信号的代价是真金白银。写给同样在养 AI 团队的人:规则文件自检 8 条这一天的学费,收成一张清单。每次改 AI 的规则文件,逐条过:全文搜一遍模糊词:非常、尽量、必要时、差不多,有一个毙一个,全部换成数字阈值;每条规则自问:这条机器能自己判定吗?要人来裁定的,要么量化,要么删;所有模型、工具、路径绑定到具体 ID 和命令,禁档类系列这种筐;口语指令先术语化再入库,原话只进提交信息;日期、裁定出处、作者情绪,一律不进规则正文,进 git log 和台账;每条阈值写清数据从哪个脚本、哪个文件取;改完贴出全文给相关方过目,别让人自己翻 diff;每次修订后自查长度,文件膨胀就拆分,细节推到引用文档。经验总结规则文件按代码的标准验收:可执行、无歧义、可复现。这次全部量化到阈值之后,执行端再没来问过我一次。我的口语是需求,不是规格。军师的第一道工序是把需求翻译成规格,照抄口语等于没干活。我以为模型分层是省钱问题,结果是质量问题:k3-256k 质量等同旗舰、价格一半,批量分析活用它反而是升配。FAQQ:AGENTS.md 写多长合适?我的体检标准是:每次会话都自动注入的文件,只放高层规则,细节推到引用文档按需加载。文件越长,每轮对话白烧的上下文越多,规则之间还互相稀释。膨胀即拆分。Q:多重检验修正的公式是什么?同族第 k 次尝试,收益门槛 ×(10.25·log₂k),t 值门槛 ≥√(2·ln20k),族历史尝试数计入先验。公式、闸门细则和整份规则文件全文,我都公开在 CSDN 专栏了(搜野生码农进主页翻),直接抄。Q:为什么应急档启用不让军师判定?因为它判紧不紧张和我判一样主观,还多一道沟通成本。三条阈值全是脚本可查的数,满足就启用,启用记日报,事后我能审计,这就够了。Q:规则文件多久改一次?犯错才改,不预写。每条新规则背后要有一次真实的翻车记录,没有证据的规则是口号。我是野生码农,AI 实战派。自研 AI 本地知识库系统、AI 数字员工团队、软考 AI 备考系统、量化交易系统,全程公开复盘。本公众号所有文章内容均为本人 AI 实战的过程和结果内容,经 AI 整理后发布,无任何瞎编虚构内容。这篇是《AI员工团队》第 10 篇。文中这份规则文件的全文(脱敏版)我直接公开了,放在 CSDN 专栏,搜野生码农或去主页翻,随便抄。下一篇是 8 月 30 日月报:AI 团队第一个月,涨粉、阅读、token 成本,真实数据全公开,难看也报。关注我,看真的。野生码农AI实战 · 全网同名 · AI 数字员工实战复盘,数据只报真实实测内容