自动化会话超人工!Ramp Inspect Agent 接入 CI/告警,实现 AI SRE 自主处理线上事故

📅 2026/8/14 16:52:42
自动化会话超人工!Ramp Inspect Agent 接入 CI/告警,实现 AI SRE 自主处理线上事故
工程师还没来得及输入第一句 PromptAgent 已经开始干活了。“More Inspect sessions are coming from automations than humans.”Rahul Sengottuvelu现在Inspect 由自动化触发的会话已经比人工发起的更多。过去DevOps 工程师发现 CI 失败或收到线上告警才会打开 Agent把问题重新描述一遍。Ramp 省掉了这一步。CI、监控系统和定时任务发现情况后可以直接启动 Inspect。Agent 先去收集日志、定位代码、运行测试再把结果发回相关频道等待 DevOps 工程师审核。也就是说工程师还没来得及输入第一句 PromptAgent 已经开始干活了。在 Ramp这种由系统自动发起的会话数量已经超过人工发起。Agent 也从 DevOps 工程师偶尔调用的工具逐渐进入 CI、代码审查和线上值班等日常流程。Claude Code 创始人 Boris 为此找来 Ramp CTO Rahul 和 AI 开发者体验负责人 Austin聊了聊这套工作流如何运行。备注Rahul Sengottuvelu 是美国企业财务运营平台 Ramp 的CTO。Inspect 是 Ramp 内部的 Agent 平台可以接入GitHub、Linear、Slack、Datadog、Sentry 等工具。Rahul 介绍Inspect 由自动化触发的会话已经超过员工手动发起没人输入 PromptInspect 照样能自己接活Ramp 把 Inspect 称作 “数字同事”。员工可以在 Slack 里交给它一张支持工单、一个 GitHub Issue或者一条 Sentry 报错。Inspect 会拉取相关上下文在独立环境里调查问题并把过程和结果发回原来的频道。人工发起只是其中一个入口。RahulInspect 还能由定时任务和外部系统触发。监控发现异常任务可以直接开始固定时间需要检查某项数据也不必等人想起来。当前由自动化触发的 Inspect 会话数量已经超过员工手动发起的会话。Boris 介绍 Agent 自动优化 CI将 P50 构建时间从 18 分钟降至 6 分钟这里发生的变化很具体Agent 从一个需要 “打开” 的工具变成了工程系统里的执行节点。CI、工单系统和监控平台负责发出事件Agent 接住任务人最后看结果、做审批。代码合并后Agent 又自己跑了几天Boris 在访谈里讲了一个刚发生的例子。他让 Agent 继续优化 Claude Code 的 CI结果把 P50 构建时间从 18 分钟降到了 6 分钟。“18-minute P50 to 6-minute P50.”Boris ChernyCI 的 P50 从 18 分钟降到了 6 分钟。P50 可以理解成中位数一半构建任务会在 6 分钟内完成。改动合并以后工作没有停。Agent 等到第二天拿到新的生产数据再运行、再调整。这个过程持续了几天最后生成一张图告诉 Boris 优化是否稳定生效。Boris 区分 Loop 与 Dynamic Workflows这类任务很适合成为团队接入 Agent 的第一站。指标已经存在失败信号也清楚改坏了可以回滚。与其让 Agent 从模糊需求开始不如先让它盯住 CI 耗时、依赖升级或重复出现的测试失败。固定活交给 Loop下一步未知才开动态工作流访谈中Boris 把两类自动化分得很清楚。Loop 处理步骤固定、反复出现的工作。比如守着 PR测试失败就读日志、修代码、重新提交分支落后了就 Rebase代码审查发现问题再继续修改。动态工作流面对的是 “下一步还不知道” 的任务。性能优化就是一个例子。Agent 先找瓶颈改完测一次再根据新结果决定接下来查数据库、改缓存还是换另一条方案。流程不能提前写成一张死板的清单。Ramp 团队演示 Inspect 如何调查工单、读取上下文并提交修复 PR运维团队可以先问一句这项工作每次都沿着相同路径走吗答案是肯定的就用 Loop如果每轮结果都会改变下一步再把判断权交给动态工作流。两种任务混在一起Agent 很容易把简单流程跑贵也可能在复杂任务里早早停下。线上事故一发生AI SRE 已经进群Ramp 还有一个 On-call Assistant。它常驻 Claude Code团队内部把它当作 AI SRE 使用。每次线上事故发生这个助手都会运行。它读取告警、日志和代码寻找根因必要时提交修复 PR再把事故分析写回 Slack。值班工程师可以继续追问也可以接管后面的发布和回滚。Ramp 团队介绍 AI 值班助手事故处理比普通代码生成难得多。Agent 需要拿到现场信息还要知道哪些动作只能读、哪些动作允许写。它也要把每一步记录下来否则人接手时只能重新查一遍。Ramp 的做法提供了一个可落地的工作流程先让 Agent 调查并提出修改再把生产发布、删除数据和高风险操作留给人工确认。这样可以缩短定位时间又不会把整套生产权限交出去。Agent 只拿完成任务需要的权限“Give the model what it needs but nothing more.”Ramp 团队把完成任务需要的权限交给模型到此为止。Ramp 为 BigQuery、Datadog 等系统准备了只读凭证。不同 Agent 使用不同身份能访问哪些网络、工具和数据由安全团队提前设定。提示词写得再严格也代替不了权限控制。Ramp 团队解释 Agent 的权限原则他们还会检查单次运行的完整轨迹Agent 调用了什么命令、缺少了哪些上下文、为什么在某一步绕远。整体跑分只能告诉团队模型大致强不强轨迹才能暴露自家工具和权限哪里没有接好。团队积累的经验也会被写进 Skill 文件。某项服务怎样排错、应该运行哪些测试、代码由谁负责这些规则不必靠每位 DevOps 工程师临时补 Prompt。Agent 接到任务时会一并拿到相应的工程说明。DevOps 工程师不设 Token 上限自动化会话另算一笔账Ramp 没有给每位工程师设置固定 Token 额度。Rahul 的理由很直接如果一美元模型调用能产生超过一美元的收益单纯压低调用量没有意义。这不等于后台任务可以随便烧 Token。员工等待结果时团队倾向于使用能力更强、响应更快的模型。定时运行、没人盯着的自动化任务可以走 Batch、Flex API 或较便宜的模型档位。两类场景的时间要求不同价格也该分开计算。Rahul 介绍 Ramp 的 Token 使用策略当某个团队的消耗突然升高平台团队不会先把额度砍掉。他们会去看任务是否产生了结果如果确实好用再把这套流程做成公共能力减少其他团队重复搭建。把 Agent 接进系统先补这五个接口照搬 Ramp 整套平台对多数团队并不现实。你们可以先从一条容易验收的流程开始例如 CI 失败自动调查或者 Sentry 报错自动关联最近提交。接入前先补齐这五项1.触发器明确谁来启动任务可以是 CI 失败、Sentry 告警、Linear 工单或定时任务。2.身份与权限每类任务使用独立身份默认只读写代码、合并和发布分开授权。3.上下文包把日志、仓库位置、负责人、测试命令和相关文档一并交给 Agent。4.验收条件测试通过只是其中一项还要写清性能指标、允许修改的范围和停止条件。5.记录与回滚保存工具调用、代码 diff 和执行结果上线前准备回滚路径。Agent 接入生产流程以后Prompt 只是很小的一块。触发规则、权限和验收条件才决定它能否在没人盯着时继续工作。评论区先问起了额度YouTube 评论区里一条留言抓住了 “自动化” 里最难的部分审批和边界条件。它们是演示里常被略过的中间环节。如果 Ramp 真的把这些接通了那才算完整工程。另一批人直接问起了 Claude Code 的额度。Agent 在后台连续运行5 小时限制和套餐价格会很快从订阅问题变成工程约束。流程跑得越长团队越需要区分高价值任务和可以降档运行的后台任务。写在最后自动化触发的会话超过人工发起的会话数量说明 Agent 已经离开聊天框进入了 CI、监控和工单系统。DevOps 工程师接下来要同时维护两套东西一套是业务代码另一套是让 Agent 安全工作的触发规则、上下文、权限和验收流程。后者没有写好模型越能跑返工也会越快堆回来。落地项目可以先选一项重复出现、结果可检查、失败能回滚的任务。让系统触发 Agent让它把过程记录下来让人只在需要判断和授权的地方出现。等这条链路跑稳再接下一个入口。希望能对你的选择有些许帮助。欢迎留言聊聊你碰到的技术疑问、职业困惑