知识图谱赋能Agent Ops实践:从AIOps到真正自动化的故障定位

📅 2026/8/7 15:05:16
知识图谱赋能Agent Ops实践:从AIOps到真正自动化的故障定位
本文整理自 QCon 北京 2026《裴彤 - 知识图谱赋能 Agent Ops 实践》通过AI音视频转录总结工具Ai好记视频转文字整理以下为精炼整理后的会议笔记内容。监控指标堆成山、日志海量刷屏、告警天天炸可根因还是得靠人一点点查。这是几乎所有运维团队的日常。裴彤在 QCon 北京 2026 的分享里给了一条从传统 AIOps 走向 AgentOps 的清晰路径用可观测性知识图谱当底座再叠加多智能体架构把故障定位从「半自动」推进到「真自动化」。这篇把整套思路、架构和工程化实践整理成一份能直接落地的笔记。一、为什么传统 AIOps 始终差一口气我们先看清问题在哪。传统 AIOps 更像是算法辅助模型能做异常检测、能聚类日志但很难实现真正的自动化根因定位。数据是海量且孤立的指标、日志、Trace 各管一段关联关系全靠人脑拼。大模型和 Agent 的出现让数据建设、应用和系统交互的全面智能化成为可能也就是演讲里说的 AgentOps。但这里有一个关键前提不能直接把原始监控数据一股脑丢给 Agent。原因很直接。企业运维数据量巨大、关联关系复杂全量塞进模型上下文瞬间爆炸成本高得离谱还会急剧放大幻觉。模型会给出过于自信但可能错误的确切结论因为它根本不理解系统的拓扑和依赖关系。所以必须要有一个结构化的「地图」给 Agent 用。二、可观测性知识图谱给 Agent 一张结构化地图这个「地图」就是可观测性知识图谱。它包含三个层次层次内容作用实体监控对象服务、Pod、主机等明确分析对象是谁关系对象间的依赖、部署关系理清异常传播路径属性对象描述及关联的元数据提供分析所需的细节有了这张图Agent 就知道系统长什么样、哪个服务依赖哪个服务、异常会怎么传不再在海量数据里盲目搜索。知识图谱为智能分析收敛了范围是整套方案的推理基石。三、用 AI 构建 AI知识图谱怎么自动长出来知识图谱价值大但构建是最大挑战。手写规则太慢全量喂给模型又太贵、还会污染数据。演讲给了一个很妙的解法用模型生成规则用程序执行规则。具体是两步把抽样数据比如指标样本、日志样本交给大模型让它分析并提取出识别实体、关联关系的模式规则。例如从带ip标签的 CPU 指标里识别出「机器」这个实体。这些有限的规则被程序化执行自动化、持续地生成和更新图谱数据。这样做的好处是避免了直接用模型处理全量数据的不可靠和高成本图谱能持续进化同时保持数据干净。四、四种 Agent 应用模式图谱不只是背景板同一个知识图谱在 Agent 系统里可以有四种用法这也是演讲里很有启发的部分作为上下文给 Agent 提供背景信息让它理解当前环境。作为工具供 Agent 查询和遍历按需拉取相关节点和关系。作为规划器用图谱结构约束 Agent 的分析步骤避免它乱走。作为验证器对 Agent 的假设结论做事实校验防止误导。五、假设验证循环专治模型的过度自信当 Agent 推断出某个根因比如「B 服务异常」后系统不会直接采信。它会用知识图谱去查 B 服务的实际状态比如成功率、存活指标。然后分三种情况处理图谱显示 B 正常把结果反馈给 Agent 让它重新分析图谱确认 B 异常接受结论无法验证要求 Agent 给出「不确定」的推测。这个循环能有效纠正模型过于自信的幻觉防止把错误结论直接推到运维人员面前。它是整套方案可靠性提升的关键一环。六、工程化实践先精炼数据再交给 Agent为了节省成本、提升效果演讲强调要对原始数据做预处理用传统算法异常点检测、日志聚类去重先把数据清洗一遍只把精准、关键的信息喂给 Agent。这既省 Token又能减少幻觉让 Agent 把算力花在真正重要的分析上。这其实是一种「驾驭」输入数据的思路上下文不是越多越好而是越精准越好。七、Multi-Agent 与 Workflow 结合各有分工演讲还讲了架构层面的设计核心是「混合策略」对于步骤明确、场景固定的确定性问题比如标准告警处理流程封装成Workflow 或 Skill确保执行可靠高效。对于步骤未知、需要推理探索的不确定性问题比如复杂根因定位交给Agent自主决策。同时采用「主 Agent 子 Agent」架构主 Agent 负责协调子 Agent比如日志分析、Trace 分析专注特定领域共享上下文解决单一 Agent 上下文不足和「中间遗忘」的问题。八、记忆系统让运维 Agent 持续进化一个完整的运维 Agent光有推理还不够还需要一套记忆系统来驱动持续进化短期记忆记住当前故障现场结构化记忆知识图谱本身业务知识库沉淀领域经验长期记忆历史案例学习与时间衰减。目标是实现 Agent 的自我学习和持续进化每次故障排查都能变成下一次的养料。这也是从「能用」走向「越用越聪明」的关键。落地建议结合这场分享如果你也想往 AgentOps 方向走可以分三步先建一张可观测性知识图谱把实体、关系、属性沉淀下来。按四种模式把图谱接入 Agent优先做好「验证器」这一环。用「主 Agent 子 Agent」混合架构把确定性的流程封装成 Workflow。这类几十分钟的演讲直接听一遍很难记住全部框架。我自己的习惯是把技术分享用 Ai好记 转成图文笔记它会自动生成精华速览和思维导图把多智能体、知识图谱这些结构化框架抓出来事后翻起来比重新看视频高效得多。做技术学习和知识整理这已经成了我的固定工作流。FAQAgentOps 高频问题Q为什么直接拿通用大模型做故障定位效果不好A运维数据量巨大且关联复杂全量塞进模型会导致上下文爆炸、成本高昂并放大幻觉问题。模型缺乏对系统拓扑和依赖关系的理解容易给出自信但错误的确切结论。Q可观测性知识图谱解决了什么问题A它让 Agent 具备系统拓扑认知能理解异常传播路径避免在海量数据中盲目搜索为智能分析提供结构化地图。Q知识图谱怎么低成本自动维护A用模型从抽样数据中提取模式规则再用程序执行这些规则持续生成和更新图谱避免直接用模型处理全量数据的高成本和不可靠。QAgent 和 Workflow 怎么分工A确定性问题步骤固定封装成 Workflow 或 Skill 保证可靠不确定性问题需推理探索交给 Agent 自主决策两者可结合使用。Q假设验证循环为什么重要A它能用知识图谱对 Agent 的根因结论做事实校验纠正模型过度自信的幻觉防止错误结论直接传递给运维人员。以上内容由 Ai好记 转录整理。Ai好记是一款支持音视频转图文笔记的AI知识库工具支持B站、小红书、抖音、小宇宙等平台链接及本地音视频文件视频转文字后自动生成精华速览、思维导图和结构化图文笔记帮助你把几小时的视频内容变成可搜索、可复习的图文笔记。