开放安全基准:迈向自主企业网络防御

📅 2026/8/13 12:03:21
开放安全基准:迈向自主企业网络防御
大家读完觉得有帮助记得关注和点赞摘要企业正朝着自主网络防御的方向发展即能够构建组织安全态势感知能力并据此进行评估、决策和行动的智能体AI。这建立在对企业安全态势的整体视图之上——即安全态势管理所整合的持续、跨厂商的身份、云与基础设施、数据、应用及其配置的全局画面。当智能体承担这些工作时关键不在于智能体能否给出答案而在于我们是否应信任它给出的答案。该领域尚无法回答这一问题。真实的企业环境是私有的、跨厂商的且高度关联的没有任何一个环境作为共享的、可查询的目标公开暴露用于端到端评估此类智能体。我们将此称为环境数据鸿沟。我们提出了开放安全基准OSB一个在此类工作上对智能体AI进行基准测试的框架。OSB呈现一个精心策划的企业环境——一个冻结的、整体的安全状态视图——并通过两种模态评估态势调查在关系型快照上的文本到SQL查询以及在相同环境的服务化实例上通过各厂商原生API的查询。冻结环境将目标状态固定为不可变快照并将答案锚定于封闭形式的地面真值。OSB由五个组件构建数据层、任务与评估集层、多维评分层、最小可审计执行框架以及自带路径该路径在同一基底上同时服务于公开比较和私有租户评估。我们通过两个身份安全包和一组涵盖多种规模的合成组织环境数据集来实例化该框架并规划其向更广泛的态势子域、调查模态以及从评估到修复的防御阶段扩展的路径。关键词 自主企业网络防御 · 安全态势管理 · 智能体AI · 基准测试1 引言自主网络防御——即在有限人工干预下感知、推理并应对网络威胁的系统——现已成为企业安全的明确目标相关研究包括对自动化和自主网络防御的综述[55]以及面向自主智能体的训练环境[51]。然而感知-推理-行动循环的每个阶段都预设了一个基础对组织自身安全状态的准确、实时、全面的理解。态势感知研究对此进行了精确阐述[14]并在安全领域被采纳为网络态势感知[17]智能体无法对其看不到的东西采取行动。因此建立这种自我认知是自主网络防御的先决条件。安全态势管理——即对组织防御准备状态和安全状态进行持续、全面的评估——提供了这一态势感知基础所有自主评估或决策都依赖于它。这种评估涵盖多个子域身份与访问[47]、云与基础设施配置[7]、数据暴露与分类[31]、应用安全与漏洞状态[41]、第三方与SaaS集成[34]以及与法规和合同义务的合规对齐[36]。像NIST SP 800-53[23]、CIS关键安全控制[5]和ISO/IEC 27001[20]等目录对该工作进行了规范化而从云审计工具[37,44]到SaaS扫描器[10]的态势工具则在各厂商技术栈中将其落地实施。企业越来越多地将智能体AI应用于此类工作据报道在覆盖范围和分析师吞吐量方面均有提升[18]。随着部署规模扩大关键问题发生了变化智能体可以给出答案但在这个环境中根据这些数据结合其生成的证据和已知的失败方式我们应否信任它回答这一问题需要对智能体在态势工作上进行系统性、可复现的评估且要忠实于实际工作方式。近期网络安全基准在相邻能力上推动了LLM评估[59, 48, 4]但每一个都孤立地针对一个狭窄的切片§2。更根本的是该领域面临环境数据鸿沟企业环境是专有的、跨多个厂商的且数据相互关联虽然存在面向攻击性安全任务的可执行环境[66, 49]但没有任何一个环境能作为跨厂商企业环境的共享可查询基底用于端到端评估防御性态势调查智能体并配有黄金态势答案。因此从业者无法在需要部署智能体的实际工作上进行比较研究人员也缺乏稳定的目标。我们提出了开放安全基准OSB一个用于评估智能体AI在安全态势任务上的框架¹。OSB通过呈现精心策划的企业环境作为安全状态的单一端到端视图来弥合环境数据鸿沟。其方法论承诺是冻结环境智能体通过实践中会使用的界面进行调查——在关系型快照上的文本到SQL或在相同环境服务化实例上通过各厂商原生API。OSB的目标是整个自主网络防御循环直至自动化修复但从评估阶段开始。评估是发现和证实发现结果的只读工作后续每个阶段都建立在此之上§7。我们将态势调查形式化为一个基于执行环境的智能体文本到SQL任务。每个实例是一对 (D, q)D 是组织整体安全状态身份、云与基础设施、身份提供商、SaaS的只读关系型快照q 是一个自然语言安全问题。智能体必须发现 D 中与 q 相关的表组合只读SQL查询以检索支持性证据并综合生成自然语言答案 a。答案根据封闭形式的参照一个判定、一组闭合的匹配主体以及决定性的配置事实进行评分因此评分与计划无关两个语义等价的查询得分相同遵循语义解析中基于外延denotation的传统即根据答案而非逻辑形式来评判解析结果[3]。这将Spider和BIRD系列[64, 27, 25]中模式真实、智能体化的文本到SQL范式扩展到了防御性安全工作将每次调查视为在冻结环境上、通过受限工具接口[61]进行的推理-行动循环[62]。第二种模态保持相同的 D、问题和答案标准但改变界面智能体通过各厂商原生API使用真实厂商工具对同一环境服务化实例进行查询其记录的请求轨迹替代了关系型模态中SQL所扮演的角色§3。我们将这一通用基底具体化为一个明确的首个领域。身份安全态势管理ISPM是一个自然的起点本质上是跨厂商的、数据丰富、影响重大并且新近配备了我们所基于的公开基准定义[15, 63]。该框架在相同方法论下可扩展到其他态势子域。它还沿着自主网络防御自动化的进程扩展评估、风险评估与优先级排序[33]、缓解与修复建议[35]、修复与响应实施[55, 51]以及通过持续监控进行修复后验证[32]。本工作仅实例化了评估阶段§7。本文做出三项贡献i开放安全基准一个评估框架其五个组件数据层、任务与评估集层、多维评分层、最小可审计执行框架和自带路径构成了一个标准化的基底用于关系型和原生API调查并具有明确的信任边界ii一个经过策划的多厂商企业环境数据目录以合成组织数据集的形式打包填补环境数据鸿沟以及iii初始用例包ISPM可见性和ISPM跨厂商端到端实例化该框架并为社区编写的跨态势子域包开辟了扩展路径。2 相关工作安全和数据系统中AI评估已扩展到衡量模型的推理能力、操作可靠性与真实调查工作流的对齐程度。三个方向占主导地位评估以数据为中心的推理的文本到SQL基准涵盖SOC、CTI、漏洞和访问治理推理的网络安全基准以及自动化评估方法论工作。开放安全基准借鉴了所有这些方向。Spider基准是自然语言数据库接口的经典基础。Spider 1.0[64]引入了跨领域、静态模式-查询范式的文本到SQL通过精确集合匹配和后来的执行准确率评分。BIRD[27]转向大规模“脏”数据库需要外部知识接地和值语义接近OSB目标的企业杂乱特征。Spider 2.0[25]将模型嵌入BigQuery和Snowflake等企业环境要求多步骤工作流、错误修订以及代码-模式依赖推理。这些共同标志着从单一SQL输出评分到评估智能体工作流的鲁棒性和可修复性的转变OSB在防御性安全调查中遵循这一转变。ExCyTIn-Bench[59]鼓励在模拟SOC中与威胁调查图对齐的逐步调查而CyberSOCEval[11]将评估基于真实威胁报告和沙箱输出。在网络威胁情报方面CTIBench[1]将专家验证答案与CVE/CWE映射混合SEvenLLM-Bench[21]增加了双语设置和混合语义评分。SecLLMHolmes[54]对标注的C/C和Python代码进行漏洞检测基准测试。通用套件增加广度CyberBench[30]涵盖分类、摘要、NER和QACyberMetric[52]衡量认证级知识CyberSecEval 2[4]评估不安全代码生成、提示注入敏感性和代码解释器滥用。身份和访问推理——现代态势的核心——通过OrgAccess[48]获得关注它构建合成层次结构、权限集和RBAC规则测试模型是否应用访问治理策略。OrgAccess在合成结构中测试RBAC应用而OSB目标是在真实环境中的操作可见性在可泛化到身份之外其他态势子域的基底上枚举身份、识别错误配置、评估经过生产级IAM、身份提供商IdP和SaaS数据的认证态势。OSB将其首批包所打包的两个Sola ISPM基准[15, 63]作为基础它们建立了我们构建的单平台可见性和跨厂商关联任务家族。两个相邻方向使OSB所弥补的鸿沟更为具体。首先可执行智能体环境已出现在攻击性安全领域Cybench[66]以及在更大规模上的NYU CTF Bench[49]在夺旗任务上运行智能体同时存在可共享的错误配置云实验室[45]。这些是共享的、可执行的基底但它们面向攻击而非防御性态势评估且不包含用于端到端评分的黄金态势答案。其次像Steampipe[53]和CloudQuery[8]这样的配置即SQL工具已经将云、IdP和SaaS配置状态暴露为可查询的关系型表直接证明态势即SQL是一种自然且日益普遍的表示方式。但这些是查询引擎和人工运行的审计工具而非智能体基准它们既不提供带有黄金答案的固定任务套件也不提供用于比较智能体的评分方法论。OSB提供的是缺失的部分一个共享的、面向防御的、跨厂商的关系型环境配以黄金态势答案和用于端到端智能体评估的可复现评分方法论。一个互补的方向关注自动化评估方法论。G-Eval[29]使用LLM作为评估器采用思维链表单填写提示与人类判断对齐良好RAGAS[16]引入了用于上下文相关性和答案忠实性的无参考指标。这些为OSB构建评分提供了参考在精确匹配有意义时使用确定性检查在精确匹配失效时使用基于评分标准的LLM评判器并通过专家校准保持双方的可靠性。OSB以三种方式借鉴了这一发展轨迹它采用在冻结关系型快照上的文本到SQL作为统一范式将Spider和BIRD扩展到防御性工作流它将确定性结构指标、基于评分标准的LLM评判器面板和专家校准集成为不同的、可归因的轴而非单一聚合它将公开可比性和私有租户评估作为核心属性通过共享基底和明确的信任边界实现。当每个先前基准针对狭窄能力切片时OSB是一个框架身份、配置、漏洞和更广泛态势子域的包可在共享方法论下插入其中。3 调查模态态势审查是调查性的将来自多个来源的数据关联为企业安全状态的整体视图然后在其上推理以发现和证实一个发现。这种态势感知是自主企业网络防御的基础而执行此工作的智能体必须通过某种查询界面与环境交互。OSB在同一环境上实例化两种调查模态关系型查询和原生厂商接口。因此智能体在其实际会使用的界面上被衡量同时环境、任务和答案标准保持共享。智能体可以通过至少三种界面查询企业环境。关系型查询在集中式存储上的文本到SQL其中每个枢轴实体成为一张表每个跨厂商关系成为一个连接键每个态势问题成为该模式上的工作负载是Spider系列[64, 25]研究的界面。针对活跃厂商端点的API和工具调用由工具使用智能体[62]进行并通过API和函数调用基准[43, 28]衡量。在沙箱中调用厂商CLI的Shell和命令行调用在智能体-计算机界面下研究[61]。每种路径都到达相同的发现但定义了“完成工作”的不同方式OSB实现了关系型界面和原生厂商界面后者涵盖直接API调用和厂商命令行工具。关系型模态忠实于调查活动态势分析师关联多个来源连接、透视、过滤而关系型查询是该关联的直接、可读编码。同时对基准而言决定性的是其可复现目标最廉价地获取和检查因为态势状态天然是关系型快照可不可变地冻结并允许廉价集合等价性检查。可复现性来自冻结或记录目标而非SQL本身API-Bank驱动模拟API执行器Gorilla针对静态API数据库评分SWE-bench风格框架在冻结容器镜像中使用确定性测试运行智能体[28, 43, 61]。文本到SQL之所以有效恰恰是因为态势相关的配置和身份状态而非安全遥测作为集中化、规范化、可查询的关系型数据可用像Steampipe[53]和CloudQuery[8]这样的配置即SQL引擎已将跨厂商配置状态呈现为关系型表而开放网络安全模式框架[38]和托管安全湖[2]规范化的是遥测而非OSB查询的资产和授权状态。困难且通常未解决的部分是跨厂商身份解析将HR系统、身份提供商和多个云中的同一个人协调为同一身份而这些引擎很少将其暴露为干净的外键。OSB因此将其保留在任务中而非假定已解决§6。原生厂商模态按操作员实际执行的方式衡量工作适用于许多不存在统一关系型层的场景。相同的环境快照被编译为一个运行中的世界通过各厂商原生API界面服务该企业智能体使用真实厂商工具查询它aws CLI 和对身份提供商、生产力套件、源主机和HR系统的普通HTTP调用以操作员身份认证。其唯一文档是固定、真实的厂商API规范且它从未看到底层表它仅通过计算得到的、确定性的、只读的API响应观察环境因此可复现性来自冻结快照背后的忠实模拟器而非冻结查询结果。智能体发出的每个请求都被记录到请求日志中该日志扮演了关系型模态中查询轨迹的角色——即评分器读取的证据。原生厂商模态以廉价集合等价性换取对工作真实完成方式的保真度且不需要预整合的模式。两种模态共享评分层、环境和答案标准它们仅在查询界面和其产生的轨迹上有所不同。文本到SQL首先被标准化因为其可验证目标最廉价且检查查询产物的指标——SQL质量和结构性的表与连接检查§4.3——是它特有的而答案正确性和推理质量两者适用。没有一种界面是上限因为评分独立于界面定义进一步的模态用于传递访问路径的图界面、云态势审计检查可在相同方法论下插入§7。4 框架组件开放安全基准包含五个组件共同实现第3节所述承诺。数据层§4.1将企业环境呈现为冻结的共享快照。任务与评估集层§4.2定义安全问题及其预期结构化答案。评分层§4.3单独报告每个标准。执行框架层§4.4提供一个小的、固定的智能体动作空间使每次运行可审计和可复现。自带路径§4.5允许研究人员和从业者从同一基底使用框架而不损害彼此需求。本节在设计意图层面描述每个组件具体实例化出现在第5和第6节。4.1 企业环境数据态势审查针对企业的运行状态身份、资源、角色和组成员资格、配置设置、漏洞以及连接它们的访问路径。OSB的数据层将该状态暴露为策划的关系型数据库采用第3节的实体到表映射及其理由。厂商覆盖范围包括态势风险集中的各层云与基础设施、身份提供商、SaaS套件、应用和依赖清单、数据存储当前包实例化了一个子集。在每个厂商内部模式捕获了如Scout Suite[37]和ScubaGoggles[10]等规则集所查询的实体和关系以及厂商最佳实践指南[39, 19]视为审计相关的工件。跨厂商多栈推理所依赖的可连接列共享电子邮件和用户名、组和资源标识符、所有权字段被记录但故意不声明为外键因此智能体必须推断哪些列对应跨厂商身份解析作为任务的一部分§6。这种只读关系型数据是共享基础同时不排除其他基底日志流、图遥测、模拟端点传递性、基于路径的问题嵌套组成员资格、权限提升链在平面SQL中最弱因此面向身份攻击路径工具[50]精神的图界面未来可能更好地服务它们§7。信任边界将智能体观察到的内容模式及其内容与仅评估器观察到的内容黄金参照、预期结果和种子数据绑定分开。数据集由生成器管道生成在发布前对每个问题与数据进行交叉检查但该管道位于基准之外发布的工件是冻结快照加上评估器专用参照而非创作轨迹。因为无论数据描述哪个组织相同契约都成立针对一个环境编写的基准可移植到另一个环境而无需重新设计方法论。4.2 任务与评估集一个任务配对了一个自然语言安全问题和一个SQL可推导的结构化答案第1节的 (D, q) 表述。该答案是操作员会使用的实体列表及字段或是一个态势判定及其背后的配置事实对于枚举问题答案是匹配主体集合无符合条件时为空。因为答案独立于推导它的查询指定等效查询获得相同分数。在评估器侧每个任务携带一个黄金参照该参照针对智能体看到的相同数据生成预期答案信任边界将此参照保持在单独可见性类别中仅评分器可访问。评估集是一个连贯的任务集合范围限定于某个领域或能力如身份卫生、配置漂移或跨厂商推理。契约围绕三个可见性类别设计用于公开比较和消融的开放类保留参考工件以保护排行榜完整性的门控类以及将任务和评估器保留在租户边界内的私有类。开放比较和私有自带评估现已提供门控排行榜通道在路线图上§7。同一任务定义服务于公开比较和内部审查而无重复。4.3 评估指标OSB使用从跨厂商ISPM基准[63]采纳的评估标准对每次运行评分逐字重用其附录B评分标准文本而非重新推导。评分在四阶段管道中进行执行每个问题收集每个问题的证据包应用评分标准引导的LLM评判器面板并运行确定性结构检查。评判指标使用三级尺度0, 0.5, 1二元答案判定除外。评判器设计遵循LLM-as-judge评估[29]和检索增强评估[16]的工作应用带有明确阈值的基于评分标准的面板而非自由形式评分。确定性结构指标添加了免疫于纯LLM判断语义模糊性的验证层。框架避免将这些标准折叠为单一聚合分数一个数字掩盖了失败来源而分离的指标让团队将性能变化归因于具体行为并以他们关心的属性语言阅读评分卡。答案正确性是主要指标依据任务地面真值原子的答案字段§5评分一个判定、一组闭合匹配主体以及确定性的配置事实。由于智能体以自由形式散文回答由基于评分标准的评判器将其映射到该参照上吸收良性的变异如主体命名方式或计数报告方式“大约12”与精确12而非要求朴素字符串相等。其他评判标准评估是/否判定、推理轨迹的实用性以及生成SQL的模式一致性而确定性结构指标衡量智能体是否构建了所需的关联路径、发现所需的表和连接。所有指标都与地面真值原子或最小充分证据集推导答案所需的最小表和连接集合进行比较而非特定查询计划因此分数与计划无关§4.2标准互补但非统计独立错误的表往往产生错误答案因此我们报告它们之间的关系而非假设正交性。答案正确性、判定和推理标准适用于两种调查模态SQL质量标准和结构性的表与连接指标特定于文本到SQL模态因为它们检查查询产物。在原生API模态中相同结构性角色由智能体记录的请求轨迹是否到达发现所需的端点和对象来扮演§3。表1OSB态势调查评估标准评分标准文本采纳自跨厂商ISPM基准[63]。类别标准尺度类型描述答案质量AnswerCorrectnessVsGT0/.5/1评判答案与地面真值判定、主体和事实一致AnswerVerdictCorrectnessVsGT0/1评判主要是/否判定与地面真值匹配推理ReasoningUtility0/.5/1评判推理轨迹向答案做出合理进展SQL质量SQLSemanticAppropriateness0/.5/1评判SQL是合理、模式一致的策略结构性Tables/Joins Recall[0,1]确定智能体使用了所需表和连接的比例Tables/Joins Prec., F1[0,1]确定表和连接的精度与F1除每指标分数外OSB还在运行内按任务分类法复杂性、聚焦点、平台、单平台与跨平台范围§6以及跨环境变体当前为组织规模以及随着目录增长更广泛的厂商栈、模式变体和噪声矩阵§5分解每个指标。泛化和鲁棒性因此从相同标准跨配置读取而非单独测量利用一种配置的智能体与在整个矩阵上保持稳健的智能体得以区分。这种分解是一种报告实践而非额外标准。分数来自两个不同提供商的评判器面板配对以减少LLM评判器已知的相关性和自偏好偏差[67, 57]。每个任务运行多个独立轨迹每个轨迹由每个评判器评分指标分数是汇总投票的众数遵循自洽性[58]精神的样本多数投票平局时取较低等级。由于前沿评判器漂移分数仅在固定评判器配置内可比且开放权重评判器可被替换以实现可复现性或保持私有租户数据在边界内§4.5。为暴露评分器噪声而非将其隐藏在点估计中每个指标都附带bootstrap 95%置信区间对任务重采样和评判器间一致性Cohens κ [9]。最后框架将专家校准视为锚点自动化分数应针对专家标注子集进行验证并报告其一致性以便评分器漂移保持可见。4.4 执行框架执行框架是运行智能体处理任务并产生计算每个指标所需产物的执行基底。一个单一原则指导其设计智能体采取的每个动作必须可从记录运行本身观察和复现。这排除了隐藏状态、不透明工具调用和无法重放的自由形式交互模式。智能体通过两个工具操作。get-schema返回整个环境的模式文档为单一视图每个表及其列、行数和简短说明。它暴露列名但不暴露类型或外键因此智能体必须从列本身推断每个连接包括厂商内部和跨厂商连接§4.1。run-query执行单一SQL语句并返回其结果。每个任务针对快照的私有、一次性副本运行因此尽管允许任何语句写入仅触及该副本共享环境永不被修改态势审查本质上是非变更性的而副本隔离在不约束智能体SQL的情况下提供了该保证。界面足够小智能体行为可清晰映射到可度量事件查询迭代是探索性和候选查询的轨迹答案验证是验证性查询的存在和结构。在工具界面之外每次运行生成一个证据档案每个模型步骤、工具调用和结果的有序轨迹写入磁盘§7。智能体的推理作为其工具调用之间的文本与此轨迹交错推理日志从中恢复以进行评分。因为推理和动作共享一个有序记录评分器提出的任何主张都可据此检验标记无根据断言的推理实用性指标可指向周围的工具调用检测错误连接的结构性指标可指向该连接出现的查询。执行框架是框架在实现层面标准化的唯一组件智能体运行时的其余部分模型服务、提示策略、编排循环是实验变量。该框架已在此单一工具接口上运行多个智能体运行时任何模型都可放在其后因此跨栈可比性来自固定每个智能体必须产生什么而非如何构建。4.5 自带智能体或模型上述组件组合成一条路径同时服务于研究人员和从业者。评估智能体或模型的研究人员将框架支持的运行时之一指向已发布的包在标准执行框架下运行并收到所有标准的评分卡以及完整证据档案。包是版本固定的其评估器工件是门控的因此在同一包上的运行之间评分卡可比。消融是针对该固定包重新运行仅改变一个变量——模型、提示策略或上下文配置——产生的指标变动可归因于它。可比性来自固定这些选择必须产生的工件而非强制特定模型或运行时。评估针对特定租户的智能体的从业者遵循结构相同的路径使用相同的执行框架、契约和标准但提供私有包租户特定数据和基准问题的成功定义预期答案。由于评判指标将智能体的证据包发送给LLM面板私有包可在租户边界内的自托管或开放权重评判器上运行该面板因此机密态势数据永不离开而确定性指标根本不需要外部调用。指标层接受此类包的额外基于评分标准定义的标准流程对齐、控制覆盖、内部风险定义信任边界保持任何私有评估器的输出远离公开比较因此私有评估可按租户需要任意定制而不影响公共表面。5 环境数据集数据目录通过合成组织的环境数据集填补环境数据鸿沟每个都是完全虚构的企业无真实个人、组织或凭证所有标识符姓名、电子邮件、登录名、密钥都在 .example 域上生成。尽管每个值都是虚构的环境是从真实环境综合而来每个厂商的表和列遵循该产品的真实数据模型其数据模式身份生命周期、组和权限结构、常见错误配置、凭证年龄和访问分布镜像生产企业中所见。因此任务执行真实的态势推理而快照不暴露真实身份、凭证或组织。数据集将在 Hugging Face Hub 的 Open Security AI 组织下发布²每个都是不可变、内容寻址的修订版精确固定运行所审查的字节初始目录正在准备中以下计数描述参考快照。5.1 文本到SQL的关系型编码每个环境是组织身份相关状态的单一只读关系型快照涵盖八个厂商风格来源——AWSIAM和Identity Center、Azure Active Directory、Google Cloud Platform、GitHub、Google Workspace含Drive、人力资源信息系统、MongoDB Atlas 和 Okta——在参考发布中包括44个关系型表。每个厂商实体及其配置存在于一张表中表2厂商通过可连接列关联共享标识符在模式中记录但按照§4.1故意不声明为外键因此跨厂商身份解析仍为任务的一部分。例如共享电子邮件将 hibob_employee 和 okta_user 与 aws_identitystore_user 中的同一个人关联因此像“已离职但仍拥有云访问权限的员工”这样的问题成为在这些表上按 hibob_employee.status 过滤的连接。§6的两个包贡献127个任务在每个规模上实现。表2关系型编码的示意切片。厂商来源示例表代表性列AWSaws_iam_username, mfa_enabled, password_enabled, password_last_usedaws_iam_access_keyaccess_key_id, user_name, status, create_date, last_used_dateaws_iam_account_password_policyminimum_password_length, max_password_age, password_reuse_preventionOktaokta_userlogin, email, status, last_login, departmentokta_mfa_policyname, status, authenticatorsGoogle Workspacegoogleworkspace_shared_drive_filename, owner_email, permissions, trashedHRIS (HiBob)hibob_employeeemail, fullname, status, lifecyclestatus, terminationdateAWS Identity Centeraws_identitystore_userid, name, display_name表3三个组织规模的参考环境。规模员工数总行数小型~75~1,600中型~400~8,300大型~2,000~36,000单一环境无法测试泛化能力因此参考组织在三种规模上实现小型、中型、大型表3共享任务结构但跨度超过一个数量级从约75人和约1,600行到约2,000人和约36,000行相同44张表连续规模间约5倍步长。这实例化了环境矩阵的规模轴因此泛化和鲁棒性§4.3报告为跨规模的覆盖率而非单一数字区分规模鲁棒性智能体和利用小配置特质的智能体。更广泛的矩阵厂商栈、模式变体、噪声剖面作为自然增长方向内建于数据层契约中。每个数据集是一个自包含包包含身份头部的清单、SQLite快照以及每个任务的地面真值文件。该文件是一个地面真值原子答案字段一个判定、一组闭合匹配主体和决定性配置事实以及发现所涉及的表和连接。时间相关的问题“90天或更长时间不活跃”、“已离职但仍可访问”锚定到清单中的单一发布日期因此回溯语义属于数据而非壁钟时间。因为每个修订是不可变且自包含的与前序无共享行或答案环境可以轮换重新生成并重新发布。轮换是针对答案级记忆化的杠杆因为记忆一个环境的行和答案不会对后续环境带来优势。它不能防御对固定公共模式、任务集和解决方案策略的过拟合这些在轮换和规模中持续存在留出任务拆分和留出环境生成器未来工作§7是应对更强概念的防护。5.2 同一环境原生服务关系型快照并非智能体遇到此环境的唯一方式。对于原生API模态§3相同包——清单加上相同的SQLite快照——被编译为一个自包含、可运行的世界通过各厂商原生API界面服务该企业通过 aws CLI 访问的AWS控制平面以及通过其真实HTTP API访问的身份提供商、生产力套件、源主机和HR系统。响应从SQL模态查询的相同行计算得出因此两种模态共享一个地面真值但智能体仅将它们视为厂商API结果使用厂商原生凭证认证并将固定的真实厂商API规范作为其唯一文档从未看到表。今天有八个来源的子集以此方式服务一个内容寻址修订版同时支撑两种呈现因此一个发现被定义一次既可作为查询工作负载也可作为原生API调用序列提出。6 用例包包是OSB实例化和扩展的单位一个数据域、一个评估集以及绑定它们的评分配置。该框架今天随两个身份安全包发布源自两个公开的Sola ISPM基准基于第5节的环境数据集。它们共包含127个任务——可见性包77个跨厂商包50个——每个在全部三种环境规模上实现。可见性包源自单平台Sola可见性ISPM基准[15]评估一次限定于一个厂商的基础身份清单和配置卫生问题。代表性问题包括在AWS上的“哪些活跃访问密钥超过90天”以及在Okta上的“哪些应用的 mfa_required 设置为 false 或 null”合成模式简化生产Okta通过登录策略而非每个应用标志执行多因素要求。这些是态势分析师首先会问的问题谁和什么存在基线卫生控制是否到位它们确定智能体能否正确枚举身份和读取配置状态然后才进行任何跨厂商推理。跨厂商包源自跨厂商Sola ISPM基准[63]评估跨厂商边界的联合关联其中没有共享模式或显式外键连接来源智能体必须自行重建身份解析路径。代表性问题包括“哪些已离职员工仍拥有AWS单点登录访问权限”它将人力资源记录与云访问关联以及“哪些公开共享的Google Workspace文件由已被停用的Okta用户拥有”它将身份提供商与SaaS套件的共享状态连接以暴露风险集。这些问题锻炼使身份态势困难且任何单厂商工具无法回答的关联。两个包共享一个精简任务分类法驱动所有报告的分解复杂性简单、中等、困难聚焦点认证、授权和管理后者涵盖生命周期和卫生如离职和休眠凭证以及任务地面真值所涉及的具体平台。从平台派生出单平台与跨平台范围。在这些维度上报告每个指标将单一分数转化为诊断一个智能体可能单平台清单枚举良好但在跨平台关联上失败分类法使之可见。包也是社区贡献的单位一个新的态势子域是一个新的域和评估集与现有评分方法论组合因此从这两个身份包到云配置、漏洞状态或数据暴露包的路径是创作任务而非框架重新设计。7 讨论OSB不是一个排行榜——它是一个既能衡量智能体又能推动其向自主企业网络防御前进的引擎而第二个角色的机制已存在于第一个角色中。每次运行将证据档案写入磁盘§4.4智能体通过 get-schema 和 run-query 工具的动作、这些查询返回的中间结果、其间交错的推理以及最终答案连同从该记录派生的评分卡。档案可通过框架的运行查看器浏览并附带生成时所针对的二进制和数据集修订版本印章因此运行可重新打开并针对其看到的精确字节读取。三个注意事项提示可从固定包输入重建而非逐字存储存储的运行可再次审查但尚未自动重新评分非常大的工具输出在记录中被截断。这些是训练循环消耗的相同工件。OSB未实现训练循环但今天对智能体评分的管道产生了版本化、契约合规、可重放的数据可用于训练其继任者。OSB的一个潜在效用因此是推进智能体而不仅仅是评分使档案可训练而非仅仅可读的是OSB已经计算了学习者所需的信号。框架可自动检查的结果——匹配主体集、正确判定——是可验证的奖励这是近期推理模型背后的信号[12, 24]。在结果部分可信或按评分标准分级而非精确可检查时从偏好或反馈学习的奖励模型提供相同信号[40, 6]。记录的轨迹是离线强化学习[26]和从成功轨迹进行模仿学习[46]的输入分布。过滤OSB已验证正确的运行并在其上微调智能体将循环闭合为自举式自我改进[65, 60]OSB的指标输出作为标量或向量奖励进入这些过程。没有一个是单独的系统它重用评估器已经发出的评分卡。尽管如此我们的工作受限于对合成环境的依赖它们是可共享的、可复现的且隐私安全且因为每个都是从真实产品数据模型和生产企业的行为模式身份生命周期、组和权限结构、常见错误配置综合而成它们所需的态势推理可迁移到真实部署虚构组织无法复现的是活跃租户的操作漂移和事件遥测。未来工作包括扩展目录和拓展界面。因为共享基准只有在抵抗污染时才能推动领域进步[13, 56, 22]我们将发布更多合成组织和用例包扩展跨模式、厂商栈和企业原型的覆盖范围同时在当前包饱和时加固目标[56]。评分核心已跨越文本到SQL和原生厂商模态进一步的界面以相同方式插入遵循CIS[5]、Prowler[44]和Scout Suite[37]的云态势审计用于平面SQL处理笨拙的传递访问路径问题的图界面[50]以及用于配置、漏洞和数据暴露态势的新包。最重要的是因为自治是分级而非二元的[42]OSB今天评分的只读评估——基于态势感知[14]——向上延伸至风险优先级排序、修复和验证即自主网络防御的目标[55, 51]上述评估到训练循环将智能体从每一级带到下一级。8 结论我们提出了开放安全基准一个用于评估智能体AI在安全态势任务上的框架。OSB通过呈现精心策划的合成组织环境作为安全状态的共享快照并通过两种模态评估态势调查来解决环境数据鸿沟在关系型快照上的文本到SQL以及在相同环境服务化实例上通过各厂商原生API。设计将目标冻结一次并根据已知正确的参照对答案评分。围绕这一承诺它组装了第4节的五个组件从数据层到自带路径配有一个按各自轴报告每个标准的评分层。我们通过两个身份安全包和一组涵盖多种规模的环境数据集实例化了该框架并规划了沿界面、子域和自动化轴的扩展。我们的目标不是一个单一排行榜而是一个共享基底社区可在此基底上编写包在智能体被部署执行的工作上比较它们并将每次评估转化为推进下一智能体的数据。在这样的基底上信任态势智能体成为度量的问题而非判断的问题为将可信智能体AI扩展到自主企业网络防御的态势感知核心奠定了基础。