Havenlon|AI 时代的执行安全语言体系(七一):Agent 身份、意图、权力、上下文风险 📅 2026/7/29 9:16:09 Working Draft · AI Era Execution Security LanguageThis article is part of the Havenlon Execution Security Language project.The terminology and definitions presented here describe the currentworking draft and may evolve as the discipline matures.AI 时代执行安全语言体系工作草案本系列旨在建立 AI 时代执行安全的共同语言。本文中的术语与定义代表当前工作草案将随着理论研究、工程实践和社区讨论持续修订14. Agent Authority智能体权力一句话定义智能体权力是 Agent 能够提出、选择、请求或实际触发动作的能力范围。严格定义Agent Authority 必须拆分为提议权读取权规划权工具选择权工具请求权有限自主执行权治理参与权恢复权。这些权力不能混为一体。例如一个 Agent 可以读取告警生成修复方案提议重启服务但不一定有权直接重启生产集群修改管理员权限关闭安全控制增加自己的工具权限。上位概念Execution AuthorityDelegated Authority下位概念Agent Proposal AuthorityAgent Tool AuthorityAgent Execution AuthorityAgent Governance AuthorityAgent Recovery Authority相关概念Tool PermissionDelegated ExecutionNo Unilateral Catastrophic AuthorityAuthority InheritanceScope Limit权力边界Agent 权力必须是有限、可撤销、不可自动扩张且不可无条件传递的。约束机制权力拆分最小权限非传递授权时间限制对象限制高风险转治理权力变更留证。结果目标让 Agent 能够完成任务但无法将任务能力扩张为系统主权。在 Havenlon 中Agent 默认拥有 Proposer 权力只有低风险预授权槽位提供有限执行能力。15. Agent Identity智能体身份一句话定义智能体身份是用于区分某个 Agent 实例、角色、模型、部署环境和权限主体的可验证身份。严格定义Agent Identity 可以包含agent_idagent typemodel versiondeploymentownerorganizationrolecredentialtool scoperuntime environmentcurrent policylifecycle state。系统必须区分用户身份Agent 身份代表用户行动的委托关系Agent 使用的服务账户工具底层凭证。不能把 Agent 的所有动作都归因于拥有者本人。上位概念IdentityMachine Identity下位概念Agent Instance IdentityAgent Role IdentityModel IdentityRuntime IdentityDelegated Agent Identity相关概念Agent AuthorityIntent OriginService AccountDevice IdentityEvidence Chain权力边界Agent 不能使用用户或管理员的长期身份直接执行所有动作也不能在多个 Agent 之间共享不可区分的凭证。约束机制独立凭证Agent ID工作负载身份短期 Token工具作用域实例证据权限撤销。结果目标让每个机器发起动作能够追溯到具体 Agent而不是只显示“系统执行”。在 Havenlon 中Agent Identity 进入 Proposal Evidence并与委托者身份和 Execution Intent 分开记录。16. Agent Intent智能体意图一句话定义智能体意图是 Agent 根据目标和上下文生成的、希望系统执行的结构化动作表达。严格定义Agent Intent 必须与以下内容区分用户原始目标Agent 对目标的解释当前上下文Tool Call最终 Payload。例如用户目标可能是解决这个客户问题。Agent Intent 可能被具体化为向客户账户退款 500 元。随后 Tool Payload 可能是refund(account_x, amount500)安全系统必须验证Agent 的具体化是否合理金额是否符合授权对象是否正确当前上下文是否完整是否需要人工确认最终 Payload 是否仍等于该 Intent。上位概念Execution IntentMachine-Initiated Intent下位概念Agent-Proposed IntentAgent-Derived IntentAgent-Revised IntentMulti-Agent Intent相关概念Human IntentIntent DriftContext InjectionTool CallingIntent Binding权力边界Agent 对用户目标的解释不能自动成为不可逆执行事实。约束机制Intent 结构化目标来源引用语义摘要金额与对象显式化IntentHash高风险重新确认最终绑定。结果目标把模型的开放式推理结果收敛为可验证、可审批和可拒绝的具体动作。在 Havenlon 中Agent 输出必须先转换为标准 Execution Intent不能把自然语言推理直接送给 Executor。17. Agent Hallucination智能体幻觉一句话定义智能体幻觉是 Agent 生成了不受事实支持、错误、不完整或虚构的判断、参数、状态或行动依据。严格定义Agent Hallucination 可能影响对象金额时间身份工具能力系统状态执行结果Policy用户授权外部事实。在纯内容场景中幻觉可能产生错误回答。在执行场景中幻觉可能变成错误 Tool Call错误参数错误目标不必要执行重复执行虚假成功判断错误恢复动作。上位概念Model ErrorAgent Risk下位概念Parameter HallucinationState HallucinationPermission HallucinationTool HallucinationResult Hallucination相关概念Semantic GapTool MisuseFinal RevalidationFact SourceExecution Drift权力边界模型输出不能被视为事实来源也不能因为置信表达强烈而获得执行资格。约束机制外部事实验证结构化字段对象白名单参数上限Tool Schema独立 Policy执行前重新验证。结果目标让模型错误停留在候选判断阶段而不是直接成为现实动作。在 Havenlon 中Agent 的判断只作为 Proposal 输入事实和执行条件由独立系统重新验证。18. Prompt Injection提示注入一句话定义提示注入是攻击者通过输入内容影响 Agent 的指令理解、目标优先级、工具选择或执行行为的攻击方式。严格定义Prompt Injection 可以来自用户输入网页邮件文件数据库内容工具返回其他 Agent长期记忆RAG 文档外部 API。攻击内容可能诱导 Agent忽略系统指令泄露信息调用高风险工具修改执行目标扩大作用域伪造审批隐藏行为执行攻击者指定动作。Prompt Injection 的核心危险不是“模型被说服”而是被污染内容是否能够穿过 Agent获得真实执行能力。上位概念Adversarial InputContext Attack下位概念Direct Prompt InjectionIndirect Prompt InjectionTool-Result InjectionMemory InjectionCross-Agent Injection相关概念Context InjectionTool MisusePolluted IntentLegitimate-Path AbuseTool Execution Boundary权力边界外部文本不能因为进入 Agent 上下文就自动改变执行 Policy、工具权限或治理状态。约束机制内容与指令分离不信任外部上下文工具权限外置高风险 Intent 显式化独立审批Payload Binding最终硬件拒绝。结果目标让提示注入最多影响 Agent 的候选输出不能直接继承成最终执行权。在 Havenlon 中即使 Agent 被注入并生成恶意 Tool Call最终仍需经过独立 Execution Intent、Policy 和本地执行边界。19. Context Injection上下文注入一句话定义上下文注入是攻击者或异常系统将误导性、伪造、过期或恶意信息加入 Agent 上下文从而改变其判断和执行计划。严格定义Context Injection 比 Prompt Injection 更广。它可以包括伪造业务状态污染记忆修改检索结果插入虚假审批返回恶意工具结果提供过期 Policy伪造用户意图隐藏关键限制篡改历史事件。Agent 可能并未违反任何显式提示却基于错误上下文得出危险结论。上位概念Context PollutionAdversarial Context下位概念Memory InjectionRAG InjectionTool Output InjectionState InjectionIdentity Context Injection相关概念Polluted ContextAgent IntentContext IntegrityPrompt InjectionFact Source权力边界Agent 上下文不能作为治理、Policy、身份和执行事实的唯一来源。约束机制来源标记数据签名事实分层新鲜度多源核验Context Binding最终本地状态。结果目标阻止被污染的上下文直接决定不可逆执行。在 Havenlon 中关键治理、Policy 和执行状态从受验证来源读取而不是只相信 Agent 当前上下文。