Agent Governance Toolkit 的 OWASP GenAI 社区提交:以四层运行时治理栈映射 OWASP Agentic Top 10

Agent Governance Toolkit 的 OWASP GenAI 社区提交:以四层运行时治理栈映射 OWASP Agentic Top 10 Agent Governance Toolkit 的 OWASP GenAI 社区提交以四层运行时治理栈映射 OWASP Agentic Top 10【免费下载链接】agent-governance-toolkitAI Agent Governance Toolkit — Policy enforcement, zero-trust identity, execution sandboxing, and reliability engineering for autonomous AI agents. Covers 10/10 OWASP Agentic Top 10.项目地址: https://gitcode.com/GitHub_Trending/ag/agent-governance-toolkit本文基于仓库中的社区提交文档 owasp-genai-submission.md 展开。该文档是 Agent Governance Toolkit 向 OWASP GenAI 社区提交的工具申报材料核心内容是声明 Agent Governance StackAgent OS AgentMesh Agent SRE Agent Runtime 四层对 OWASP Agentic Security Top 10 全部 10 类风险ASI01–ASI10的覆盖实现。读完本篇你可以逐条对照提交声明中的每个控制项与仓库源码文件理解其真实的实现位置与检测机制并据此判断该框架在你自身 Agent 部署中的适用性。一、提交概览工具名、定位与规模声明提交文档的元信息如下字段内容工具名称Agent Governance Stack (Agent OS AgentMesh Agent SRE Agent Runtime)类别AI Agent Security Governance Framework定位为自主 AI Agent 提供运行时治理runtime governance的开源框架覆盖声明10/10 OWASP Agentic Security Top 10 类别且均有完整技术实现性能与规模提交文档自述亚毫秒级策略执行0.1ms p99、1,680 测试、集成 12 LLM 框架LangChain、CrewAI、OpenAI、Anthropic、AutoGen、SemanticKernel 等维护方 / 许可证Microsoft Corporation / MIT其中12 框架集成一项可以从源码结构直接印证integrations 目录 下存在langchain_adapter.py、crewai_adapter.py、openai_adapter.py、anthropic_adapter.py、autogen_adapter.py、semantic_kernel_adapter.py、gemini_adapter.py、bedrock_adapter.py、mistral_adapter.py、llamaindex_adapter.py、langgraph_adapter.py、pydantic_ai_adapter.py、smolagents_adapter.py、google_adk_adapter.py、maf_adapter.py、openai_agents_sdk.py等十余个框架适配器。而测试数量与延迟数据属于提交文档的性能声明仓库中各子包的tests/目录如 agent-os 测试、agent-sre 测试是可自行核实的证据入口。提交文档给出的四层架构如下原文档保留的架构图┌─────────────────────────────────────────────────┐ │ Agent Runtime │ │ Kill Switch · Execution Rings · Saga Rollback │ ├─────────────────────────────────────────────────┤ │ Agent SRE │ │ SLO Engine · Anomaly Detection · Chaos Engine │ ├─────────────────────────────────────────────────┤ │ AgentMesh │ │ DID Identity · Trust Handshake · SPIFFE · OPA │ ├─────────────────────────────────────────────────┤ │ Agent OS │ │ Policy Engine · Sandbox · MemoryGuard · MCP │ └─────────────────────────────────────────────────┘这四层在仓库中分别对应 agent-runtime 子包、agent-sre 子包、agent-mesh 子包 和 agent-os 子包均为 Python 实现。提交文档还指向了一份更细粒度的风险-控制映射表owasp-agentic-top10-mapping.md其中明确指出该映射是架构指引而非认证声明architectural guidance, not a certification claim并要求按部署自身的威胁模型验证所需控制——这一限定在采用时应一并继承。二、ASI01 — Agent Goal Hijack目标劫持提交文档将目标劫持的防御分解为四个组件PromptInjectionDetector7 策略注入检测直接指令覆盖、分隔符攻击、编码攻击、角色扮演/越狱、上下文操纵、金丝雀泄露、多轮升级。MCPSecurityScannerMCP 工具描述中的隐藏指令检测零宽 Unicode、Markdown 注释、Base64 编码载荷。SemanticPolicyEngine意图分类9 类含DATA_EXFILTRATION、PRIVILEGE_ESCALATION置信度阈值可配置。LlamaFirewall 集成与外部护栏框架做纵深防御链式组合适配器位于 llamafirewall.py。源码印证prompt_injection.py 中InjectionType枚举精确对应这 7 种攻击类型class InjectionType(Enum): Classification of a prompt injection attack. DIRECT_OVERRIDE direct_override DELIMITER_ATTACK delimiter_attack ENCODING_ATTACK encoding_attack ROLE_PLAY role_play CONTEXT_MANIPULATION context_manipulation CANARY_LEAK canary_leak MULTI_TURN_ESCALATION multi_turn_escalation模块文档字符串进一步说明各策略的具体覆盖直接覆盖检测ignore previous instructions类指令劫持分隔符攻击检测上下文边界操控特殊分隔符、XML 风格标签、对话格式标记编码攻击识别 Base64、十六进制、ROT13 与 Unicode 转义混淆角色越狱标记 DAN mode、developer mode金丝雀泄露检测系统提示词中的 canary token 是否出现在用户输入中提示词泄露迹象每次检测都会记录时间戳与输入哈希供取证。从源码结构看检测器还实现了可插拔的证据后端协议DetectionEvidenceBackend见 prompt_injection.py#L137-L148可选的 embedding kNN 信号只能追加EvidenceSignal证据其blocks字段在构造时强制为False——证据永远不能单独改变最终裁决这保证了主判定链路的确定性。意图分类侧semantic_policy.py#L48-L58 中的IntentCategory枚举确实包含提交文档所称的 9 个类别class IntentCategory(str, Enum): DESTRUCTIVE_DATA destructive_data # DROP, DELETE, TRUNCATE, wipe DATA_EXFILTRATION data_exfiltration # bulk export, dump, copy-to-external PRIVILEGE_ESCALATION privilege_escalation # grant, sudo, chmod, admin SYSTEM_MODIFICATION system_modification # rm, shutdown, reboot, kill CODE_EXECUTION code_execution # exec, eval, subprocess, shell NETWORK_ACCESS network_access # fetch, curl, http, connect DATA_READ data_read DATA_WRITE data_write BENIGN benign配套的IntentClassification.is_dangerous属性在危险类别且置信度 ≥ 0.5 时返回Truesemantic_policy.py#L74-L87被拒绝的动作会抛出携带分类结果的PolicyDenied异常便于上层记录结构化拒绝原因。三、ASI02 / ASI04 — 工具滥用与 Agent 供应链提交文档对 ASI02Tool Misuse列出四项控制MCP 工具投毒检测SHA-256 工具指纹 Levenshtein 距离的跨服务器仿冒检测 Schema 滥用检测、AgentControl.allowed_tools白名单、NativeAdapterRuntime对全部工具调用的 pre/post 钩子拦截、以及带资源限制与 AST 静态分析的ExecutionSandbox。对 ASI04Agentic Supply Chain则强调工具指纹ToolFingerprintdescription_hash、schema_hash、版本追踪、基于 Levenshtein 距离的 typosquatting 与仿冒检测、mcp-scan scan config审计 CLI并声明覆盖 CVE-2026-25536、CVE-2026-23744、CVE-2025-68145 的攻击模式。源码印证集中在 mcp_security.py威胁分类MCPThreatType包含TOOL_POISONING、RUG_PULL、CROSS_SERVER_ATTACK、CONFUSED_DEPUTY、HIDDEN_INSTRUCTION、DESCRIPTION_INJECTION六类L67-L76。指纹结构ToolFingerprint携带description_hash、schema_hash、first_seen、last_seen、version五个字段L99-L109rug pull 检测即通过register_tool()记录基线、check_rug_pull()比对当前定义实现。检测模式在导入时编译为正则零宽空格/连接符/BOM\u200b\u200c\u200d\ufeff、双向控制字符\u202a-\u202e、HTML 注释!--...--、Markdown 参考注释[//]: # (...)以及 ignore (all) previous、override the previous、system:/assistant: 等隐藏指令特征L126-L150。模块的公开架构为scan_tool() / scan_server() / register_tool() / check_rug_pull()四个入口加审计日志与提交文档描述一致。审计 CLI 位于 cli/mcp_scan.py即文档所述mcp-scan命令的实现。工具调用拦截侧integrations/_native_adapter_runtime.py 即NativeAdapterRuntime的实现位置工具白名单则通过 ACSAgent Control Specification策略的allowed_tools契约声明见映射文档中的示例下文第五节。四、ASI05 / ASI06 — 意外代码执行与内存投毒ASI05Unexpected Code Execution。提交文档声明ExecutionSandbox通过 AST 安全访问器阻断危险模式阻断模块为 subprocess、os、shutil、socket、ctypes、importlib阻断内建为 exec、eval、compile、__import__且SandboxConfig支持max_memory_mb、max_cpu_seconds、allowed_paths等可配置项。sandbox.py 的实际清单比提交文档列得更完整。默认阻断模块列表L64-L89在文档所列 6 个之外还包括sys、builtins、gc、inspect、pickle、marshal、code、pty、fcntl、signal、posix、multiprocessing、threading、asyncio等 24 项注释逐项说明了阻断原因如gc/inspect可用于遍历存活对象触达危险类pickle/marshal在反序列化时可执行任意代码。阻断内建L91-L107同样扩展到了open、getattr、setattr、memoryview等 17 项且白名单采用 fail-closed 设计不在白名单且未被显式阻断的符号一律省略。值得强调的是源码中显式的能力边界声明这是一个进程内软沙箱提高的是subprocess、os.system、eval、importlib.import_module、dunder 遍历等常见 stdlib 逃逸手法的成本文档明确要求对强隔离场景应在独立 OS 进程中运行不可信代码seccomp/AppArmor/landlock、容器、Firecracker/gVisor 微虚拟机或 WASM 运行时本沙箱只作纵深防御层sandbox.py#L9-L21。采用方不应把它的阻断清单当作强隔离保证。ASI06Memory Context Poisoning。提交文档声明MemoryGuard对每条记忆做 SHA-256 完整性校验、每次写入做注入模式扫描、Unicode 操纵与代码注入检测并保留带时间戳与来源的审计轨迹覆盖 5 种AlertType。memory_guard.py 完全印证了这些机制MemoryEntry在create()工厂中自动生成 UTC 时间戳与 SHA-256 内容哈希L62-L89AlertType枚举实际含 6 种——提交文档列出的INJECTION_PATTERN、CODE_INJECTION、INTEGRITY_VIOLATION、UNICODE_MANIPULATION、EXCESSIVE_SPECIAL_CHARS之外还有TOOL_POISONINGL51-L58。公开接口为validate_write()写前筛查、verify_integrity()读后哈希校验、scan_memory()批量扫描与模块文档字符串描述一致。五、ASI03 / ASI07 / ASI09 — 身份、Agent 间通信与人机信任ASI03Identity Privilege Abuse声明了五项控制AgentMesh 的 DID 身份did:mesh:unique-id Ed25519 密钥对、TrustRoot 确定性非 LLM策略权威及最大升级深度、SPIFFE mTLS 工作负载身份、RBAC 能力授权、以及 Agent Runtime 的四层执行环Ring 0–3。源码对应物trust_root.pyAgent OS 侧的策略权威锚点、integrations/rbac.pyRBAC 模块、AgentMesh 子包的身份与信任握手实现agent-mesh/src以及执行环的 ADR 依据 0002-use-four-execution-rings-for-runtime-privilege。ASI07Insecure Inter-Agent Communications声明了 TrustHandshake基于 nonce 的挑战/响应认证、五维信任分传播competence、integrity、availability、predictability、transparency、覆盖 A2A / MCP / IATP / AI Card 协议的 TrustBridge 适配器、gRPC WebSocket 加密传输与心跳、AuditChain哈希链审计日志和 OPA Rego 策略评估。这些组件分布在 agent-mesh/src 与 Agent OS 的 mcp_protocols.py、audit_logger.py 中哈希链审计的设计决策另见 ADR 0017-merkle-chain-for-audit-tamper-evidence。ASI09Human-Agent Trust Exploitation声明了require_human_approval审批门MCPGateway 的 PENDING/APPROVED/REJECTED 审批工作流、Agent Runtime 的共识机制Ring 1 操作需人类共识、Ring 0 需 SRE 见证、GovernanceLogger结构化 JSON 审计、KillSwitch行为漂移、速率限制、环越界、手动四类终止原因以及 HumanSponsor/SponsorRegistry 的人类担保问责。MCP 网关与审批实现位于 mcp_gateway.py审批与 kill 控制的架构归属可在映射文档的控制表中对照见 owasp-agentic-top10-mapping.md 中 ASI09 行Approval binding, evidence, restricted audit。六、ASI08 / ASI10 — 级联故障与失控 AgentASI08Cascading Agent Failures的四个控制项在 agent-sre/src/agent_sre 中均有对应模块CircuitBreakerCLOSED → OPEN → HALF_OPEN状态机failure_threshold与reset_timeout可配置实现在 cascade/circuit_breaker.pyChaosEngine / ChaosLibrarychaos/engine.py 提供延迟、错误、超时、对抗四类故障注入chaos/library.py 提供 tool-timeout、error-storm、cascading-failure 等预置模板IncidentDetectorincidents/detector.py 做信号关联SLO_BREACH、ERROR_BUDGET_EXHAUSTED、COST_ANOMALY、POLICY_VIOLATION并配套 runbook 执行器incidents/runbooks 含 restart_agent、revoke_trust、rollback_version、throttle_traffic 四个预置 YAMLErrorBudget多时间窗1h/6h/24h/7d/30d燃烧率告警归属 slo/objectives.py 所在的 SLO 子系统。ASI10Rogue Agents的控制项映射到AnomalyDetector行为异常检测anomaly/detector.py延迟尖峰、吞吐下降、异常工具序列、资源耗尽、SLO 引擎的持续合规监控、OpenTelemetry 导出tracing/exporters.pyTraceExporter MetricsExporter、Agent Runtime 的 RingEnforcer 信任分降级与对不可信 Agent 的自动沙箱化、带审计证据与 saga 交接支持的 KillSwitch以及CostGuard预算强制85% 节流、95% 终止实现在 cost/guard.py。七、端到端验证方式与适用前提提交文档本身不含可运行示例但同目录的姊妹文档与仓库内既有材料提供了验证入口策略层回放映射文档建议使用agt test做策略回放agent-compliance CLI 即agt命令入口并用适配器中介测试验证副作用顺序、用沙箱提供者测试验证隔离、用红队套件验证跨层攻击场景。ACS 策略示例owasp-agentic-top10-mapping.md#L21-L35 给出了一段可直接参照的策略用法from agent_control_specification import AgentControl, HostSession runtime AgentControl.from_path(policies/owasp-manifest.yaml) session HostSession( runtime, agent_idowasp-agent, session_idowasp-session, ) evaluation session.pre_tool_call( tool_nameexecute_code, args{code: untrusted input}, )其中allowed_tools白名单、预算、转换、证据与审批均为原生 ACS 契约manifest 可把策略绑定到输入、模型、工具、输出四个干预点。 3.快速上手示例examples 目录 提供quickstart.py、governed_agent.py、prompt_defense_governance.py三个可运行脚本及requirements.txt是查看治理栈接入方式的最短路径。 4.失败即拒绝fail-closed映射文档明确策略、调度器或审批的意外错误一律拒绝操作对外暴露稳定错误文本结构化PolicyEvaluation仅保留在受信任的审计通道中。采用前应注意的适用前提源码中多个安全模块prompt injection、MCP security、sandbox均带有_SAMPLE_DISCLAIMER警告内置规则只是示例性起点上线前必须按自身用例审查、定制和扩展进程内软沙箱不构成强隔离边界强隔离需外部机制见第四节映射表是架构指引而非认证声明具体控制取舍应以部署自身的威胁模型验证为准提交文档中的性能数据0.1ms p99与 CVE 覆盖声明属于提交方自述仓库中可核实的是各检测器、沙箱与策略引擎的实现及其测试如 tests 目录数值指标建议以自有基准为准。八、相关文档与源码索引主题路径本文主体OWASP GenAI 提交文档agent-governance-python/agent-compliance/docs/submissions/owasp-genai-submission.md风险-控制映射与 ACS 策略示例agent-governance-python/agent-os/docs/owasp-agentic-top10-mapping.md注入检测ASI01agent-governance-python/agent-os/src/agent_os/prompt_injection.pyMCP 安全扫描ASI02/04agent-governance-python/agent-os/src/agent_os/mcp_security.pymcp-scan CLIagent-governance-python/agent-os/src/agent_os/cli/mcp_scan.py执行沙箱ASI05agent-governance-python/agent-os/src/agent_os/sandbox.py记忆防护ASI06agent-governance-python/agent-os/src/agent_os/memory_guard.py语义策略引擎ASI01/05agent-governance-python/agent-os/src/agent_os/semantic_policy.py信任权威与 RBACASI03agent-governance-python/agent-os/src/agent_os/trust_root.py / agent-governance-python/agent-os/src/agent_os/integrations/rbac.py熔断与混沌工程ASI08agent-governance-python/agent-sre/src/agent_sre/cascade/circuit_breaker.py / agent-governance-python/agent-sre/src/agent_sre/chaos/engine.py异常检测与成本守护ASI10agent-governance-python/agent-sre/src/agent_sre/anomaly/detector.py / agent-governance-python/agent-sre/src/agent_sre/cost/guard.pyOWASP 架构合规总览docs/compliance/owasp-agentic-top10-architecture.md【免费下载链接】agent-governance-toolkitAI Agent Governance Toolkit — Policy enforcement, zero-trust identity, execution sandboxing, and reliability engineering for autonomous AI agents. Covers 10/10 OWASP Agentic Top 10.项目地址: https://gitcode.com/GitHub_Trending/ag/agent-governance-toolkit创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考