Agent Substrate与Kubernetes的区别:为什么你需要第二控制面 📅 发布时间:2026/9/17 1:24:17 👁 浏览次数: Agent Substrate与Kubernetes的区别为什么你需要第二控制面【免费下载链接】substrateAgent Substrate: the core system项目地址: https://gitcode.com/GitHub_Trending/substrate7/substrateAgent Substrate 是一个专为 AI Agent 设计的Agent 执行运行时Agent Runtime它把 Kubernetes 当作第一控制面负责基础设施再在其之上构建了一个第二控制面专门管理 Agent 的生命周期创建、挂起、恢复、调度和路由。如果你正在用 Kubernetes 跑大量 Agent这篇文章会用通俗的语言讲清楚两者到底差在哪里。30 秒理解 Agent Substrate先把概念捋顺只需要记住三个词概念通俗理解类比Actor一个 Agent 实例是挂起/恢复的基本单位一位员工Worker一个预先启动、待命的 Pod一次只承载一个 Actor一张工位WorkerPool一批温热的 Worker Pod由 Kubernetes 管理一间办公室Agent Substrate 的核心洞察是Agent 类应用 99% 的时间都在等等用户输入、等事件、等工具返回真正干活的时间极短。所以它把大量 Actor映射到少量 Worker上反复复用——官方演示中约 250 个有状态的 Actor 被多路复用到了仅 8 个物理 Pod 上见 README.md。Kubernetes 是第一控制面它擅长什么Kubernetes 是业界标准的工作负载平台它的强项是基础设施生命周期管理节点、Pod、网络、存储的声明式调和资源隔离命名空间、RBAC、NetworkPolicy 等治理手段低频、异步、最终一致性调度一个 Pod 需要调度器、网络、镜像拉取等多个环节收敛这些特性对跑几小时的微服务非常合适但对毫秒到秒级就结束、且数量达百万的 Agent 场景就力不从心了。核心区别一张表看懂两个控制面的分工维度Kubernetes第一控制面Agent Substrate第二控制面管理对象Pod、节点、节点级基础设施Actor、Worker 分配、快照操作频率低频Pod 起停以小时/天计高频每秒数百次挂起/恢复状态存储etcd适合声明式资源PostgreSQL 状态库适合百万级动态记录调度链路多个异步进程收敛 网络跳转 拉镜像原子化直接指派温热 Worker绕过 K8s 调度器启动延迟秒级对长驻负载完全够用目标 P95 约 100ms 的唤醒延迟状态管理PersistentVolume面向持久卷内存磁盘全量快照随时休眠、随时恢复这套分工在架构文档中有明确阐述Substrate 依赖 Kubernetes 做基础设施供给和 Worker Pod 生命周期管理而由自己的小控制面处理高 QPS、低延迟的挂起/恢复这类 Kubernetes 不擅长的高频操作见 docs/architecture.md。为什么你需要第二控制面四个关键原因 1. 空闲 Pod 也消耗真金白银Kubernetes 的 Pod 一旦起来就占着 CPU、内存和节点配额。Agent 大部分时间空闲如果一个 Agent 一个 Pod等于花钱买了一屋子睡大觉的员工。Substrate 的解法是挂起Suspend空闲 Actor 被冻结成快照、归还 Worker资源立刻可复用。2. K8s API Server 不是为百万资源设计的Kubernetes 擅长异步调和但不擅长存储海量离散资源和处理巨量写流量。百万 Actor、每秒多次状态变更如果都写成 etcd 里的 K8s 对象集群控制面会被压垮。所以 Substrate 把 Actor 和 Worker 这类高频动态状态放进了专用的 PostgreSQL 状态库K8s 里只保留 WorkerPool 这类低频声明式资源见 docs/glossary.md。3. 秒级调度对毫秒级负载太慢了跑一个 Pod 需要几秒对跑几天的服务无伤大雅但 Agent 的一次请求可能只活几毫秒。Substrate 的 Worker 是预先启动好的温热沙箱唤醒时直接指派、恢复快照不需要再走一遍调度、拉镜像的完整链路。4. 状态管理快照 vs 持久卷Kubernetes 的 PV 适合稳定的数据卷不适合百万份、大小不一、高频挂载卸载的进程状态。Substrate 把 Actor 的内存 工作区文件一起打快照存到对象存储如 GCS/S3休眠时计算资源可 100% 回收下次请求原样恢复含内存里的计数器演示见 demos/counter/README.md。两个控制面如何协作一次请求的旅程整个流程体现了各干各的擅长请求到达atenet-router网关网关发现目标 Actor 正处于休眠控制面ate-api-server从 WorkerPool 原子地认领一个空闲 Worker节点上的atelet监督者把 Actor 快照恢复到沙箱中gVisor 或 microVM网关通过 mTLS 隧道把请求转发给刚醒来的 ActorActor 空闲一段时间后再次挂起Worker 归还池中值得新手注意的一个细节是请求停车Request Parking当 Worker 池瞬间被占满时路由器不会直接返回 503而是把请求停放几秒重试——因为超卖是 Substrate 的常态瞬时饱和往往毫秒级就缓解见 docs/request-parking.md。官方给出的北极星指标从项目架构文档可以看到设计目标也能帮你判断它适合什么规模见 docs/architecture.md唤醒延迟P95 约 100ms集群规模单集群支持 10 亿级 Actor含休眠⚡唤醒吞吐每秒 1000 次同时官方明确提示项目处于早期开发阶段API 大概率会变化尚不建议直接用于生产见 README.md。想深入了解看这些路径️ 整体架构与为什么需要专用控制面docs/architecture.md 核心术语表Actor / Atespace / WorkerPool / Workerdocs/glossary.md 有状态计数器的完整演示demos/counter/README.md 请求停车机制docs/request-parking.md️ API 配置参考WorkerPool、ActorTemplatedocs/api-guide.md 威胁模型与安全隔离docs/threat-model.md总结什么时候该引入第二控制面一句话判断如果你的负载多数时间空闲、但要求毫秒级唤醒、且实例数量远超物理 Pod 数Kubernetes 单控制面就不够用了。Agent Substrate 的思路不是替代 Kubernetes而是与它分工——Kubernetes 管房子基础设施与 Worker PodSubstrate 管人Actor 的挂起、恢复、调度和路由。这正是第二控制面存在的意义让高频、低延迟的 Agent 运维决策不再受困于为低频、最终一致性设计的通用控制面。【免费下载链接】substrateAgent Substrate: the core system项目地址: https://gitcode.com/GitHub_Trending/substrate7/substrate创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考