118、构建可扩展的Agent基础架构那天晚上十一点,线上的Agent实例突然开始集体超时,日志里刷满了TooManyRequests,但我们的API配额明明还有余量。查了一整夜,最后发现根因不在模型服务,也不在业务代码,而在我们引以为傲的“灵活”的Agent调度层——每个请求进来都会动态创建一个新的Agent实例,而每个实例又要初始化自己的记忆缓存、工具注册表和会话上下文管理器。当并发从20涨到200时,这些轻量级的初始化操作突然变成了重量级的资源竞争,更恶心的是,Python的GIL在大量对象创建时直接把我们按在地上摩擦。那晚之后我意识到,所谓可扩展的Agent基础架构,不是让你堆多少个Agent实例,而是让你在任何并发压力下,都能让每个Agent的运行成本趋近于一个静态函数的调用成本。而大多数团队卡在做第一步:把Agent当成“一次性请求处理器”来设计,每次请求都从零开始构建整个认知链。先看一个最典型的反模式。很多人喜欢这么写Agent的主流程:defhandle_user_message(user_id,text)