Agent 应该聪明到什么程度?

Agent 应该聪明到什么程度?

一场企业 Agent 演示会上,业务负责人提出任务:“帮我处理一下下周可能缺货的物料。”

Agent 很快查出库存、生成缺口分析,又调用接口创建了补货单。屏幕上的执行轨迹十分流畅,现场也很兴奋。直到计划员发现:Agent 选错了仓库,忽略了一张尚未入库的在途订单,还把“准备补货方案”理解成了“正式提交申请”。

每一步在技术上都成功了,整件事在业务上却做错了。

这类失败很容易被归因于模型还不够聪明。于是,团队继续优化提示词、增加工具、延长任务规划,希望 Agent 可以少问人、自己完成更多步骤。但问题也许恰好相反:它已经能做很多事,企业却没有说明哪些地方可以灵活判断,哪些地方必须接受确定性约束。

敲黑板:企业 Agent 的先进程度,不能用“能独立完成多少步骤”衡量。

Agent 应在意图理解、任务组织和非结构化信息处理中保持灵活,在对象身份、关键判断和高风险动作上接受确定性约束。好的自主性不是没有边界,而是知道何时继续、何时降级、何时把责任交还给人。

一、“越自主越先进”,为什么是个危险假设

在通用任务中,减少人工干预往往意味着更好的体验。但企业任务不是一条纯粹的信息生成链,它会改变客户、库存、资金、设备和责任状态。

Agent 生成一份补货分析,错误可以被人发现并改写;创建一张草稿,影响仍然有限;一旦正式下发采购,错误就进入交易系统,可能占用预算、形成供应承诺。类似地,整理客户流失原因与批量发送挽回消息,分析设备告警与执行停送电操作,虽然出现在同一条任务轨迹中,风险却完全不同。

所以,“自主”必须具体到某个场景、某一步动作,而不能给整个 Agent 贴一个统一标签。一个 Agent 可以自主检索资料、组合证据、安排查询顺序,同时在冻结库存、客户触达、采购下发或运行控制前停止。

更高自主度也不代表更高成熟度。边界稳定、风险较低、结果可观察且可补偿的场景适合自动执行;高影响、不可逆或规则尚不稳定的场景,保留人工确认本身就是成熟设计。

最危险的做法,是让 Agent 直接拿到一组接口,再在提示词里写“请谨慎操作,必要时询问用户”。提示词可以影响模型行为,却不能替代服务端权限、对象校验、审批规则、幂等控制、风险分级和结果回写。真正的边界必须位于执行链路中,而不是寄希望于模型每次都记得克制。

二、Agent 擅长什么:在不确定性中组织任务

Agent 的价值,不是复制一套固定流程。传统流程已经清楚知道下一步是什么时,工作流或普通程序往往更稳定。Agent 更适合处理目标用自然语言表达、上下文分散、路径需要动态选择的任务。

它首先擅长理解意图。用户说“处理一下这批有风险的客户”,Agent 可以追问或推断:风险是流失、投诉还是信用风险?用户要的是分析、建议、任务草稿,还是正式触达?“这批客户”指当前页面选中的对象,还是某个动态条件下的集合?

其次是任务拆解。面对“分析主变油温异常并准备处理建议”,它可以拆成识别设备、读取量测、查找相关部件、调取历史缺陷、调用告警逻辑、整理证据和预填巡检任务,而不是要求用户逐条发出命令。

再次是能力选择。Agent 可以根据任务决定先查对象还是先读文档,调用哪个逻辑能力、哪个只读工具,是否需要补充上下文。工具返回异常时,它也可以调整计划、寻找替代路径或把问题交给人。

最后是处理非结构化信息。检修报告、客服记录、合同条款、会议纪要和现场照片中包含大量难以预先写成字段的内容。Agent 可以提取候选事实、归纳原因、生成摘要,再把需要确认的结论送入结构化对象和逻辑能力。

这些能力都在处理开放问题与不完整上下文。Agent 可以提出路径和候选解释,但候选不能悄悄变成权威事实,语言上的合理也不能自动升级为业务许可。

三、本体承担什么:把企业的确定性部分交出来

如果 Agent 负责在不确定性中组织任务,本体负责把企业已经明确的业务世界表达出来。

对象告诉 Agent“企业里有什么”。客户、库存项、批次、设备、工单、补货单不是任意表名,而是有身份、状态和业务边界的运行对象。Agent 找到“物料 A”还不够,还要定位“物料 A 在华东仓的库存项”。

关系告诉 Agent“对象如何相连”。客户关联授权、账户和触达记录;异常批次关联工单、成品和客户订单;设备关联测点、部件、拓扑和责任班组。关系既提供上下文,也决定行动许可和影响范围。

状态告诉 Agent“此刻能做什么”。补货单已经待审批,就不应重复创建;客户已经退订短信,就不应进入营销触达;设备处于检修中,新的告警要与未关闭工单一起判断。

逻辑能力承接需要稳定复用的判断,例如客户触达资格、缺货风险、质量冻结条件、设备告警有效性和审批级别。它们有明确输入、输出、例外、版本和测试。Agent 可以解释逻辑结果,但不能为了让方案更顺畅而临场改写关键规则。

行动能力定义可以安全执行的业务动作。创建草稿、提交补货单、登记缺陷、发送渠道消息分别需要什么参数、权限和前置条件,怎样处理重复、失败与补偿,结果写回哪里,都应由行动契约约束。

治理边界则说明谁能看、谁能做、哪些动作要确认或审批、运行轨迹保留什么证据。Agent 继承用户的业务权限,不应因为连接了高权限集成账号,就获得用户本来没有的执行能力。

可以把分工概括为一句话:Agent 负责组织,本体负责定界,逻辑能力负责判断,行动能力负责受控执行,业务系统负责保存权威交易事实,人负责关键责任。

四、一条完整轨迹:不是“规划—调用”,而是六步闭环

一次可运行的 Agent 任务,可以写成六步:

意图 → 对象 → 判断 → 动作 → 观察 → 回写

仍以“处理下周可能缺货的物料”为例。

意图。Agent 先确认任务范围:哪个组织和仓库,未来多长时间,是生成风险清单、准备补货方案,还是提交动作。自然语言在这里负责灵活入口。

对象。Agent 在本体中定位库存项、需求、在途订单、供应商和未关闭补货单。对象身份、数据来源和读取权限不能靠它猜测。

判断。Agent 调用缺货风险与补货逻辑,得到风险时间、缺口数量、原因和替代路径。关键结论来自可测试的逻辑能力,Agent负责组合解释,而不是现场发明一套库存政策。

动作。如果用户只要求方案,轨迹在建议处停止;如果允许创建草稿,Agent预填行动参数;若要提交或下发,则行动层重新校验权限、重复单据、数量约束和审批要求。

观察。创建请求发出后,Agent要读取动作结果和外部回执。超时不等于失败,返回成功也不表示业务已经完成。补货单是否审批、采购是否下发,决定任务如何继续。

回写。外部单号、对象状态、人工修改、失败原因和后续任务回到本体,成为下一轮判断的输入。没有回写,Agent只是在发起动作,不是在承担任务。

这条轨迹还有一条“运行证据链”:原始请求是什么,选了哪些对象,调用了哪个版本的逻辑,预填了什么参数,谁确认或修改,外部系统返回什么。只有这些步骤能够回放,企业才知道错误发生在意图理解、对象定位、逻辑判断、行动参数还是系统执行。

五、人在回路应该放在哪里

不少企业为了安全,在每一步都弹出确认框。结果是用户习惯性点击“继续”,确认变成橡皮图章;另一些企业为了体验顺畅,尽量不让 Agent 停下来,又把责任边界藏进了系统内部。

人在回路不应按“每调用一次工具”设置,而应放在责任真正发生变化的位置。

意图歧义点。目标对象、任务范围或“分析/建议/执行”含义不清时,继续规划只会放大误解。这里需要用户澄清,不需要审批。

证据不足点。对象匹配置信度低、关系断链、数据过期、多个来源冲突时,应让业务人员复核事实。人是在补充判断基础,不是在替机器点按钮。

责任转移点。动作开始影响资金、库存、客户权益、生产或设备状态时,需要责任人确认或审批。确认页面必须展示对象、参数、依据、影响范围、风险和回退方式。

异常接管点。外部系统结果未知、动作部分成功、权限冲突或补偿失败时,Agent应停止扩展动作,把完整上下文交给人处理。

相反,已经授权、低风险、可逆、重复发生且结果可观察的查询、摘要、草稿、提醒,不必处处请求确认。人的注意力是稀缺资源,应留给歧义、例外和责任,而不是浪费在机械点击上。

六、Agent 自主度五级:不是能力排名,而是风险配置

为了帮助企业选择边界,我把 Agent 自主度分为五级。等级描述的是“在一个具体场景中,Agent 最远可以推进到哪里”,不是给模型打智力分,也不是要求所有场景最终升到第五级。

L1:只检索和解释

Agent 可以查询资料、汇总事实、解释规则,不选择业务对象集合,也不生成正式建议。适合刚接入、对象体系尚不完整,或者对答案质量仍在评估的场景。

例如,解释安全库存政策、汇总某设备的历史检修报告。主要风险是引用错误和越权读取,因此要控制来源、权限和引用证据。

L2:定位对象并生成建议

Agent 可以把自然语言落到具体对象,沿关系组织上下文,给出候选分析或下一步建议,但不调用关键判断替人作结论,也不执行写操作。

例如,定位高风险库存项并生成待核查清单,识别油温异常设备并整理可能原因。对象匹配不确定时必须显式提示并请人确认。

L3:调用逻辑能力形成方案

Agent 可以调用经过测试和版本管理的逻辑能力,生成结构化判断、方案和行动参数。它不再只靠语言模型推测规则,但仍停在建议或草稿层。

例如,计算缺货时间和建议数量,判断客户是否具备触达资格,生成质量异常影响范围。适合规则相对明确、方案需要复用,但正式动作仍有责任要求的场景。

L4:在确认后执行中风险动作

Agent 完成对象定位、逻辑调用和参数预填,向责任人展示证据、影响和风险;确认后,由行动能力执行创建任务、提交补货单、登记一般缺陷等中风险动作。

这里的关键不是多一个确认框,而是确认人真正理解并承担这次行动。高风险动作可以使用类似流程,但通常还需要更高层审批,甚至不允许 Agent 直接触发。

L5:在限定场景内自动执行并观察结果

Agent 可以在预先授权的对象范围、金额或数量阈值、时间窗口和工具集合内自动执行,并持续观察状态、处理可预期异常、触发补偿或转人工。

它适合低风险、标准化、可补偿、历史表现稳定且结果可观察的动作,例如创建内部观察任务、更新非关键备注、按明确策略生成低风险草稿。L5 不是“自由行动”,而是“在很窄的跑道内自动闭环”。

七、如何为一个场景选择等级

自主度不能只看动作是否简单。一个点击操作可能对应大额采购,一套复杂分析也可能只是只读报告。评估时至少要看六个问题。

  • 业务影响:是否改变资金、库存、客户权益、生产或设备状态?

  • 可逆程度:错误能否撤销、补偿,还是会形成不可恢复的外部后果?

  • 判断稳定性:规则是否明确、经过测试,还是依赖大量情境经验?

  • 对象与数据质量:身份、关系、状态是否完整及时,冲突能否被识别?

  • 权限与责任:谁授权、谁承担结果,是否存在明确审批和接管角色?

  • 观察能力:执行后能否取得权威回执,发现失败、重复和业务偏差?

影响越高、越难回退、判断越不稳定、观察越弱,自主度就应越低。即使运行在 L5,只要出现对象不确定、证据冲突、规则变化、系统异常或影响超阈值,也应降级到 L3 或 L4。

反过来,某个场景长期稳定并不意味着可以直接升级。企业要用历史回放和小范围运行证明:对象选对率、逻辑结果、动作成功率、人工修改率、异常接管和业务结果都处于可接受范围,再逐步放宽对象范围或动作权限。升级的是经过验证的运行边界,不是对模型的信心。

带走一张表:Agent 自主度五级评估表

等级

Agent 最远推进到哪里

人在回路的位置

适用条件

典型产物

L1 检索解释

查询、汇总、解释

通常事后抽查

只读、来源可控

答案、摘要、依据

L2 对象建议

定位对象、生成候选建议

对象不确定时确认

低影响、判断仍需人负责

对象清单、建议说明

L3 逻辑方案

调用逻辑、形成结构化方案

方案或关键判断复核

逻辑可测试,动作尚未发生

风险结论、行动草稿

L4 确认执行

确认后执行中风险动作

责任转移前确认或审批

权限、行动契约、证据完整

任务、补货单、缺陷单

L5 限定闭环

限定范围内执行、观察、回写

异常或越界时接管

低风险、可补偿、可观察、运行稳定

自动闭环及完整轨迹

评审时不要只选一个等级,还要写清四项配置:允许作用的对象范围、允许调用的动作、必须降级的触发条件、结果观察和人工接管时限。没有这四项,“L5 自动执行”仍然只是一个模糊口号。

结语:让 Agent 灵活地想,受控地做

企业需要的 Agent,不是一个在所有环节都自由发挥的模型,也不是一个每走一步都等待确认的聊天界面。

它应该在用户表达模糊时理解意图,在上下文分散时组织信息,在路径不确定时拆解任务、选择能力;同时,它应接受对象身份、关系、状态、关键逻辑、行动契约和权限审批的约束。灵活性放在任务组织层,确定性放在业务后果层。

Agent 自主度五级提供的不是一条“从低级走向高级”的升级路线,而是一套配置语言:这项任务可以走到哪一步,哪里要停,谁来接手,什么条件下可以再向前。

真正聪明的 Agent,不是从不向人求助,而是能识别自己的边界;真正成熟的企业,也不是把人完全拿掉,而是把人的判断和责任放在最值得出现的位置。

留一道思考题:

企业为什么敢让 Agent 做事?答案不只在权限和审批,还在于每一次判断、行动、失败和人工干预,能不能留下完整的运行证据。