多模型LLM委员会实战:从错误放大器到稳定流程设计

多模型LLM委员会实战:从错误放大器到稳定流程设计 最近一个月我一直在维护一套用 9 个模型组成的 LLM 委员会multi-model council让它帮我写每周的金融通讯稿。听起来像一种很前沿的“AI 编辑部”但实际跑起来之后我遇到最频繁的问题不是“模型不够聪明”而是“9 个模型一起犯错的姿势比 1 个模型多太多”。有一次委员会里的多数模型通过了一个标题理由是它具备足够的冲击力。我没有重新核对公司名称直接把标题放进了草稿。直到最后人工检查时才发现那家公司已经改名前半年了。从那时起我才真正意识到多模型协作不是简单地加数量而是要把“流程设计”变成一等公民。否则你得到的不是一个更稳的 LLM 系统而是一个更复杂的“错误放大器”。这篇文章我会拆开讲运行一个 9 模型 LLM 委员会时真正会坏掉的地方、金融场景里的特殊风险以及我是如何一步步把方案改成能稳定跑起来的。1. 我从“9个模型写金融通讯稿”这个想法里真正想要的是什么先说清楚动机否则后面一切改进都无从谈起。我最初想用多模型委员会并不是为了“显得酷”而是想解决一个很具体的问题单一模型在金融内容上的系统性偏见。金融通讯稿不是散文它需要同时兼顾事实密度、市场覆盖和可读性。不同的模型在训练数据、推理风格、上下文利用方式上差异很大。一个模型可能很擅长宏观概述却对某个细分行业有盲区另一个模型可能对市场情绪很敏感但又容易把合规风险写得太轻。我当时想的是如果让多个模型分别扮演研究员、分析师、编辑、校对最后再合并是不是能覆盖每个模型的盲区这个想法本身没有错但它隐含了一个假设只要把模型组合起来问题就会减少。实际上不是的。多模型组合只是把“一个模型的黑盒”变成了“多个模型的黑盒集合”如果你没有在它们之间设计清晰的信息边界和校验机制反而会把问题变得更难追踪。1.1 动机不是让模型互相投票而是要覆盖盲区类似投研团队里宏观分析师、行业研究员、风控经理各自的职责不同。如果让 5 个研究员用同一个模子写报告覆盖度并没有提升。真正有价值的是让不同视角形成互补。我的初衷是把 9 个模型分成几组3 个模型负责信息提取从新闻原文中抽取出事件、数字、时间、公司主体。3 个模型负责分析判断给这些事件补充背景、风险和可能的市场影响。3 个模型负责写作和校对把前两组的输出整理成可发布的通讯稿。最后用一个汇总 Prompt把 9 个模型的输出合并并生成最终文本。这个结构听起来很“委员会”但实际运行起来最先出问题的恰恰是角色边界。1.2 我对“委员会”的初始设定我一开始写角色卡时只写了“你是一名宏观研究员”“你是一名行业分析师”“你是一名金融编辑”。我以为模型会按照投研团队的逻辑各司其职但真实情况是给研究员角色的模型经常在摘要里夹带“我认为”“建议关注”。给编辑角色的模型又会把别人的分析结果改成自己的“判断”。所有模型都倾向于“充分表达”而不是“克制地完成指定任务”。这不是模型“不听话”而是 Prompt 里的角色约束太弱。在多模型流程里角色不是口头上的身份而是需要通过输出格式、内容边界和禁止事项来落地的。比如研究员角色只允许输出结构化事实不能输出“我认为”而判断类角色才被允许写“可能”“存在风险”。所以委员会项目的第一步不是选 9 个最强的模型而是先定义好每个模型“能说什么”和“不能说什