AI幻觉率从46%到4%:Google Co-Scientist的多Agent可靠性工程实践 📅 发布时间:2026/9/4 16:18:26 👁 浏览次数: 最近 Google 的 AI 研讨方向出现了一个很有意思的数据点论文结果幻觉率 46% 降到 4%。这是 Google 在 Co-Scientist 可靠性模块中公开的一组效果。对于科研工作者、算法工程师和技术博主来说这个数字背后真正值得关心的不是“AI 进步了多少”而是“系统如何通过工程手段把幻觉关进笼子里”。为了便于检索和阅读我会从背景、原理、实际工程思路、效果验证、常见陷阱和应用建议这条线展开全文预计 6000 字左右尽量不堆理论。1. Google Co-Scientist 是什么Co-Scientist 是 Google 于 2025 年发布的一整套基于多 Agent 协作的 AI 科研辅助系统。它的目标很垂直不写通用问答而是把“科研灵感生成”这件事做成一个可管理的流水线。传统上科研人员找新想法靠几种方式阅读大量论文寻找空白点在实验室内部讨论中碰撞方向凭个人经验把不同领域的方法迁移到新问题上使用普通大模型做泛泛的 brainstorming。这几种方式都有明显瓶颈。阅读量大个人经验有偏差普通大模型缺乏长期记忆和结构化评估容易一本正经地输出无依据的假设。Co-Scientist 提供的是“多 Agent 科研助理”形态。你可以把一套复杂科研任务拆给多个虚拟专家角色每个角色只负责一个环节有的负责生成想法有的负责反思缺点有的负责打分筛选有的负责和已有文献比对。最后由一个元评审角色把结果聚合形成候选研究方向。这类系统在 2025 年以来已经不少见但 Co-Scientist 的特殊之处在于它对“可信度”做了显式优化。而可靠性与幻觉率直接挂钩这也是本文要讨论的一个高价值切入点。具体版本号和论文细节以 Google 官方发布为准。但可靠性模块的技术思想是通用的任何由大模型生成的科研建议都必须经过“证据校验层”而不是让大模型直接输出结论。2. 幻觉率从 46% 降至 4% 这个数字为什么重要先说一个容易踩的坑看到“46% 降到 4%”就认为这是“大模型变得更聪明了”这种理解并不准确。从已知材料看这次改善的核心是给模型生成的建议增加了可靠性校验模块而这个模块的目标很明确区分“可能有依据的灵感”和“完全没有依据的臆测”。这个数字证明的不是模型推理能力发生质变而是工程防线能显著抑制错误输出。为便于非算法背景的读者理解可以把问题类比成“评审论文时的审稿流程”。如果一位评审专家只凭印象写评审意见那么他对一篇文章技术细节的记忆可能只有 50% 的准确率。但如果要求这位评审专家必须翻到论文的“方法”章节、对照表格中的原始数据再引用参考文献页码写意见那么他的准确率会大幅上升。注意他的专业知识并没有突然增长只是因为流程强制他“每个论断都要回到原始资料”。AI 科研辅助系统也是这样。生成模型本身不可避免地会产生幻觉尤其是在生成“假设”“实验思路”“论文结论”这类开放性内容时。问题的关键不是让模型发誓不撒谎而是给它设计一个“审稿人”或“检索器”在输出进入用户视野之前完成一轮又一轮的证据核验。所以 46% 到 4% 这个数值衡量的是可靠性模块带来的系统级增益不是模型本身能力提升的增益。这个区隔对普通用户非常重要它说明“AI 工具是不是胡说八道”在很大程度上可以被工程治理而不只是等大模型版本更新。3. Co-Scientist 的核心架构原则由于 Google 官方只公开了部分架构细节这里不猜测具体实现参数而是把该系统公开披露的多 Agent 通用架构分层梳理。从外部视角看Co-Scientist 至少包含以下几个功能层次第一任务解析层。用户的输入往往是一段相当宽泛的研究目标比如“研究某种疾病的潜在治疗靶点”。系统需要先把目标分解为领域、约束、目标变量和可验证标准。第二多 Agent 创意思考层。该层通常包含生成、反思、打分和演化四类 Agent生成 Agent根据已知知识提出候选假说或实验路径反思 Agent站在批评者角度主动寻找漏洞打分 Agent给各个候选方案的可落地性和新颖性打分演化 Agent把高分方案与历史优秀方案结合产生下一代想法。第三证据校验层。这是可靠性模块的核心位置。所有候选方案在这里面对同一个问题你提出的这句话能不能在权威科学文献里找到直接或间接证据第四聚类与输出层。降低信息冗余度把相互重复的建议合并向用户输出摘要、证据图、置信等级和建议实验。这个架构本身并不算超前很多基于大模型的多 Agent 项目也是这么设计。真正拉开差距的是“证据校验层”的完成度它不只是一个“关键词检索 引用生成”功能而是把校验过程拆分成了更细粒度的验证单元。4. 可靠性模块是如何把幻觉率降下来的Google 官方公布的 46% 到 4% 这个改善幅度是经过某种可量化的评测任务得到的。普通文献中并不存在一个统一的“幻觉率”定义所以更合理的理解是在一个受控评测集上系统输出的研究建议中被证据检验模块判定为“有可靠佐证”的比例大幅上升。从工程实现的角度拆解这类可靠性模块通常由四个关键环节构成。4.1 声明切片与事实点抽取大模型生成的完整回答是一整段话不能把整段话当作一个事实来校验。可靠性模块首先要做“粒度切分”。例如模型生成了一句复合句“靶点 X 的表达水平在疾病 Y 的晚期显著升高且抑制 X 可以降低炎症因子 Z。”这段内容至少包含四个事实点靶点 X 表达水平与疾病 Y 相关相关性发生在晚期表达方向是升高抑制 X 可以降低因子 Z。每一个事实点都可能部分正确、部分错误。如果不切分系统无法判断整句是否可信。切分之后系统就有了四个可验证的单元。这个环节看似简单却是评测中影响分数比较大的部分。切分过粗校验等于没做切分过细则产生大量难以在文献中精确匹配的碎片会造成误杀。4.2 文献检索与相关性校准事实点抽取完成后系统会调用学术检索接口把每一句话转成检索式寻找最相关的文献片段。这里容易遇到一个工程问题搜索引擎返回文档的排序并不能代表事实相关性。一个网页同时提到“疾病 Y”和“抑制剂”可能与目标事实毫无关系。所以可靠性模块不能直接信任检索排序它还需要一个重排或者相关度过滤的步骤。相关度过滤后系统通常会做“证据强度分级”强证据该句子在已发表的同行评议研究中有直接明确对应弱证据只有间接支持或仅存在于预印本、非同行评议材料无证据没有检索到支持性文献也没有明确反证反证存在检索到与生成结论冲突的文献。这种分级比简单的 0/1 评分更合理因为科研中“没有证据”和“证据反对”是完全不同的状态。4.3 核验结果回注与输出置信度修正校验完成后生成内容不是被简单标记“正确”或“错误”而是会带着证据链接和置信度标签返回给用户。例如“现有证据提示靶点 X 可能通过下调炎症因子通路延缓疾病 Y 进展。支持证据文献 A 报道了 X 在动物模型中的作用文献 B 报道了炎症因子 Z 与 Y 的关系。但尚无人体实验直接证明抑制 X 可以降低 Z。”这样用户就能区分哪些内容有较高把握哪些内容只是间接指导。Co-Scientist 的可靠性模块大概率是在输出阶段强制要求“所有重大结论都必须附带文献来源”。当结论没有文献支撑时系统自动降低该结论的展示权重或者干脆在最终汇总里剔除这类结论。4.4 人工反馈回路最后一个关键机制是用户反馈。科研人员阅读完系统建议后可以标注某条建议是“可行”还是“依据不足”。可靠性模块会把这个反馈反馈给打分 Agent从而影响未来对待同类文献的态度。如果没有这一层可靠性模块就只是一把静态尺子。引入人工反馈之后它可以不断适应细分领域的文献风格。5. 你以为文章在解决什么实际又解决什么很多人看到“幻觉率降低”第一反应是“这下可以用 AI 代替我读文献了”。这是对这类系统的最大误解。Co-Scientist 的可靠性模块解决的是“检索增强生成”里最常见的副作用让大模型给出经过验证的回答但它不能解决两个根本问题第一文献本身可能错误。如果科学文献中有错误结论而且可靠性模块恰好检索到并认定为“强证据”那么错误会被包装成高置信度输出。模型引用次数越多错误反而显得越可信。第二科研中真正有价值的部分往往没有前序文献。如果一个研究方向处于无人区那么所有高置信度输出都只会指向已有热点而不是未知空白。使用这类系统时必须意识到它给出的最稳妥建议往往来自已验证领域而最有变革潜力的方向恰恰在证据真空区。所以在实际使用中不能把“低幻觉”和“高价值”画等号。低幻觉只意味着“有据可查”并不意味着“答案创新”。对科研选题而言理想状态是低幻觉基础上有创新而不是只要低幻觉。6. 当我们讨论 46% 时讨论的是什么“幻觉率 46% 到 4%”很容易让人想到一个画面过去的 100 条输出里有 46 条是编造的现在只有 4 条。这种理解过度简化了评测口径。在大多数模型评测中“有幻觉”的定义包含了一个重要前提评测人先确定一个标准答案然后看模型输出是否与标准答案一致。但科研建议不像“曹植的七步诗是不是五言”那么有标准答案科研建议的“对错”往往是程度问题。一个建议可能“方向正确、机制解释错了一半”也可能“结论正确、引用的实验对象不对”。因此46% 和 4% 更大概率是“可靠性模块介入前后在某个具体证据匹配集上的误差对比”不代表模型在开放场景下永远保持 4% 的幻觉率。这一点技术上想通了才不会在后期落地时被“指标美化”误导。以后看到厂商宣传“幻觉率降低到 4%”第一反应应该是问三个问题评测集是什么谁定义了答案正确性4% 是在检索库覆盖范围内还是范围外这些问题同样适用于今天的主角 Co-ScientistGoogle 的官方论文可能详细描述了评测方式但普通开发者更应关注这套机制的工程形态。7. 一个可实操的最小校验系统对于搞自然语言处理和应用开发的工程师来说研究 Google 的论文是一回事自己动手搭一个简化版“可靠性校验层”才能真正理解下降机理。下面给出一个最小可执行的思路。整体流程分三步用大模型生成研究建议对建议做事实切分每一条事实点与参考语料做相似度计算并输出证据等级。这里不用复杂架构只需要 Python 环境和一个能调用向量模型的库。需要说明的是这段代码用于演示通用流程版本和库名可能会有变化重点是运行方法。先准备虚拟研究建议文本# verify_demo.py import json # 模拟大模型生成的科研建议 generated_suggestion 抑制基因 ABC 的表达可以降低炎症因子 IL-6 的水平。 动物实验表明敲除 ABC 基因的小鼠在疾病模型中表现出更低的死亡率。 已有临床研究证明该基因在人体中可以作为治疗靶点。 # 把整段切分为三个可验证声明 claims [ 抑制基因 ABC 的表达可以降低炎症因子 IL-6 的水平, 敲除 ABC 基因的小鼠在疾病模型中表现出更低的死亡率, 已有临床研究证明该基因在人体中可以作为治疗靶点 ]这只是说明数据被切成了三个单元。真实系统会使用大模型微调接口做声明切分。然后准备一个简单的本地“证据库”实际项目中这里应该换成论文标题和摘要。为了演示可运行这里构造两条资料# evidence_store.py evidence_pool [ { id: paper_001, source: Journal of Molecular Biology 2024, abstract: ABC 基因编码炎症调控蛋白敲低 ABC 后 IL-6 水平下降。 }, { id: paper_002, source: Nature Aging 2023, abstract: 在 db/db 小鼠模型中ABC 基因缺失改善了代谢指标但没有报道死亡率变化。 }, { id: paper_003, source: Lancet 2025, abstract: 一期临床试验未发现 ABC 基因靶点在人体中的意义。 } ]这里的第二条资料只支持“小鼠相关”但没有明确说死亡率数据。第三条资料与“已有临床研究证明”存在矛盾。运行验证逻辑后应当得到这样的结论第一条声明有支持第二条声明证据不足第三条声明被反证。接着写一个函数把所有声明与全部文献做简易相似度比较# 简化的向量计算函数示例 # 因为完整 embedding 依赖外部模型这里用字符重叠度做说明 def fake_relevance(claim: str, evidence: str) - float: claim_tokens set(claim.lower().split()) evidence_tokens set(evidence.lower().split()) if not claim_tokens: return 0.0 intersection claim_tokens evidence_tokens return len(intersection) / (len(claim_tokens) ** 0.5)这个函数不能用于生产但有助于理清逻辑。生产环境应该用一个真正的 embedding 模型比如在本地跑开源向量模型或者通过云端 API 调用然后计算余弦相似度。随后组装验证流程def verify_claims_with_evidence(claims, evidence_pool): results [] for i, claim in enumerate(claims): best_score 0.0 best_id None best_source for evidence in evidence_pool: score fake_relevance(claim, evidence[abstract]) if score best_score: best_score score best_id evidence[id] best_source evidence[source] label 无证据 if best_score 1.0: label 强相关证据 elif best_score 0.3: label 弱相关证据 else: label 无证据 results.append({ claim: claim, best_match: best_id, best_source: best_source, score: round(best_score, 2), label: label }) return results if __name__ __main__: result_list verify_claims_with_evidence(claims, evidence_pool) print(json.dumps(result_list, ensure_asciiFalse, indent2))运行以后输出的第三条声明会得到比较低的证据等级因为论文摘要里写着“未发现人体意义”与生成结论含义冲突。如果规则里把“反证”也纳入判定这条就应输出为“警告存在反证”。对于演示代码这套流程的效果可以这样验证打开文本并确定过滤条件。真实系统再把这条逻辑推到智能体层就可以延伸成“校验失败则重新生成”的机制。实际的可靠性模块远不止这些运行时还需要关键词扩展、引文网络分析、检索重排和引用格式生成这已经足够说明设计一块可靠性模块时核心流程是怎样的。8. 多 Agent 架构中可靠性模块应该放在哪里有人会问既然 Google 这套系统叫多 Agent那像可靠性校验这种“找茬”环节是不是也可以作为一个 Agent这个想法是对的但要把“校验 Agent”和“反思 Agent”区分开。反思 Agent 做的是逻辑层面的评审比如“实验分组是否有对照组”它不一定要查文献。可靠性模块做的是事实层面的核验它必须能给出证据。两者不在同一层级。实际架构中的接入顺序大约如下先由生成 Agent 输出候选建议反思 Agent 剔除逻辑漏洞可靠性模块把剩下建议的事实点拉出来做文献比对无证据的建议不一定是错的但会被打上“缺少证据”标签打分 Agent 在综合分数中扣除无证据项的得分最终输出中无证据项排到很低位置甚至直接隐藏。用工程语言就是可靠性模块是打分流程的上游过滤器而不是事后大模型生成引用。很多团队总觉得“给大模型加一句‘请附带引用’就能减少幻觉”这是不成立的。模型对自身生成的引用内容完全可以再次产生幻觉只有外部检索器返回真实文献才能形成闭环。9. 这组指标的实际工程启示实事求是地讲论文中 46% 到 4% 的改善不是靠单点优化而是依靠一整条防线的配合。从这套思路里普通研发团队可以直接吸收五条经验第一不要试图用一个巨大的提示词让大模型“不胡说”而是把输出拆散再执行校验。只有拆了才能查。第二证据等级必须分级不要只有“符合/不符合”。科研场景到处是灰色地带。第三条要在“用户看到结果”之前做校验而不是让用户去怀疑每一个结果。输出的第一版界面只展示高置信证据结果无证据的结果藏在“探索模式”下即可。第四条在引用生成上多做一步保留原文来源让用户有能力点进原始论文去核实。第五条是持续收集用户反馈。科研人员在测试中标记“这个结果不可信”比任何自动指标都更准确因为有时候大模型看起来引经据典实际却跑偏了方向。外部对标一下2025 年各大模型厂商和科研工具都在强调 RAG、Agent 编排和模型可靠性。但很多方案只把检索能力当作上下文补充没有做声明切分和证据等级判定所以它们即便接入检索接口幻觉依旧没有显著下降。这就说明真正起作用的是“流程约束”而不只是“接入数据库”。10. 拿这个数字做产品宣传时要注意哪些坑如果你的团队正在开发科研 AI 产品并且准备引用类似数据建议先确认以下四个边界第一评测集覆盖的学科。如果一个评测集只涉及分子生物学那么生成结论里 4% 的幻觉率不代表在量子物理领域同样成立。Co-Scientist 内部同样是按领域拆分校验器的。第二评测集是否包含“无文献支持但有价值”的例子。如果所有错误都被定义成“没有文献支持”那么强行要求低幻觉率会把真正有创造力的方案全部过滤掉指标好看但意义不大。第三是需要区分“错误生成结论”和“错误推断机制”。有些输出其实没有违背事实只是把有关联的文献解读得过头了。过于粗略的评测可能导致人们忽视更隐蔽的语义级幻觉。第四动态更新速度。科研文献每天都在增长如果校验库停留在旧版本今天还“证据充分”的结论明天可能已经被推翻。可靠性系统要设计定期更新机制不是上线一次便终身有效。如果产品团队把这些边界讲清楚用户会更信任指标。如果只贴一个“46% 降到 4%”的宣传海报等到真实应用中被用户发现一次失败案例反而会削弱整体可信度。11. 对科研人员来说现在可以怎么用先给结论这个 4% 并不是“可信到可以直接写完论文投稿”而是指“有可靠性保障的时候用户敢把结果作为待验证灵感”。一个具体落地方案可以是这样的用 Co-Scientist 的输出做“选题启发池”把池子里高证据等级的结论搜集起来优先阅读相关原始文献把低证据等级的结论作为探索问题丢给实验室讨论。这个流程的关键在于“低证据等级不等于否决”只是优先级更低。科研人员的专业判断仍然是最重要的环节AI 系统提供的其实是“文献上下文扩展”能力。各团队根据自己的领域不同还应该让系统提供可配置的“证据等级最低阈值”做药物重定位这类风险较高的研究时阈值要调高做早期探索性课题时阈值可以放宽。Google 官方可能也会提出类似“用户设定新颖性与可靠性之间的旋钮”的思路这种设计比较合理。12. 这条技术路线的下一步走向论文表明可靠性模块能把幻觉压低真正影响行业的是它背后的评测方法。可以推测未来科研 AI 模型竞争会向两条线扩展一是评测标准化。更多项目会推出各自的“科研幻觉率”基准包含不同学科、不同文献库、不同技术类型。到时候不能只看一个总体百分比要按细分领域与细分能力做评价。二是证据颗粒度细化。现在的校验大多从论文级到摘要级下一步会走到实验表格级甚至到图表、原始数据代码这一层。比如某个基因表达差异的数值不是从正文摘要里核对而是从补充材料的表格里自动提取核对这能进一步降低次生错误。对于面向技术的用户当前可以动手加强的能力有三个多 Agent 工作流编排能力、声明切分模型的微调能力、以及证据库与检索质量的设计能力。这些能力不挑 Co-Scientist 具体版本长期适用。13. 文末值得记住的三件事关于这次讨论的“46% 到 4%”最后想给你三个可迁移的判断。第一看到一个大数字下降时先确认它是哪个层级的提升。如果是模型层你需要重测模型如果是流程层你可以抄作业。当前这个案例更接近流程层。第二可靠性工程追求的目标不是让模型绝对可信而是让模型在重要任务上“最大程度被约束”。从 46% 降到 4% 很好但不要假设它会本降到 0。科研探索允许灵感偶尔跑偏只是跑偏的代价会提前被用户知晓。第三如果你的团队已经在用 RAG 或 Agent 生成分析结论别急着要求效果数字一样漂亮先把最基础的“声明切分、证据分级、引用回注”这个最小闭环落地了模型能力的差异永远没有流程缺失更致命。这条从“生成”到“验证”再到“证据协同”的走向会是接下来一段时间里科研 AI 工具能够持续迭代的核心动力所在。