DeerFlow Skill Reviewer 的效果验证机制用四级 Assurance 与风险驱动的证据标准界定审查到底证明了什么【免费下载链接】deer-flowAn open-source long-horizon SuperAgent harness that researches, codes, and creates. With the help of sandboxes, memories, tools, skill, subagents and message gateway, it handles different levels of tasks that could take minutes to hours.项目地址: https://gitcode.com/GitHub_Trending/de/deer-flow本文围绕 DeerFlow 技能审查体系中的效果验证Effect Verification机制展开解析static_only、trigger_checked、behavior_verified、regression_verified四级保障等级Assurance Level的定义与升级条件、提升 Assurance 所需的八项证据要素以及缺评估何时才构成实质问题的风险判定规则。读完本文你能够理解 DeerFlow 中 readiness就绪度与 assurance保障度这两个正交维度的设计逻辑并在实际审查或编写技能包评估证据时准确判断一份证据链能支撑到哪个保障等级。效果验证在 skill-reviewer 中的定位DeerFlow 内置的 skill-reviewer 技能 负责把既有技能包当作不可信数据进行审查判断其是否具备发布就绪度。整个审查方法论由四个参考文档构成review-rubric.md七个语义维度的打分标准review-checklist.md可重复执行的事实检查清单eval-design.md触发评估与行为评估的设计规范effect-verification.md效果验证即审查结论由什么证据支撑的判定规则。effect-verification.md开篇一句话即点明核心立场Readiness and assurance are separate.就绪度与保障度是两回事。这句话是理解整套机制的钥匙。skill-reviewer 的 SKILL.md 在 Readiness Rules 一节中也明确警告publish_candidate可作为发布候选并不意味着运行期行为已经被验证。也就是说一个技能包静态检查全部通过、语义审查无实质问题只能说明它看起来可以发布而不能说明它实际上会按预期工作。后者必须由保留下来的运行证据来证明而证据与保障等级的对应关系正是 effect-verification.md 所规范的内容。四级 Assurance 等级及其精确定义文档定义的四级保障等级由低到高依次为等级定义含义解读static_only仅对包做了静态检查未保留任何运行期证据只证明了结构、触发边界、安全约束等静态属性trigger_checked针对明确的模型/运行时执行并保留了正例与负例路由用例证明了该技能在指定模型上会被正确选中/不被误选behavior_verified针对被审查包的摘要digest行为断言全部通过证明了指定版本包在指定运行时下行为符合断言regression_verified冻结基线与被审查包进行了对比并保留了输出与评分证据证明了新包相对基线没有回归甚至可证明改进这套枚举并非文档口头约定而是被机器契约与渲染代码共同固定的。机器契约 review_report.v1.schema.json 中assurance字段即为assurance: { enum: [static_only, trigger_checked, behavior_verified, regression_verified] }并且该字段是报告顶层必填项required列表包含assurance。在确定性审查核心中renderer.py 同样以Literal类型固化了这四个取值Readiness Literal[blocked, revise, publish_candidate] Assurance Literal[static_only, trigger_checked, behavior_verified, regression_verified]从源码结构看确定性核心产出的静态报告会把assurance直接初始化为static_onlybuild_static_report中assurance: static_only——这与文档语义完全一致只跑了静态事实提取就默认只能主张最低保障等级任何更高等级必须由保留的运行证据另行证明。此外renderer 中还内置了面向en/zh两种语言的本地化标签如static_only→ 仅静态审查、regression_verified→ 回归已验证报告渲染规则文档 report-rendering.md 也要求结构化输出中的枚举值不得翻译中文解释只能作为标签附在枚举旁。提升 Assurance 所需携带的八项证据文档规定要突破static_only证据必须同时包含以下八项——subject digest被审查包的摘要model ID执行的模型标识runtime or DeerFlow version运行时或 DeerFlow 版本prompt inputs提示词输入tool trace工具调用轨迹outputs输出产物assertions or grading result断言或评分结果timestamp时间戳。并附上一条关键的降级规则If any of those are missing, stale, contradictory, or attached to a different digest, name the limitation and keep the lower assurance level. 上述任何一项缺失、过期、互相矛盾、或挂在别的 digest 上时必须明确写出这一局限并保持较低的保障等级。这条规则值得展开理解digest 锚定。证据必须与被审查的那一份包摘要绑定。review-rubric.md 中 Evidence Quality 维度的concern状态正是描述这种情况Evidence exists but is partial, stale, or not tied to the reviewed digest.证据存在但不完整、过期、或未与被审查 digest 绑定。证据链中任何一环指不到当前 digest就不能主张更高的 assurance。降级而非删改。文档要求是 name the limitation and keep the lower assurance level——把证据缺口如实写进报告的局限说明里并停留在较低的等级而不是把缺失证据脑补成已验证。这与 SKILL.md 中 Do not claim a higher assurance level than the evidence proves.不要主张超出证据所能证明的保障等级的总原则一脉相承。与行为评估的对应。eval-design.md 中 Behavior Evals 一节要求保留的要素正是这八项的子集被审查包 digest、模型与运行时身份、提示词与预期行为、工具轨迹、输出产物、断言或评分结果。Baseline Comparisons 一节则进一步要求若要主张改进必须同时保留基线与候选包两个 digest并且只有当对比产物与评分证据齐备时报告才可使用regression_verified。基于风险的证据要求缺评估何时才构成实质问题文档最后一节 Risk-Based Evidence 回答了另一个常见疑问没有评估evals到底算不算问题答案是取决于风险画像。缺失的 evals 在以下六类情形中会成为实质问题material技能执行破坏性操作或对外可见的操作destructive or externally visible actions处理密钥或敏感数据存在已知的兄弟技能路由冲突风险sibling-routing collision risk声称相对基线有可度量的改进产出高风险high-stakes输出有回归历史。这条规则在评分标准 review-rubric.md 的维度 7Evidence Quality中有一一对应的表述Missing evals are normally a recommendation, not a blocker. They become a major issue when the skill performs destructive or externally visible actions, handles secrets, has sibling-routing collision risk, claims measurable improvement, produces high-stakes output, or has known regressions.即缺评估默认只是建议项recommendation一旦命中上述风险画像则升级为 major 问题而 rubric 同时定义了更严格的情形——当技能做出高风险或可度量声明却完全没有可信证据支撑时该维度可直接给出blocker进而按 SKILL.md 的 Readiness Rules 把就绪度压到blocked。这套风险 → 证据要求的映射与审查清单 review-checklist.md 的 Evidence 小节相互呼应清单要求路由边界模糊时触发评估必须包含正例与负例行为评估必须把输出绑定到被审查的 digest声称改进之前基线必须先冻结frozen对任何已验证声明运行时、模型、提示词、输出、评分器都必须保留下来。与 Eval 设计的衔接证据从哪来effect-verification.md 回答什么算有效证据而 eval-design.md 回答证据怎么产生两者共同决定了 assurance 能爬到哪一级Trigger Evals对应trigger_checked触发评估集应包含应当命中本技能的正例、应当路由到别处的负例、存在相似边界时的兄弟冲突用例并为每条用例附简短理由。文档给出了既定的用例结构现有触发评估列表格式[ { query: Review this skill for publication readiness, should_trigger: true, rationale: Explicit skill review request } ]只有针对明确的模型/运行时实际执行并保留了这套正负用例才能主张trigger_checked。Behavior Evals对应behavior_verified行为评估必须保留被审查包 digest、模型与运行时身份、提示词与预期行为、工具轨迹、输出产物、断言或评分结果——这正是提升证据清单的核心组成部分。Baseline Comparisons对应regression_verified主张改进类结论时必须同时保留基线与候选包两个 digest且对比产物和评分证据齐备报告才允许使用regression_verified。skill-reviewer 的 SKILL.md 也明确运行行为实验或基线对比实验属于skill-creator的职责域reviewer 只负责判定既有评估与保留证据究竟证明了什么——即 effect-verification 的判定本身。实践要点把上述机制落到实际操作中可以归纳为三条可执行原则写报告前先定 assurance而不是先定 readiness。确定性事实只能把你带到static_only从 renderer.py 的默认值即可见想上探到更高等级先检查八项证据是否齐备、是否绑定当前 digest、是否针对明确的模型与运行时。缺证据就降级并写明局限。证据缺失、过期、矛盾、或挂在别的 digest 上四者居其一结论就是停留在较低等级并在报告中点名该局限不做推断补全。按风险画像决定缺评估的严重度。无破坏性/敏感数据/路由冲突/度量声明/高风险输出/回归历史六类风险时缺 evals 只作为建议项提出命中任一风险时按 major 处理若已做出高风险或可度量声明却无可信证据则按blocker处理并影响就绪度判定。小结effect-verification.md 是 DeerFlow 技能审查体系中证据—结论对应关系的权威规范它用四级 assurance 枚举把审查证明了什么量化用八项证据要素和 digest 锚定规则划出升级边界用风险画像决定缺评估的严重度。这些规则不是孤立的文档约定而是被 review_report.v1.schema.json 的机器契约、review-rubric.md 的 Evidence Quality 维度、review-checklist.md 的检查项以及 renderer.py 中的确定性实现共同落地的构成了一套可审计、可重复的技能效果验证方法。【免费下载链接】deer-flowAn open-source long-horizon SuperAgent harness that researches, codes, and creates. With the help of sandboxes, memories, tools, skill, subagents and message gateway, it handles different levels of tasks that could take minutes to hours.项目地址: https://gitcode.com/GitHub_Trending/de/deer-flow创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考