Hermes Agent实战-用AGENTS.md说说怎么做Harness落地 📅 发布时间:2026/8/28 17:23:31 👁 浏览次数: Harness 的真相落地不是框架是一份 800 字的 AGENTS.mdHermes Agent 调教 · 独立篇 | 基于 Hermes v0.20.0 实测2026-08-24deepseek-v4-flash 摘要Harness 是 2026 年 AI 圈最热的词——「模型是大脑harness 是手和脚」。但概念人人听过落地长什么样却很少人见过。这篇文章用 36 次受控实验3 种写法 × 4 个任务 × 3 轮揭开真相harness 落地的最小单元就是一份 AGENTS.md。对比无约束、精简铁律、结构化三种写法结构化写法达标率 100%、成本 1.44 倍而看似稳妥的「精简铁律」反而触发过度验证、成本飙到 2.28 倍。附可复用的写法模板。导读目标读者用 AI AgentClaude Code / Codex / Hermes / Cursor 等做交付、写过但觉得「约束文件没什么用」的开发者你会得到AGENTS.md 三种写法的实测对比数据、为什么「铁律」会失效、一套 800-1500 字的可复用写法模板环境声明实验在 Hermes v0.20.0 deepseek-v4-flash 上执行结论对其他 Agent 平台方向性适用一、业务场景Harness 概念满天飞落地没人见过2026 年Harness Engineering 成了 AI 圈最热的概念。OpenAI 说「如果推理模型是大脑harness 就是手和脚」Terraform 作者 Mitchell Hashimoto 说「每次 agent 犯错就工程化一个方案让它再也犯不了同样的错」。概念一套套人人都能聊两句。但我们做 Agent 交付时发现一个尴尬的事实概念好懂落地难寻。你说 harness 是「环境」「约束」「工具壳」——那它到底长什么样是一套框架一个平台还是别的什么很多人以为 harness 是什么高深的基础设施但 OpenAI Codex 团队和 Hashimoto 的实践都指向一个朴素到近乎反高潮的答案harness 落地的最小单元就是一份 AGENTS.md——一个几百字的 Markdown 文件。Hashimoto 给 Ghostty 写的 AGENTS.md每一行都对应 agent 过去犯过的一次错。我们决定用实验验证这个「真相」如果 AGENTS.md 真的是 harness 的落地形态那「怎么写」就直接决定 harness 好不好用。于是有了这次 36 次受控实验。二、场景痛点约束文件写了为什么没用我们观察到三个典型失效模式裸铁律被字面执行。写了「测试要全面」agent 就真的把每个文件都翻出来测一遍——过度验证耗时成本翻倍产出反而变差。约束太长被稀释。几百条规则塞进一个大文件agent 上下文有限真正重要的纪律淹没在噪音里。只有要求、没有禁止。告诉 agent「要自测」但没说「不许跳过编译直接交付」——它照样能在最该拦的地方漏掉。写约束不是「写得多」是「写得对」。这促使我们做了一次受控实验用数据回答到底什么写法有效三、解决方案落地真相——AGENTS.md 就是 harness 的最小单元在讲实验前先建立框架AGENTS.md 为什么是 harness 的最小单元Hashimoto 给 harness 下过一个朴素定义「每次 agent 犯错就工程化一个方案让它再也犯不了同样的错。」他给 Ghostty 写的 AGENTS.md每一行都对应 agent 过去犯过的一次错。OpenAI 的 100 行地图哲学同理AGENTS.md 只当目录和指针把关键约束钉在顶层。所以 AGENTS.md 不是「项目说明书」是错误经验的固化载体——agent 犯过的错写进约束文件变成它下次的行为边界。约束文件AGENTS.md项目级管输出形态全局级管行为纪律格式要求 · 输出结构 · 汇报规范技能检查 · 自测习惯 · 事实完整按客户/项目要求调整SOUL.md 内化执行成本 1.59×AGENTS.md 字面执行成本 2.28×四、实验设计36 次受控实验怎么做的为了排除「感觉」我们做了对照实验实验项设计环境WSL Ubuntu-26.04Hermes v0.20.0deepseek-v4-flash规模3 种写法 × 4 个任务 × 3 轮 36 次独立会话考卷4 个约束敏感型任务T1 格式转换 / T2 技能纪律 / T3 写作约束 / T4 代码自测三种写法A 基线无约束/ B 精简铁律500 字/ C 结构化分节表格评估六维一次成功率 / 达标率 / 自我修正 / token 成本 / 耗时 / 稳定性五、运行验证实测结果5.1 核心对比36 次实测写法一次成功率平均达标率平均 token/轮耗时/轮稳定性A 基线无约束75%88.2%48.3k1.00×53s高稳定缺技能纪律B 精简铁律500 字91.7%96.1%110.1k2.28×83s中轮次间不一致C 结构化分节表格100%100%69.8k1.44×64s高三轮全一致5.2 关键发现技能纪律梯度清晰A 0/3 → B 2/3 → C 3/3 次加载技能。C 写法下 agent 每次都先加载技能再动手——「先加载技能」的铁律真正被内化。B 的裸铁律触发过度验证T2 任务平均消耗 766k tokensA 的 3 倍——写了「测试要全面」它就把全项目翻出来测。C 用「要求禁止」成对写法成本可控。事实完整性差异B 有一次从局部日志推断整体把「3 变体 36 轮」说成「双变体 24 轮」C 每次都读完整方案文件、说对。「禁止从局部推断整体」从此写进我们的纪律。C 的约束直接体现在输出格式表格化、来源标注、汇报三要素逐项出现——约束文件管什么产出就长什么样。六、落地建议约束文件写法要素可直接复用实验结论收敛成一套可复用写法800-1500 字超过 3000 字稀释上下文分节角色 / 执行纪律 / 输出格式 / 禁忌——四节各管一摊纪律表格要求与禁止成对| 纪律 | 要求 | 禁止 |——只有要求没有禁止agent 会字面执行成过度行为B 变体的教训「事实完整」纪律必带涉及范围/数量/结论的事实必须核对完整来源禁止从局部信息推断整体分层项目级约束AGENTS.md管输出形态全局级约束SOUL/USER/MEMORY管行为纪律——同样一句话放 SOUL.md 内化执行成本 1.59×放 AGENTS.md 字面执行成本 2.28×记忆是信息不是纪律行为纪律进身份层触发强信息偏好/环境进记忆层触发弱一个 AGENTS.md 模板片段真实模板节选## 执行纪律 | 纪律 | 要求 | 禁止 | |------|------|------| | 技能 | 动手前先加载对应技能 | 禁止凭记忆硬写 | | 自测 | 写完代码立即执行验证 | 禁止跳过测试直接交付 | | 事实完整 | 结论核对完整来源 | 禁止从局部日志推断整体 | ## 输出格式 - 中文标题关键信息用表格呈现 - 汇报三要素做了什么 / 实测结果 / 遗留问题七、实战坑实测踩出来的坑现象修复铁律被字面执行「测试要全面」→ 全项目翻查成本 2.28×要求禁止成对约束聚焦「别做什么」约束过长稀释几百条规则agent 只看开头800-1500 字每行问自己「删掉会导致犯错吗」行为纪律放错层纪律写进项目文件 → 字面执行而非内化行为纪律放 SOUL/USER全局格式要求放 AGENTS.md项目级记忆当纪律写MEMORY 写「先加载技能」→ 不触发0/3纪律进身份层MEMORY 只写信息偏好/环境八、启示回到开头那个问题harness 落地到底长什么样36 次实验给出的真相是落地不是一套框架是一份 800 字的 AGENTS.md——它的本质不是「写要求」是把 agent 犯过的错固化成行为边界。而这份文件的写法直接决定 harness 是可靠的缰绳还是勒脖子的死结结构化、成对、分层缺一不可。概念听得再多不如亲手写一份。下次 agent 反复犯同一个错时别急着骂模型也别急着搜什么 harness 框架。问自己一句这个错值得写进 AGENTS.md 吗如果值得怎么让它在 800 字内、以「要求禁止」的形式出现这就是 harness 的落地——不在 PPT 里在你项目根目录那份几百字的 Markdown 文件里。 你给 Agent 写过约束文件吗有没有「写了约束反而更糟」的经历评论区聊聊。 更多实战记录见我的博客鱼日先生本文基于 Hermes v0.20.0 实测实验环境为 WSL deepseek-v4-flash结论对其他 Agent 平台方向性适用。AI 参与创作声明本文由 AI 辅助写作内容基于作者真实实测记录。