模型越强越翻车?GPT-6 旧配置踩坑深度避坑指南

模型越强越翻车?GPT-6 旧配置踩坑深度避坑指南 文章目录前言1. 模型越听话你越容易遭殃1.1 官方那个反面教材1.2 描述写太宽为什么这么坑2. AGENTS.md一份文件引发的血案2.1 反面教材读都给我读2.2 正面教材给上下文建一张路由表3. Skill 的真相description 才是路由器3.1 先递名片再谈生意3.2 激进哲学1% 的可能也要上4. 那些过时的祖传规矩4.1 测试狂魔4.2 万事请示5. 结论把配置维护当成迁移的一部分P.S. 目前国内还是很缺AI人才的希望更多人能真正加入到AI行业共同促进行业进步增强我国的AI竞争力。想要系统学习AI知识的朋友可以看看我精心打磨的教程 传送门http://blog.csdn.net/jiangjunshow教程通俗易懂高中生都能看懂还有各种段子风趣幽默从深度学习基础原理到各领域实战应用都有讲解我22年的AI积累全在里面了。注意教程仅限真正想入门AI的朋友否则看看零散的博文就够了。前言先说个事OpenAI 放话了从 GPT-6 开始你攒的那些 Skill 和 AGENTS.md该大扫除了。我看到这消息的第一反应是啊我还没攒够呢你就要我扔我家 C 盘都没这么乱过。1. 模型越听话你越容易遭殃这事特别反直觉模型越强越会遵守指令你以前攒下的优良传统就越容易出事。以前是你说东它往西现在是你眨个眼它都当圣旨执行。官方这次也承认了GPT-6 Astra 的 instruction following 比前代强一大截所以更容易被 Skill、AGENTS.md 里的规则带跑。模糊的、互相打架的、范围大到没边的规则会让它提前停下来问你问着问着干脆卡住活也不干了。翻译成人话你请了个执行力爆表的员工然后亲手把岗位说明书写成了脑筋急转弯。1.1 官方那个反面教材官方自己举过一个例子。有个 Skill 的描述是这么写的Use when working with databases, queries, models, or persistence.覆盖范围大不大大。有用吗没有。你只是想改个 ORM 字段名或者修一条普通的 query模型一看数据库query这题我会当场把 migration Skill 拉进上下文后面跟一大串规则、检查步骤、参考资料浩浩荡荡全进来了。就像你去便利店买瓶水店员以为你要承包整条供应链给你拉来一车货还附赠一份物流方案。官方推荐的版本长这样adding or changing a migration, or reviewing its rollout区别在哪它描述的是具体任务不是一片领域。触发条件一收窄模型就不会逮着谁都问您是不是要上系统。省下来的可都是白花花的 token。1.2 描述写太宽为什么这么坑有人觉得描述写宽点怎么了模型聪明着呢会自己判断。问题是它太聪明了聪明到把可能相关和就是相关当成一回事。一个 PostgreSQL migration 的 Skill你要是写处理数据库、query、model 或 persistence 时使用它干任何沾边的事都想把迁移手册翻出来比老太太翻黄历还勤快。2. AGENTS.md一份文件引发的血案2.1 反面教材读都给我读现在很多 AGENTS.md 还是这种画风Before every edit, read architecture.md, database.md, and deployment.md.这条规则以前有用因为早期的 Agent 是真不会主动找文档你只能把饭喂到嘴边还得补一句张嘴。现在呢你改一个字符串它把三个 md 从头读一遍再改一个字符它又从头读一遍。一天改两百次它就读两百遍。除了浪费 token、拖慢进度毫无意义上下文还像吹气球一样膨胀膨胀到最后它开始自己骗自己幻觉比梦话还离谱。这画面像什么像你妈当年逼你每写一个字之前先把新华字典翻一遍。你憋了五百字的作文你妈在旁边翻了五百遍字典最后还问你作业怎么还没写完2.2 正面教材给上下文建一张路由表官方推荐把它改成条件触发Use architecture.md for service boundaries, database.md for schema changes, and deployment.md when preparing a deployment.说白了就是给模型建一张上下文路由表改 service boundary → 读 architecture.md改 schema → 读 database.md准备部署 → 读 deployment.md普通 UI bug → 都不用修一个 typo → 都不用修 typo 都不用这待遇比我当年上班强多了。这套东西有个正经名字叫 Harness 工程意思是给模型一套精准的上下文索引和项目约束。名字听着高级本质就一句话别让它瞎翻翻到有用的为止。3. Skill 的真相description 才是路由器3.1 先递名片再谈生意很多人有个误解项目里放几十个 SKILL.md 有什么关系需要的时候模型自然会加载。实际上现在的 Codex 用的是 progressive disclosure翻译过来就是先递名片再谈生意。启动的时候模型手里只有每个 Skill 的 name 和 description顶多再带个文件路径。它先判断这单跟谁有关判断上了才去读完整的 SKILL.md。所以 description 是什么它就是 Skill 的路由器。你把描述写成小区门口那种本店经营各种商品那模型就只能挨家挨户敲门。3.2 激进哲学1% 的可能也要上老牌的 Superpowers 里有个 using-superpowers写得特别激进只要有 1% 的可能某个 Skill 适用就必须调用回复之前、澄清之前、浏览代码之前、检查文件之前全都得先过一遍 Skill 判断。你品品这个流程。这是干活吗这是过安检还是那种连拖鞋都要脱下来检查的安检。作者后来自己调整过但在现在的强模型面前这种约束哲学确实没什么必要了。它会把模型从高概率的自然轨迹上硬拽到一条规定的跑道上还要求它边跑边喊口号。模型不知道什么时候该判断判断着判断着活就干完了——当然是它自己觉得的。4. 那些过时的祖传规矩4.1 测试狂魔再看一类很经典的 AGENTS.mdAlways run tests after every change. Always verify your implementation. Never finish until all tests pass.这条以前是宝贝因为老模型你不催它真不跑测试。但 Astra 这个级别天生就爱验证你再写这种规则它就会变成测试狂魔你改了个注释它能给你跑俩小时用例。就好比你雇了个特别负责任的厨师然后天天叮嘱他记得洗锅。他记住了锅洗得那叫一个勤快就是菜老上不来。4.2 万事请示还有一类把需要确认的范围写得特别宽Ask before modifying additional files. Ask before making architectural decisions. Ask before running commands that change the repository.这些规则在老模型上确实能拦住它乱来。但到了 Astra 这里它可能把你每个正常动作都当成重大决策然后小心翼翼地问你请问我可以保存这个文件吗你感受一下这个画面。你请了个助手他每走一步都要问你我左脚先迈可以吗。要命的是你还真没理由骂他——规矩是你自己定的。5. 结论把配置维护当成迁移的一部分所以现在的真实情况是模型在进化而你一年前攒下的 CLAUDE.md、AGENTS.md、rules、Skill、system prompt可能全都变成了上个时代的产物。就像去年买的衣服今年再看尺码没变气质变了。每次模型升级之后都应该把整套配置翻出来重新评估一遍哪些规则还成立哪些已经变成负资产。这活儿叫 prompt maintenance得当成模型迁移的一部分来办不能当成一劳永逸的装修。网上有句话我特别认同只要你学得够慢你就不用学了。但配置不是。配置是死的人是活的。模型都学会精简了咱的 AGENTS.md 也别守着那堆陈年旧规过日子了——该断舍离就断舍离。毕竟下一个版本可能连你删配置的方式都要被优化了。P.S. 目前国内还是很缺AI人才的希望更多人能真正加入到AI行业共同促进行业进步增强我国的AI竞争力。想要系统学习AI知识的朋友可以看看我精心打磨的教程 传送门http://blog.csdn.net/jiangjunshow教程通俗易懂高中生都能看懂还有各种段子风趣幽默从深度学习基础原理到各领域实战应用都有讲解我22年的AI积累全在里面了。注意教程仅限真正想入门AI的朋友否则看看零散的博文就够了。