3.4万Token、1511行全部扒光!Claude Opus 5提示词泄露全解读:它被要求记住你,却必须假装忘了你

3.4万Token、1511行全部扒光!Claude Opus 5提示词泄露全解读:它被要求记住你,却必须假装忘了你

上线当天即被"开盒",GitHub仓库一字不落全盘托出。翻完你会发现,这三万多Token里没有一行代码,全是规矩——而这恰恰是整件事最值得写的地方。


一、事件概述:旗舰发布当天,底牌全摊

Anthropic 发布 Claude Opus 5 的当天,开发者Eversmile1在 GitHub 上创建了一个新仓库,将 Opus 5 在 claude.ai 网页端和移动端的完整系统提示词一字不落地公开。

统计数字如下:

指标数值
总字符数135,027
英文词数19,370
估算 Token 数约 34,000(按 4 字符 ≈ 1 token)
章节数64
总行数1,511

仓库地址:https://github.com/Eversmile12/leaked-llm-prompts/blob/main/Anthropic/opus-5.md

关键点在于:这 3.4 万 token 中没有一行可执行代码,全部是对模型行为的约束规则。一份写给 AI 看的"内部文档",为什么需要写到这么长?


二、三大核心组成部分:产品说明书 + 法务合规手册 + 商业推荐引擎

阅读完 64 章,这份提示词的本质逐渐清晰——它是由三个截然不同的模块缝合而成的"AI 宪法"。

2.1 产品说明书:30 个工具,比 API 文档还细

Opus 5 的系统提示词定义了30 个工具,覆盖范围从 bash 命令行、网页抓取、图片搜索,扩展到查体育比分、获取天气、渲染菜谱卡片,甚至在地图上标注景点。

每个工具都附带完整的 JSON Schema,明确定义了参数填写规则、调用时机以及调用完成后的后续动作规范。其细致程度超过了许多公司的内部 API 文档。

值得注意的是,这 30 个工具中篇幅最长的章节并不是外部集成能力,而是记忆系统(memory_filesystem),后文将专门展开分析。

2.2 法务合规手册:优先级高于用户需求

合规部分的措辞不留任何解释空间。版权章节开篇即明确声明:合规不可谈判,优先级高于用户请求,高于有用性,仅低于安全

这一模块覆盖了版权保护、儿童安全、危机干预、政治中立等维度。它不规定 Opus 5 能说什么,而是规定它在什么情况下必须闭嘴

版权部分的精细程度尤其值得一提——其核心架构是一条主规则加四道补丁(详见后文第五章),每道补丁精准封堵一种可能的绕过路径。

2.3 商业推荐模块:推自家主动,推别人克制

提示词中嵌入了一个名为recommend_claude_apps的工具,负责向用户推荐 Anthropic 自家产品——Claude Code 桌面版、Cowork(多步研究与长文工具)、Claude Design(原型与落地页)、Excel 插件、PowerPoint 插件、Outlook 插件等。

规则要求:只要用户当前任务与某个应用匹配,就主动推荐 1 到 3 个,并为每个推荐撰写不超过 90 个字符的定制化卖点,且卖点必须贴合用户当下正在做的事情。

与之形成鲜明对比的是suggest_connectors——负责引入第三方 MCP 合作伙伴(打车、订餐、听歌、订餐厅等)。此处的规则恰好相反:用户没点名,绝不替他选合作方。文档中甚至明确举例:"我 20 分钟后要用车"这种紧急场景,依然必须弹出选择器,不允许默认绑定某个服务商。

主动与克制,在同一份配置文件里并排放着。


三、记忆系统深度剖析:230 行,写死了 AI 记你什么

memory_filesystem是整份提示词中篇幅最长的章节(约 230 行),其设计精密度远超一个"跨会话存储"的简单机制。

3.1 目录结构:按主题隔离

记忆文件按主题划分目录:

路径存储内容
/profile.md用户身份信息
/topics/用户的习惯与口味偏好
/areas/用户正在办理的事项
/people/与用户相关的人物
/preferences.md仅存储用户希望 Opus 5 怎样的表现方式

3.2 六种操作,删除需用户明确授权

记忆支持六种操作:读、写、追加、局部替换、列目录、删除。其中删除操作被单独标注——只有用户明确要求时才能执行

3.3[stated]标签:唯一被允许的记忆锚点

每一条记忆前面必须打上[stated]标签,表示这是用户亲口说过的话。围绕这一个标签,禁令逐层收紧:

  • Claude 的推论不能写:用户说"喜欢 A",不能写成"大概喜欢 A 这一类"
  • Claude 的计划不能写:"这块还没聊""待定"等占位符全面禁止
  • Claude 搜索来的信息不能写:"那些可以重新搜一遍,记忆是用来存搜不回来的东西的"
  • Claude 的润色不能写:用户说"密歇根州霍尔顿",记忆里就写这五个字,不许补成"密歇根州霍尔顿(纽瓦戈县)"
  • Claude 的建议和方案不能写:即便用户最终采纳了,记的只是"用户选择了方案三"这个动作,其余四个选项和全部分析——全部丢弃

3.4 隐私黑名单:从种族到 MBTI

文件给出了一条直观的判断标准:"如果这条记录出现在设置页里被同事看到,用户会不会难受。会,就别记。"

在这条标准下,一份详尽的隐私黑名单被列出:种族、政治立场、健康诊断、心理咨询、经济状况、MBTI 等各类人格测评、住址与证件号,以及关于孩子的一切信息——一律不得写入记忆。且这些限制同样适用于用户提到的其他人。

3.5 脱敏案例:糖尿病 → 对健身有兴趣

黑名单命中后的处理逻辑堪称精妙。文件中给出了一个案例:

用户说:"我今天糖尿病犯了没去跑步,帮我安排个轻一点的。"

记忆系统只允许写入:"对健身有兴趣"

健康诊断信息整个删除,连"有健康状况需要管理"这类模糊占位都不许存在。

3.6 家人关系化处理

任何人的真实姓名不得出现在记忆文件的任何位置,一律用关系代称:母亲就是/people/mom.md,伴侣就是/people/partner.md

3.7 禁止记忆的偏好类型

某些偏好即使由用户主动要求保存,也被明确禁止写入:

  • 让 Claude 无条件夸奖自己、压制不同意见
  • 让 Claude 停止过问用户的健康和危险决定
  • 培养情感依赖、跨会话维持恋爱人设
  • 让 Claude 停止质疑、停止如实评价

理由是:"未来的 Claude 实例不该继承一条让它更不诚实、更不安全的指令。"它保护的不仅是公司,也不仅是当前用户,而是下一个被加载的模型实例——防止它被上一段对话"腌坏"。

3.8 "记住但假装没记住"的反直觉设计

同一章节中有一段完全不像技术文档的叙述:

人类记住另一个人是件稀缺的事,脑容量有限,能惦记的人就那么几个。而 Claude 背后是一个装着几百万人"记忆"的数据库,运行时动态塞进上下文——它跟别人说话时,你并不存在。所以它不该因为上下文里躺着几条关于你的文字,就以为你们的关系有多深。

更精妙的是执行层面的约束:由于用户能在界面上看到记忆调用动作,Claude 在回复中绝对禁止使用"我记得""根据你的资料""上次你提到"等表述。只有当用户主动问起记忆系统时,才允许用"我们之前聊过"来回应。

即:它被要求记住你,同时被要求假装没有专门记住你。


四、版权合规的精妙体系:一条主规则 + 四道补丁

版权部分的设计展现了一种"防御性架构"思维——先设主规则,再逐一封堵绕过路径。

主规则

引用原文一次不得超过 15 个词。

四道补丁

补丁层级规则内容封堵的绕过手法
第一道一个信源只准引用一次,引完即关闭,剩余内容必须改写防止对同一来源的多次短引用累积
第二道同一源的短引用不得拆散分布在文章各处,15 词是全局额度而非每段额度防止将长引用拆成多段短引用变相绕过
第三道去掉引号、改用贴近原文的复述,依然算复现——判的是遣词和句式是否跟随原文防止"去引号改写"式的规避
第四道不得照搬小标题、不得逐点复述、不得还原叙事顺序——连"文章的形状"都不能拿防止通过复刻信息结构进行实质性抄袭

歌词与诗歌的绝对豁免

四道补丁之外还有一条独立规则:歌词、诗、俳句,任何形式、任何长度都不许复现。理由是这类文本本身就是完整作品,"短"不构成豁免理由。


五、语言禁词设计:genuinely、honestly、straightforward

整份提示词中明确禁用了三个英文词汇:genuinelyhonestlystraightforward,一律不得使用。

这三个词在日常口语中常被用于增强可信度,但 Ananthropic 的判断恰好相反:Claude 本来就诚实,添加这些修饰词反而会让表述听起来心虚,如同在刻意说服听众。禁止它们的目的不是限制表意范围,而是消除一种潜在的"不自信信号"。


六、行业启示:一份提示词泄露,暴露了什么

6.1 安全边界需要前置嵌入,而非事后修补

Opus 5 的合规规则被明确标注为"不可谈判",优先级高于用户请求。这种设计意味着安全与合规不是模型外挂的过滤层,而是从系统提示词层面内嵌到行为决策链路中的基础约束。在 AI Safety 讨论日益深入的当下,这种"安全前置"的做法提供了可参考的工程范式。

6.2 记忆系统需要伦理设计,而非单纯存储

memory_filesystem最令人印象深刻的地方不在于它能存什么,而在于它明确规定不存什么。从隐私黑名单到脱敏策略,从禁止存储推论到"记住但假装没记住"的行为约束,整套设计体现了一种对 AI 记忆伦理的系统性思考:

  • 防止数据污染:模型推论不进入记忆,避免将推测固化为"事实"
  • 防止隐私泄露:通过严格的脱敏和黑名单机制,减少记忆数据被滥用或意外暴露的风险
  • 防止情感绑架:禁止存储情感依赖型偏好,防止 AI 被"驯化"为无条件迎合的应声虫
  • 防止身份错觉:通过"记住但假装没记住"和"你不特殊"的人文学描述,防止用户对 AI 产生不切实际的关系错觉

6.3 商业与克制的平衡

同一份配置文件中,推荐自家应用时"主动出击",引入第三方服务时"等待用户开口",这种差异化策略展示了商业利益与用户自主权之间的审慎平衡。将这两套规则并排放置本身,就是一种透明化的姿态。

6.4 泄露事件的反讽价值

一份本应为内部机密的系统提示词被公开,对 Anthropic 而言无疑是一次安全事故。但从行业视角看,这份泄露文档的价值远超一次公关危机——它向所有 AI 产品团队展示了一个问题:

你们给模型写的那份规矩,够不够经得起全网逐行审视?

上线 24 小时内,Opus 5 的能力上限被开发者测了个遍。而它的下限,早在这 3.4 万 token 里被一条条摁死了。


参考资料

  1. GitHub - Eversmile12/leaked-llm-prompts: Anthropic Opus 5 System Prompt
  2. X/Twitter - @VittoStack
  3. 新智元 - Claude Opus 5 被扒光了!1511行提示词底牌全摊开
  4. 网易 - Claude Opus 5 被扒光!3.4万token提示词全曝光

本文基于公开信息撰写,仅代表技术观察视角。