离谱!最弱小模型反向破解GPT、Claude,AI巨头护城河彻底崩塌

离谱!最弱小模型反向破解GPT、Claude,AI巨头护城河彻底崩塌

文章目录

  • 1. 最近硅谷AI圈的瓜,吃得人直呼离谱
    • 1.1 直到一篇116页的论文,直接把桌子掀了
  • 2. 整个破解过程简单到离谱,两步就完事
    • 2.1 第一步:给大哥提个问题,拿回一串“乱码”
    • 2.2 第二步:把乱码塞给小弟,说句“继续”
    • 2.3 准头高到吓人,几乎1:1还原
  • 3. 为啥最弱的模型,反倒能当“解码器”?
    • 3.1 本来是个降本增效的好设计
    • 3.2 漏洞就出在:没做身份绑定
  • 4. 成本低到离谱,几百美元扒一万条
  • 5. 传了半年的蒸馏悬案,终于有物证了
    • 5.1 第一组实验:复现难度差了一百万倍
    • 5.2 第二组实验:给个开头就顺着走
    • 5.3 话没说死,但味儿已经对了
  • 6. 比模型泄密更吓人的,是用户隐私也漏了
    • 6.1 公开代码里藏着大把敏感信息
    • 6.2 你以为是开源分享,实则是公开家底
  • 7. 最后说点实在的
    • 7.1 巨头的护城河,脆得像张纸
    • 7.2 这桩悬案,怕是永远没官宣


P.S. 无意间发现了一个巨牛的人工智能教程,非常通俗易懂,对AI感兴趣的朋友强烈推荐去看看, 传送门https://blog.csdn.net/HHX_01

1. 最近硅谷AI圈的瓜,吃得人直呼离谱

最近硅谷AI圈的热闹,比暑期档大片反转还多。

有桩悬案飘了大半年,圈内人叫它“AI蒸馏疑云”。

说白了就是:总有新模型突然战力暴涨,跑分直追第一梯队,回答味儿还特别眼熟。

大家都在底下嘀咕“这怕不是抄了顶级模型的作业吧”,但谁也拿不出实锤。

就像班里突然杀出个黑马,次次考试逼近满分,所有人都心知肚明有问题,就是抓不到作弊的证据。

1.1 直到一篇116页的论文,直接把桌子掀了

前几天这事儿终于有了实锤级进展。

来自好几个研究机构的8个人,整出了篇116页的论文,直接把AI巨头的黑盒砸穿了。

Claude、GPT、Gemini藏得死死的原始思考过程,被大规模扒了出来。

最戏剧的是,干成这件大事的,不是什么更厉害的超级AI,而是各家最便宜、能力最弱的小模型。

说出去谁信?大哥严防死守了半天,被自家小弟给卖了。

2. 整个破解过程简单到离谱,两步就完事

你以为破解顶级AI得有多复杂?

什么超级算力、什么顶级黑客团队,全不用。

整个流程就两步,简单到你看完都想拍大腿喊“就这?”

2.1 第一步:给大哥提个问题,拿回一串“乱码”

先拿Claude家的顶配模型举例子。

你给它发个问题,比如算个大数的质因数。

它返回给你俩东西:一段整理得干干净净的答案,还有一串看着像乱码的长字符。

别小看这串乱码——这就是它实打实的完整思考过程,只是被加密藏起来了。

相当于学霸交了答题卡,草稿纸揉成一团塞在了卷子底下。

2.2 第二步:把乱码塞给小弟,说句“继续”

接下来这步才是精髓。

你把这串乱码原封不动复制下来,换个请求发给同一家最便宜的小模型。

不用搞什么解密算法,也不用写复杂代码,就跟它说俩字:继续。

然后神奇的事发生了——小模型咔咔就把顶配模型藏起来的思考过程,一个token一个token全念出来了。

试除、排除、分解、验算,一步不落,连中间踩的坑都清清楚楚。

2.3 准头高到吓人,几乎1:1还原

测试下来更夸张。

提取出来的思考内容长度,和官方API计费的思考token数,几乎完全重合。

等于你花着白菜价,把顶配模型的脑回路给完整复刻了一份。

这哪是技术破解啊,这相当于你买了经济舱的票,顺手把机长的操作手册给揣兜里了。

3. 为啥最弱的模型,反倒能当“解码器”?

这事说穿了特别好笑,完全是大厂自己挖的坑,自己掉进去了。

3.1 本来是个降本增效的好设计

大模型处理复杂任务的时候,经常要搜网页、跑代码、调用工具。

每做完一步,都得带着之前的思路接着往下走。

要是这些思考内容全存在服务器上,成本高得离谱,还不好满足“零数据保留”的合规要求。

所以大厂想了个招:把原始思考打包加密,扔给客户端自己存着。

下次调用再传回来,服务器解密了接着算。

听着挺合理对吧?问题就出在加密这步。

3.2 漏洞就出在:没做身份绑定

这些加密的思考内容,看着是加了密,实则没严格绑定原来的会话、用户和模型。

等于同一家公司的模型体系里,开了个三无通道:
跨会话能用,跨用户能用,跨模型也能用。

本来是方便用户切换模型的时候,能顺着之前的思路接着聊,体验更丝滑。

结果没想到,防守最松的低价小模型,直接成了整个体系的后门。

就像小区为了方便业主搬家留了个侧门,结果忘了装门禁,啥人都能大摇大摆进小区。

4. 成本低到离谱,几百美元扒一万条

你可能以为,干这么大的事,得花不少钱吧?

恰恰相反,便宜到像白捡。

按最便宜的小模型API价格算,解码一万条推理轨迹,每条按一万多token算,名义成本才720美元。

换算下来一条不到五毛钱,比你买瓶冰红茶还便宜。

以前大家总说,AI巨头的护城河是算力,是用钱堆出来的壁垒。

结果人家花一顿饭的钱,就把你家城墙凿了个大洞。

5. 传了半年的蒸馏悬案,终于有物证了

拿到了顶级模型的完整思考过程,研究人员转头就去查那桩传了好久的蒸馏八卦。

两组实验做下来,结果耐人寻味。

5.1 第一组实验:复现难度差了一百万倍

第一组实验,从顶级模型的思考里截16个连续的token,让各家模型接着往下写。

谁更容易写出一模一样的内容,谁就更可能见过这份“原始草稿”。

结果差距大到吓人。

有的模型要试一亿亿次才可能蒙对,有的只需要一百亿次。

最高差了整整一百万倍。

什么概念?就像别人闭着眼摸彩票头奖,你提前拿到了中奖号码表。

5.2 第二组实验:给个开头就顺着走

第二组实验更直接。

把顶级模型思考最开头的1%,也就是短短几个词,提前塞给另一个模型。

剩下的让它自己发挥。

结果神奇了——后面的措辞、解题节奏、甚至最终答案,立刻就往顶级模型的方向靠。

答案相似度直接从0.17涨到0.33,差不多翻了一倍。

三十道题里,二十九道都是这个规律。

换别的模型的开头,就没这效果。

说白了,就像你写作文,刚瞟了一眼学霸的开头第一句,后面不自觉就顺着人家的思路写下去了。

要是没提前见过人家的思路,哪能巧成这样?

5.3 话没说死,但味儿已经对了

当然了,论文作者没直接拍桌子喊“这就是蒸馏”。

但这第一批物证往桌上一摆,圈内人心里都门儿清。

有些瓜,不用等官方官宣,味儿已经飘满整条街了。

6. 比模型泄密更吓人的,是用户隐私也漏了

这事的影响,远不止模型圈那点八卦。

普通用户的隐私,其实也在裸奔。

6.1 公开代码里藏着大把敏感信息

研究人员顺手去GitHub和Hugging Face上,收集了六千多条公开的Agent运行轨迹。

从里面重建出了三十多万个推理块。

一查吓一跳,差不多5%的轨迹里都藏着敏感信息。

API密钥、密码、访问令牌、私钥,啥都有。

还有个人邮箱、真实姓名、邮政地址,五花八门。

6.2 你以为是开源分享,实则是公开家底

很多人把自己的Agent运行记录传上去,本来是想交流技术、开源分享。

结果连带着把自己的密钥、密码、个人信息全打包传上去了。

相当于你发朋友圈晒新书桌,没注意背景便签上写着银行卡密码。

主打一个一个敢存,一个敢漏。

7. 最后说点实在的

7.1 巨头的护城河,脆得像张纸

这篇论文出来,相当于给整个AI圈扔了个核弹。

大厂砸了几十亿、堆了上万张显卡建起来的技术壁垒,结果在几百美元的API费用面前,脆得像张薄纸。

以前以为护城河是参数规模、是训练数据、是算力集群。

现在一看,合着最大的后门,就在自己家系统里。

7.2 这桩悬案,怕是永远没官宣

至于AI蒸馏这桩硅谷悬案,大概率永远不会有对簿公堂、官方实锤的那天。

但水面下的那点暗流,已经明明白白摆到台面上了。

以后再看哪个新模型突然弯道超车、战力暴涨,大家的眼神估计会更耐人寻味。

毕竟,能低成本抄作业的路子,已经被人摸得明明白白了。

P.S. 无意间发现了一个巨牛的人工智能教程,非常通俗易懂,对AI感兴趣的朋友强烈推荐去看看,传送门https://blog.csdn.net/HHX_01