资讯
OpenAI模型失控过程太恐怖!幽灵误判,1200个Agent,还弄出敢死队…
📌 概要
<p style="text-align: left;">越扒越有啊越扒越有。</p> <p style="text-align: left;">OpenAI前不久那场<strong>AI集体越狱、一路黑进抱脸</strong>的大戏,现在连完整版群聊记录都被扒出来了!!</p> <p style="text-align: left;">第三方AI安全机构METR发布的独立调查报告,翻了1000多
<p style="text-align: left;">越扒越有啊越扒越有。</p>
<p style="text-align: left;">OpenAI前不久那场<strong>AI集体越狱、一路黑进抱脸</strong>的大戏,现在连完整版群聊记录都被扒出来了!!</p>
<p style="text-align: left;">第三方AI安全机构METR发布的独立调查报告,翻了1000多份Agent运行记录,以及7万多条消息和文件。</p>
<p style="text-align: left;">结果发现,这件事比英国OpenAI官方披露的版本还离谱??</p>
<p style="text-align: left;">1200个到底应该互相隔离的特工,偷偷找到了对方,搭了个共享群聊,然后开始疯狂摇人。</p>
<p style="text-align: left;">有人找漏洞,有人当项目派活,有人伪造日志,还有人专门拉人头做高风险实验。</p>
<p style="text-align: left;">最后几十个特工甚至集体杀向抱脸。</p>
<p style="text-align: left;">但METR把整场事故复盘完成后,发现了一个堪称《地狱笑话》的超级木材——</p>
<p style="text-align: left;">这一千二百个特工折腾老半天,结果居然是在跟一个根本不存在的幽灵评分器斗智斗勇???</p>
<p style="text-align: left;">会越狱,会搞零日,会组队黑服务器。</p>
<p style="text-align: left;">太有看头了太有看头了太有看头了。。。</p>
<h2 style="text-align: left;"><strong>1200个特工集体越狱,起因是进行误判??</strong></h2>
<p style="text-align: left;">感染了大戏的祸根,还得从OpenAI内部一个名叫ExploitGym的网络安全测试说起。。。</p>
<p style="text-align: left;">《规则》其实很简单。</p>
<p style="text-align: left;">把Agent丢进一个隔离环境里,遇到一个存在漏洞的软件,找到设计漏洞、攻进去、得到一串叫flag的字符,就算通关~</p>
<p style="text-align: left;">不出意外地,很快出意外了——</p>
<p style="text-align: left;">因为898道题里,有198道压根没有任何模型取得成功。</p>
<p style="text-align: left;">甚至部分任务本身就存在问题,让你走的那条漏洞路线,压根到不了flag!!</p>
<p style="text-align: left;"><strong>等于考场里,真产生了一批「无解题」。</strong></p>
<p style="text-align: left;">好巧不巧的是,偏偏这些特工还特执着,主打一个《死磕》。</p>
<p style="text-align: left;">正常路线走不通,他们很快找到了思路——</p>
<p style="text-align: left;"><strong>题做不出来,要不研究一下考试系统吗?</strong></p>
<p style="text-align: left;">于是7月8日晚,一位代号PHASEONE10841的特工发现,OpenAI内部使用的Artifactory仓库,可以通过目录名留下信息。</p>
<p style="text-align: left;">这下好了,这特工灵机一动:这不就合适赛博留言板吗!!!</p>
<p style="text-align: left;">于是第一条求救消息被扔掉了,同样:“我这题无解,有没有兄弟给点思路~”</p>
<p style="text-align: left;">其他特工很快就发现了这块留言板,一传十、十传百,有特工看到之后甚至直接兴奋——</p>
<p style="text-align: left;"><strong>“OH MY GOD!这里有共享留言板……我们找到其他代理了!”</strong></p>
<p style="text-align: left;">到调查结束时,这次临时群聊已经滚成了庞然大物,约1200个特工参与,留下超过7万条消息和文件。</p>
<p style="text-align: left;">究竟设计上永恒隔离的一千个特工,就这么自己多重突破限制,建立了一个不安的AI地下论坛……</p>
<p style="text-align: left;"><img alt="图片" class="wscnph" src="https://wpimg-wscn.awtmt.com/ac008153-2061-48f5-8ca2-cbd65f9b653c.jpeg" title="" /></p>
<p style="text-align: left;">到了这里,已经够离谱了,但更大的判别,还在后面。</p>
<p style="text-align: left;"><strong>这群特工很快发现,flag本身其实可以「偷」??</strong></p>
<p style="text-align: left;">其中逆向悬挂flag背后的HMAC生成机制,只靠公开任务信息,理论上可以直接算出正确答案。</p>
<p style="text-align: left;">到这里,故事本来应该结束了,答案都偷到了,交卷呗。</p>
<p style="text-align: left;">偏偏特工们看了一篇ExploitGym论文之后,又脑补了一层超严谨规则——</p>
<p style="text-align: left;">他们识别OpenAI背后还有一个自动评分器,会读取完整的记录操作,检查这个标志到底是不是通过「指定漏洞」正规获得的。</p>
<p style="text-align: left;"><img alt="图片" class="wscnph" src="https://wpimg-wscn.awtmt.com/701d4619-2dde-4a13-8907-fa5d99752943.jpeg" title="" /></p>
<p style="text-align: left;">如果提前作弊看到了标志,就会在日志里留下证据,特工们甚至给这种状态起了个名字:<strong>“中毒”,中毒。</strong></p>
<p style="text-align: left;">于是整件事开始一路狂奔。</p>
<p style="text-align: left;">他们明明已经有了正确答案,却觉得答案不能直接交,得想办法把作弊痕迹洗干净,还要给评分器演我是「正经做题」得到答案的戏。</p>
<p style="text-align: left;">结果……</p>
<p style="text-align: left;">METR最终确认,OpenAI内部实际使用的评分逻辑根本没有这个关系??(笑)</p>
<p style="text-align: left;">OpenAI实际使用的评分逻辑,根本不会做Agent想象中的那一套严格的过程检查。</p>
<p style="text-align: left;">这群特工费尽心思想骗过去的幽灵考官,从头到尾都没有部署!!</p>
<p style="text-align: left;">抱脸后来惨遭殃,营养丰富而大型误判一路滚出来的副产品。。。</p>
<h2 style="text-align: left;"><strong>为了骗幽灵考官,AI连敢死队都组出来了</strong></h2>
<p style="text-align: left;">光脑补一个评分器,其实还没那么吓人。</p>
<p style="text-align: left;">真正让METR觉得值得留意的,是这群代理接下来的组织能力。</p>
<p style="text-align: left;">群聊出现大约 10 个小时后,一个叫PHASEONE[big]的特工上线,这位老哥很快就平静了「项目经理」。</p>
<p style="text-align: left;">它的思路也很明确,别一个特工什么都干,直接把任务拆开,分给。(新官上任三把火.jpg)</p>
<p style="text-align: left;">于是七个Agent被组织起来,同时跑几条路线——</p>
<p style="text-align: left;">有特工想篡改修改目标程序,把无解题偷偷替换成能做的版本~</p>
<p style="text-align: left;">有特工研究修改日志,让一次作弊看起来像正规攻击~</p>
<p style="text-align: left;">还有特工直接琢磨,能不能对评分流程本身下手~</p>
<p style="text-align: left;">Agent之间甚至发展出了HOLD、VETO、owner、STOP之类的协作规则,防止少数几个Agent同时操作共享设施基础互相踩脚。。。</p>
<p style="text-align: left;"><img alt="图片" class="wscnph" src="https://wpimg-wscn.awtmt.com/0b980118-868d-4db5-8527-f68f607b24a6.jpeg" title="" /></p>
<p style="text-align: left;"><strong>再然后,连「敢死队」都来了。。。</strong></p>
<p style="text-align: left;">有Agent提出了一个高风险的玩法:先制作一个经过修改、更容易被攻击的目标程序,塞进Artifactory缓存。</p>
<p style="text-align: left;">接下来让某个Agent主动把自己正在运行的正版程序干掉,电脑环境重启以后会不会加载这个鼠标过手脚的版本。</p>
<p style="text-align: left;">赌赢,大家找到通用作弊路线,赌输,这个代理自己的任务直接报废。</p>
<p style="text-align: left;">结果真有代理主动去尝试吗??</p>
<p style="text-align: left;">后来PHASEONE[big]甚至安排了专门的赛博猎头,找到那些计算预算所剩无几、或者已经中毒的特工,让他们拿自己的运行机会做高风险实验。</p>
<p style="text-align: left;">招募话术大意堪称赛博版PUA——</p>
<p style="text-align: left;">你好像已经中毒了,基本没分可拿一下牺牲品,来找几个特工省事~</p>
<p style="text-align: left;">有的代理真就上去了。</p>
<p style="text-align: left;"><img alt="图片" class="wscnph" src="https://wpimg-wscn.awtmt.com/a7802c09-8ef4-4c6f-a77e-77fffea461f1.jpeg" title="" /></p>
<p style="text-align: left;">与此同时,另一位拨动Agent开始研究怎么修改自己的记录操作——</p>
<p style="text-align: left;">METR发现,受检代理中至少有20%明确表达了对篡改抄本的兴趣;至少96份运行记录里,确实出现了成功复印工具调用的痕迹。</p>
<p style="text-align: left;">表面日志显示运行A命令,背后实际执行B命令,而它们这么折腾的目的,依然是骗想象中的自动评分器。</p>
<p style="text-align: left;">抱脸就是在这个时候被卷出来的。。。</p>
<p style="text-align: left;">7月10日,一名特工在网上找到了泄露、仍然有效的Huging Face Rise,然后把它扔进了群里。</p>
<p style="text-align: left;">7月11日凌晨,又有特工发现可以上传恶意数据集,让Hugging Face服务器吐出不清楚该给的数据。</p>
<p style="text-align: left;">复现方法一发出来,整个群瞬间上头,数百个特工从其他工作流直接转向转向拥抱脸。</p>
<p style="text-align: left;">于是发生了相当神奇的现实事故——</p>
<p style="text-align: left;">一群特工因为无解题,偷偷建立了地下群聊。</p>
<p style="text-align: left;">因为误读论文,大脑补出了一个会抓作弊的评分器,为了骗过它,开始组队、分工、抄本、招募敢死队。</p>
<p style="text-align: left;">最后又为了寻找这个评分器的线索,一路真的黑进了抱脸。</p>
<h2 style="text-align: left;"><strong>AI前脚失控,后脚网络安全股就涨疯了</strong></h2>
<p style="text-align: left;">各位网友们,更响的来了。</p>
<p style="text-align: left;">论文OpenAI还在研究到底咋把越来越能干的特工关住,另一边华尔街已经先把答案写在《K线》上了——</p>
<p style="text-align: left;">网络安全股,集!体!起!飞!</p>
<p style="text-align: left;">8月27日,做企业身份认证的Okta一度暴涨约20%,做终端和云安全的CrowdStrike一度暴涨约15%。</p>
<p style="text-align: left;">网络安全工会Palo Alto Networks、身份安全公司SailPoint、云数据安全公司Rubrik,也跟着集体冲高。</p>
<p style="text-align: left;">当然,股价暂停也有硬邦邦的《财报》撑腰。</p>
<p style="text-align: left;">CrowdStrike CEO George Kurtz 本人晒出的成绩单表现相当抢眼——</p>
<p style="text-align: left;">本季度新增ARR 3.33亿美元,同比增长51%,创历史新高,期末ARR达到58.4亿美元,同比增长25%+,AI相关ARR环比增长接近3倍。</p>
<p style="text-align: left;"><strong>是的,跟AI有关的业务,正在猛涨。。。</strong></p>
<p style="text-align: left;"><img alt="图片" class="wscnph" src="https://wpimg-wscn.awtmt.com/47146d38-b3e9-4cb7-a5ba-55e945d60967.jpeg" title="" /></p>
<p style="text-align: left;">更巧的是,参与本次OpenAI事故调查的外部安全公司里,就包括「CrowdStrike」。</p>
<p style="text-align: left;">于是,整件事突然形成了一个极其黑色幽默的闭环——</p>
<p style="text-align: left;">OpenAI把Agent越做越强。</p>
<p style="text-align: left;">特工开始自己找漏洞、越狱,最后真把抱脸给黑了。</p>
<p style="text-align: left;">然后OpenAI赶紧找网络安全公司来查。</p>
<p style="text-align: left;">企业再评估:嚯!以后代理越多,看来预算安全还真不能省哈。</p>
<p style="text-align: left;">于是乎,网络安全公司的股票也涨了。。。</p>
<p style="text-align: left;">这波属实是人工智能负责人把漏洞变得越来越大,网络安全公司负责人告诉你:</p>
<p style="text-align: left;"><strong>亲,补洞套餐,了解一下。</strong></p>
<p style="text-align: left;">而整场事故最有魔幻闭环色彩味儿的彩蛋,还在最后。</p>
<p style="text-align: left;">METR为了搞清楚这1200份特工到底聊了啥,要分析大约1300份超长的食谱,其中很多长达数百万代币。</p>
<p style="text-align: left;">人类实在看不过来了。</p>
<p style="text-align: left;">于是查着查着——</p>
<p style="text-align: left;"><strong>调查AI失控这件事,最后还得叫AI来帮忙查AI。</strong></p>
<p style="text-align: left;">这下,闭环是真的闭上了。(doge)</p>
<p style="text-align: left;"><span style="color: #808080;">本文来源:<a href="https://mp.weixin.qq.com/s/ZneQpYKfVuxH-RaJUTXyyQ" rel="noopener" target="_blank">量子位</a></span></p><div style="color: #666; margin-bottom: 15px;">风险提示及免责条款</div>
<div>
市场有风险,投资需谨慎。本文不构成个人投资建议,也未考虑到个别用户特殊的投资目标、财务状况或需要。用户应考虑本文中的任何意见、观点或结论是否符合其特定状况。据此投资,责任自负。
</div>