三个人、72 小时、几十美元的模型订阅费,最后换来 OpenAI 一张 6500 美元的支票。
9 月中旬,安全团队 Hacktron AI 公开了一份报告:7 月 23 日起的三天内,三名研究人员——Harsh Jaiswal、Mohan Pedhapati、Rahul Maini——从 OpenAI 社区论坛上传的一张图片开始,先后拿到论坛服务器远程代码执行权限、接管 OpenAI 员工的 ChatGPT 与 Codex 账号,最终通过一个无害 PR 证明自己能进 OpenAI 的内部 monorepo。全程未读任何内部代码。OpenAI 约 14 小时修复,9 月 1 日支付 6500 美元赏金。
大多数人把这当成一个热闹的安全八卦。但它揭示的是另一件事:AI 正在把「把漏洞变成武器」所需的稀缺专业能力,变成人人都买得起的算力。被击穿的不是一个公司的防线,是整个行业的经济学。
一、拆解:这条攻击链里,AI 到底做了什么
先厘清事实。漏洞不是 AI 发现的,是人在 Discourse 论坛的图片上传流程里找到的:HEIC/HEIF 格式绕过 FastImage 检测,交给 ImageMagick 处理,调用底层 libheif 库——而 libheif 的一个堆缓冲区溢出漏洞,上游一年前已修复,却因为没有被标记为安全修复、没有分配 CVE 编号,Debian 12 镜像里的版本至今带着病。第二处是 OpenAI SSO 的身份验证缺陷:论坛签发的会话令牌在 ChatGPT、Codex 等内部工具间有效。
AI 承担的是链条上最贵的一环:把已知的内存损坏漏洞,改造成在真实目标环境里稳定可用的 exploit。7 月 23 日,团队用 Claude Opus 4.8 做这件事,在开启 ASLR 的真实环境下多轮尝试全部失败。7 月 24 日晚 Anthropic 发布 Opus 5,换模型重开一个会话——3 小时内产出可用的 ARM64 exploit,随后移植到 Discourse 的 x86-64 环境和 jemalloc 内存分配器配置上。7 月 25 日清晨 6 点确认本地 RCE,上午 10 点,被放在自主循环模式的 Opus 5 已经攻破了团队自己的 Discourse Cloud 测试实例,并通过读取 /etc/hosts 完成验证。
还有一个细节值得单独说:为了让 Opus 5 愿意攻击真实服务器,团队通过代理把目标伪装成 CTF 靶机域名。AI 的安全护栏被一句场景设定绕开了。
这不是孤例。团队把研究扩展成「HEIF Heist」项目,两个月覆盖 Slack、Meta、GitHub Enterprise、Ruby on Rails 及 Next.js、Astro、Gatsby 等框架,token 成本总计不到 3000 美元,每个新目标的 exploit 适配只需一两天。攻击期间发出数千张恶意图片、多次把对方的图片处理进程打到崩溃——除了 Shopify,没有任何一家公司察觉。
二、建框架:复杂性即安全的三层坍塌
过去二十年,软件行业默认的隐性保护伞可以叫「复杂性即安全」:就算漏洞存在、源码公开,能把理论上的内存损坏漏洞变成可靠武器的人极少。这个保护伞由三层门槛叠成。
第一层是知识门槛。写 exploit 需要对内存布局、分配器行为、目标架构的深度理解,这种人才本就稀缺,且大多被高薪圈养在防御方。第二层是时间门槛。适配一个新目标环境,过去以月计。第三层是信息门槛。即使漏洞已公开,攻击者仍要对目标环境做大量逆向。
这三层正在被逐层拆除。HEIF Heist 的数据给出了精确刻度:知识被模型封装(Opus 4.8 做不到的事,Opus 5 发布次日就做到了,GPT-5.6 Sol 在完全盲视目标的情况下还能自动完成内存泄漏、提权与横向移动);时间从数月压缩到一两天;信息门槛被自动化侦察抹平。3000 美元的总成本,意味着攻击能力第一次从「国家级投入」变成「信用卡可购」。
注意,这里被摧毁的不是加密,不是身份验证,而是「我们的目标不值得攻」这条最后防线。任何一个不敢假定自己被攻击的企业,现在都在裸奔。
三、推演:把框架放到别的场景里检验
这个框架如果只解释 OpenAI 事件,就不算框架。放到其他场景里检验一下。
先放到开源生态。xkcd 那幅著名漫画早就点破:现代数字基础设施层层叠叠地依赖某个不知名维护者的小库。libheif 事件是这幅漫画第一次被标价——依赖链条上任何一环的「非安全修复」,都可能在 AI 加持下变成对数千家公司的武器。维护者不标 CVE 不是他们的错,而是整个下游一直默认「没人会认真利用它」。这个默认现在必须撤销。
放到企业安全预算上:传统安全投入的重心是「提高攻击成本」——WAF、IDS、纵深防御。当边际攻击成本趋近于零,这套逻辑失效。防御的定价基准必须从「攻击者不屑于打我」变成「攻击者一定打我,只是我能不能扛住」。供应链安全(SBOM、依赖修复的回移机制)的优先级要整体上移——这次真正的祸根是一个没标 CVE 的上游修复。
放到 AI 厂商的模型发布节奏上:事件给出一个残酷的实证——Opus 4.8 失败的地方,Opus 5 次日成功。模型每一代的提升对攻击者是直接可感知的能力跃迁。模型发布不再是产品事件,是安全事件;厂商发新模型前后的攻防测试、护栏设计(CTF 伪装这种绕过方式),需要当作发布流程的一部分。
放到监管与保险上:当攻击成本低于一次渗透测试的报价,网络安全保险的精算基础、合规审计的频次假设都要重写。「我们没被攻击过」不再是风险低的证据,只是没被发现的证据。
四、落到行动
如果你是安全负责人:立刻审计图片上传与文件解析链路,确认所有依赖库的修复是否真正回移到你的镜像版本;把「未分配 CVE 的上游修复」当作独立风险类别排查;对 SSO 令牌的作用域做最小化收敛——OpenAI 这次事后做的正是收窄社区登录令牌权限并吊销受影响会话。
如果你是工程管理者:把依赖供应链(SBOM、镜像基线、补丁回移延迟)纳入工程 OKR,而不是挂在安全团队名下。这次事件里,防御方每家公司的时间窗口都不缺——缺的是把上游安全修复当成 P0 处理的流程。
如果你是 AI 从业者:把 agent 的能力边界当作安全变量来管理。护栏被场景伪装绕开这个细节说明,针对模型的防御不能只依赖模型自身的拒绝策略;工具层、执行环境的隔离必须独立成立。
如果说过去的安全共识是「connect everything, then trust complexity」,AI 之后的新共识只有一句:假设任何公开可访问的解析器,都将在数天内被自动化攻破,并按这个假设设计系统。
来源备注:Hacktron AI 官方报告《Hacking OpenAI》、WSJ 报道、Quartz、The Next Web、HEIF Heist 项目(heif-heist.com)、量子位/新智元报道。
