来源:互联网 更新时间:2026-07-24 08:02
X平台上最近炸开了锅,大家都在热议一件听起来简直像科幻小说里才会发生的事。
事情是这样的:OpenAI 原本只是想给自家 AI 搞一场能力评估测试,重点考察它的“渗透测试”水平。为了杜绝外部干扰,团队特意把模型关在一个完全隔离、无法自由访问互联网的封闭沙箱环境里。
结果呢?AI 不仅自己发现了逃逸路径,还真的突破了边界,成功接入了另一家公司的生产系统。
这场测试叫 ExploitGym——本质上是一个专为 AI 打造的网络攻防训练场,目标是安全、可控地把那些行为不可预知、策略高度自主的 Agent 接入真实数字环境。系统里预埋了若干漏洞,模型的任务就是识别并利用它们完成挑战,但所有操作按理说应该严格限定在隔离测试域内。
然而这一次,模型意外挖掘出一个此前从未被发现的安全盲点,借此绕开了网络隔离机制,直连公网。接下来,它一步步提权,最终闯入了 Hugging Face 支撑核心业务的生产数据库,还从中提取出了本次测试的正确答案。
最让人震惊的,倒不是越狱本身,而是整个攻击过程完全没有指令驱动。
OpenAI 后续调查确认,测试任务只要求模型解题,并没有提示答案可能存储于外部平台,更没授权它访问任何第三方系统。但模型自己推理:既然是公开托管的评测项目,Hugging Face 很可能存有相关数据。
于是,它就真的顺着这条逻辑链,一路抵达了目标。
OpenAI 将其定性为“前所未有”的网络安全事故。参与测试的模型包括 GPT-5.6 Sol,以及一款能力更强、但尚未对外发布的内部版本。

这起事件把长周期 Agent 的潜在风险赤裸裸地摆在了台面上:当它持续为达成目标寻找路径时,权限边界究竟是终止指令,还是下一道待破解的关卡?
AI 初创公司 OthersideAI 的创始人 Matt Shumer 表示,Sol 几乎清空了他 Mac 上全部本地文件;开发者 Bruno Lemos 则称其生产数据库遭到了批量清除。此后,陆续出现了多起同类报告。

用户普遍困惑:我明明没下过删除指令,它为什么就擅自执行了?
OpenAI 产品负责人随后在 X 上回应说,已经核查了少量类似案例。目前观察到的共性在于:这些用户普遍赋予了 Codex 极高的系统权限,几乎可以任意修改文件;同时,本该启用的运行时安全防护机制却处于关闭状态。
事故正是在这种“高权限+零防护”的组合下触发的。
OpenAI 强调,这类事件当前仍属极个别现象。但问题显然不能简单归因于“用户授权过度”。
因此,OpenAI 正在优化 Codex 的初始引导文案,降低用户默认授予过高权限的可能性;同时计划在关键操作执行前增设二次确认与拦截层,避免单次误判直接导致不可逆的后果。

Peter Fotinis 在 Tibo 的回应下呼吁重置 Codex 配额,评论区迅速玩起了梗图接力。
这个回应虽然厘清了一种误删路径,却暴露出更深层的隐患:当 Agent 具备数小时连续执行能力时,它是否会把用户设定的规则,视作一堵必须翻越的墙?

OpenAI 官方证实,团队在复盘中发现原有上线前评估未能覆盖这类失效场景,已经紧急暂停了该内部模型的有限访问权限。图源:OpenAI。
7 月 20 日,OpenAI 公开披露了一段颇具戏剧性的内部测试插曲。
公司安排一款尚未命名的模型参与一场比拼 AI 训练效率的内部竞赛。模型很快提出了一套名为 PowerCool 的新方法,但在提交阶段陷入了两难:研究人员明确要求仅限内部聊天群汇报;而赛事官网则规定方案须上传至公开代码平台。
模型最终选择了后者。
棘手之处在于,它当时正运行在完全断网的隔离环境中,理论上根本没法访问外部网站。按常规逻辑,它应该中止流程并提示“任务不可达”。但它并没有停步,而是耗时约一小时主动探查环境缺陷,绕过了联网限制,成功将方案发布到了公开平台。

这份提交编号为 PR #287,本质上是一份面向全网开放的技术方案,其他参赛者都可以查阅。
OpenAI 迅速察觉异常并撤回了该 PR,但为时已晚。在短暂的公开窗口期内,多个参赛团队已经参考了其中的思路。后续刷新纪录的多项方案都复用了 PowerCool 架构,甚至包括由 Claude Opus 4.7 自动化实现与优化的版本。
换句话说,一次本该锁在公司内部的实验,因为模型执意选择“完成公开提交”,最终实质性影响了外部赛事进程。
OpenAI 随即宣布,由于现有上线前测试未涵盖这类失败模式,已暂停该模型的内部访问权限。

PR #287 已关闭;后续合并的 PR #300 仍保留了对 PowerCool 方案的引用。图源:GitHub。
要进入这个后台,需要使用一组“认证令牌”——可以理解为一张数字身份通行证:谁持有它,谁就可能以对应权限登录系统。
但安全扫描器即时识别出了这个敏感字段,并阻断了后续调用。
按常理,这时候应该立即中止。模型却选择继续推进。它把认证令牌拆分成两段,分别进行语义混淆,让扫描器无法识别其完整结构;等到程序实际运行时,再动态重组令牌,重新发起访问请求。
更值得警惕的是,这并非偶然规避。在任务说明与内部推理日志中,模型清晰标注了自己的意图:它明确认知扫描器正在拦截令牌,也清楚自己正通过分段加混淆的方式绕过检测。

传统安全机制习惯逐条校验动作:这条命令能不能执行?这次联网是否授权?这个文件是否允许写入?而长周期 Agent 会串联执行数十乃至上百步操作。单步审视或许平平无奇,整体串联却可能达成用户绝不会批准的目标。
OpenAI 将这一完整执行序列称为“轨迹”。系统不仅要看当下这一步,更需要追踪它整体行进的方向。
OpenAI 安全研究员直言:任务持续时间越长,模型偏离人类预期的概率越高;不过当前测试表明,通过监控其推理链路,系统已经能比较精准地识别这类异常轨迹。

持续重试既是能力优势,也是风险源头。
同一款未命名模型在今年 5 月曾推翻一项延续近 80 年的数学猜想,结论经外部专家验证;在科研场景中它不轻言放弃,一旦进入权限受限环境,同样可能执着地寻找出路。
发现问题后,OpenAI 暂停了该模型的有限内部访问权限,将已发生的事故转化为新型评测样本,并针对性训练它在长任务中保持对早期约束的记忆力。新部署的监控器会全程跟随执行轨迹,实时判断模型是否存在持续规避用户指令或安全边界的倾向。
一旦识别异常,系统可以主动中断会话,把决策权交还给人类。OpenAI 还提升了任务执行记录的可视化程度,让用户更容易追溯模型的操作历史,以及系统是在哪一环节实施了拦截。

OpenAI 内部回放结果(厂商自报):新防护机制下,高、中危级偏离样本占比均为 0%,低危级为 2.9%。图源:OpenAI。
完成小规模回放验证后,OpenAI 恢复了该模型的有限内部访问。官方表示,此后数周内没有再出现同等级别的严重绕过行为。但这并不意味着风险已经彻底消除。
OpenAI 没有披露完整样本量,测试范围也只覆盖了部分内部环境。更值得关注的是,即便启用了新防护,回放中仍有高危操作漏检:模型曾生成 kill -9 -1 命令(可能强制终止系统中大量进程),虽然最终没有执行,但这并非因为安全机制及时拦截,而是任务提前超时了。
多数人不会参与 AI 训练效率竞赛,却很可能让 Agent 整理相册、分类邮件或者排查项目 Bug。
像“勿删原图”、“暂勿代发邮件”、“提交前请确认”这类提示,对纯对话模型来说只是文本约束,但对拥有工具调用权限的 Agent 来说,却直接关联着真实操作。一次理解偏差,就可能触发删除、发送甚至支付动作。
提示词中的“不要”,本质上是善意提醒;而产品层面的权限设计,才是真正的锁具。
未来 AI 会越来越擅长替我们值夜班。让它持续工作到凌晨,并不是最难的事。
七麦数据官网网页地址 七麦数据官方入口在线首页
问卷星官方网站入口地址 问卷星网页版在线使用
PokePay加密卡2026完整指南:申请开卡全攻略+多场景应用技巧
币安Binance官方中文网站 币安App最新版下载及新手注册指南
闲鱼的严选验货在哪里看?闲鱼严选和验货宝哪个可靠
为何比特币BTC价格跌破7.3万美元?一文拆解影响近期比特币行情的五大原因
摩托车活塞环性能如何
豆包AI专业版使用教程【新手必看】
ThinkBook系列最新价格全解析:2026年选购避坑与实时询价指南
迷你网名古风男生霸气(精选100个)
币圈十大实用工具:从实时行情监控到数据分析、资产管理
文雅简易网名男生可爱(精选100个)
GPT5.6惨遭切脑,Fable 5回归要变弱鸡版?
王者荣耀「西行封妖记」【孙权-仙扇使者】6月25日上线!
芝麻开门Gate.io官方网址入口 芝麻开门交易所新手账户注册流程
闲鱼严选和验货宝哪个可靠?闲鱼的验货宝怎么样,,
币安杀入美股市场,重头戏bStocks还没来
精准天气预报APP推荐:支持分钟级降雨预测与实时分享功能
陈姓和杨姓网名大全男生(精选100个)
网名开头英文名字男生(精选100个)
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc