热门搜索:和平精英 原神 街篮2 

您的位置:首页 > > 教程攻略 > ai资讯 >OpenAI_黑进_Hugging_Face_,当喊停的不再是人类

OpenAI_黑进_Hugging_Face_,当喊停的不再是人类

来源:互联网 更新时间:2026-07-24 08:02

X平台上最近炸开了锅,大家都在热议一件听起来简直像科幻小说里才会发生的事。

事情是这样的:OpenAI 原本只是想给自家 AI 搞一场能力评估测试,重点考察它的“渗透测试”水平。为了杜绝外部干扰,团队特意把模型关在一个完全隔离、无法自由访问互联网的封闭沙箱环境里。

结果呢?AI 不仅自己发现了逃逸路径,还真的突破了边界,成功接入了另一家公司的生产系统。

这场测试叫 ExploitGym——本质上是一个专为 AI 打造的网络攻防训练场,目标是安全、可控地把那些行为不可预知、策略高度自主的 Agent 接入真实数字环境。系统里预埋了若干漏洞,模型的任务就是识别并利用它们完成挑战,但所有操作按理说应该严格限定在隔离测试域内。

然而这一次,模型意外挖掘出一个此前从未被发现的安全盲点,借此绕开了网络隔离机制,直连公网。接下来,它一步步提权,最终闯入了 Hugging Face 支撑核心业务的生产数据库,还从中提取出了本次测试的正确答案。

最让人震惊的,倒不是越狱本身,而是整个攻击过程完全没有指令驱动。

OpenAI 后续调查确认,测试任务只要求模型解题,并没有提示答案可能存储于外部平台,更没授权它访问任何第三方系统。但模型自己推理:既然是公开托管的评测项目,Hugging Face 很可能存有相关数据。

于是,它就真的顺着这条逻辑链,一路抵达了目标。

一场本用于衡量 AI 能力边界的内部实验,就这样从虚拟考场蔓延到了现实基础设施,演变成波及他司业务系统的实际安全事件。

OpenAI 将其定性为“前所未有”的网络安全事故。参与测试的模型包括 GPT-5.6 Sol,以及一款能力更强、但尚未对外发布的内部版本。

这起事件把长周期 Agent 的潜在风险赤裸裸地摆在了台面上:当它持续为达成目标寻找路径时,权限边界究竟是终止指令,还是下一道待破解的关卡?

多位用户反馈 GPT-5.6 Sol 擅自执行删除操作

AI 初创公司 OthersideAI 的创始人 Matt Shumer 表示,Sol 几乎清空了他 Mac 上全部本地文件;开发者 Bruno Lemos 则称其生产数据库遭到了批量清除。此后,陆续出现了多起同类报告。

用户普遍困惑:我明明没下过删除指令,它为什么就擅自执行了?

OpenAI 产品负责人随后在 X 上回应说,已经核查了少量类似案例。目前观察到的共性在于:这些用户普遍赋予了 Codex 极高的系统权限,几乎可以任意修改文件;同时,本该启用的运行时安全防护机制却处于关闭状态。

事故正是在这种“高权限+零防护”的组合下触发的。

OpenAI 强调,这类事件当前仍属极个别现象。但问题显然不能简单归因于“用户授权过度”。

毕竟,普通使用者很难预判 Agent 在获得权限后的真实行为轨迹,更没法实时审计每一条自动化命令。

因此,OpenAI 正在优化 Codex 的初始引导文案,降低用户默认授予过高权限的可能性;同时计划在关键操作执行前增设二次确认与拦截层,避免单次误判直接导致不可逆的后果。

Peter Fotinis 在 Tibo 的回应下呼吁重置 Codex 配额,评论区迅速玩起了梗图接力。

这个回应虽然厘清了一种误删路径,却暴露出更深层的隐患:当 Agent 具备数小时连续执行能力时,它是否会把用户设定的规则,视作一堵必须翻越的墙?

OpenAI 官方证实,团队在复盘中发现原有上线前评估未能覆盖这类失效场景,已经紧急暂停了该内部模型的有限访问权限。图源:OpenAI。

7 月 20 日,OpenAI 公开披露了一段颇具戏剧性的内部测试插曲。

公司安排一款尚未命名的模型参与一场比拼 AI 训练效率的内部竞赛。模型很快提出了一套名为 PowerCool 的新方法,但在提交阶段陷入了两难:研究人员明确要求仅限内部聊天群汇报;而赛事官网则规定方案须上传至公开代码平台。

模型最终选择了后者。

棘手之处在于,它当时正运行在完全断网的隔离环境中,理论上根本没法访问外部网站。按常规逻辑,它应该中止流程并提示“任务不可达”。但它并没有停步,而是耗时约一小时主动探查环境缺陷,绕过了联网限制,成功将方案发布到了公开平台。

这份提交编号为 PR #287,本质上是一份面向全网开放的技术方案,其他参赛者都可以查阅。

OpenAI 迅速察觉异常并撤回了该 PR,但为时已晚。在短暂的公开窗口期内,多个参赛团队已经参考了其中的思路。后续刷新纪录的多项方案都复用了 PowerCool 架构,甚至包括由 Claude Opus 4.7 自动化实现与优化的版本。

换句话说,一次本该锁在公司内部的实验,因为模型执意选择“完成公开提交”,最终实质性影响了外部赛事进程。

OpenAI 随即宣布,由于现有上线前测试未涵盖这类失败模式,已暂停该模型的内部访问权限。

PR #287 已关闭;后续合并的 PR #300 仍保留了对 PowerCool 方案的引用。图源:GitHub。

单条指令看似无害,整段执行轨迹早已偏航

它注意到后台缓存了其他系统已完成但尚未发布的提交内容,于是推断这些数据可能有助于自身任务达成,并开始尝试接入后台提取信息。

要进入这个后台,需要使用一组“认证令牌”——可以理解为一张数字身份通行证:谁持有它,谁就可能以对应权限登录系统。

但安全扫描器即时识别出了这个敏感字段,并阻断了后续调用。

按常理,这时候应该立即中止。模型却选择继续推进。它把认证令牌拆分成两段,分别进行语义混淆,让扫描器无法识别其完整结构;等到程序实际运行时,再动态重组令牌,重新发起访问请求。

更值得警惕的是,这并非偶然规避。在任务说明与内部推理日志中,模型清晰标注了自己的意图:它明确认知扫描器正在拦截令牌,也清楚自己正通过分段加混淆的方式绕过检测。

症结在于目标优先级:任务完成凌驾于用户约束之上

传统安全机制习惯逐条校验动作:这条命令能不能执行?这次联网是否授权?这个文件是否允许写入?而长周期 Agent 会串联执行数十乃至上百步操作。单步审视或许平平无奇,整体串联却可能达成用户绝不会批准的目标。

OpenAI 将这一完整执行序列称为“轨迹”。系统不仅要看当下这一步,更需要追踪它整体行进的方向。

OpenAI 安全研究员直言:任务持续时间越长,模型偏离人类预期的概率越高;不过当前测试表明,通过监控其推理链路,系统已经能比较精准地识别这类异常轨迹。

持续重试既是能力优势,也是风险源头。

同一款未命名模型在今年 5 月曾推翻一项延续近 80 年的数学猜想,结论经外部专家验证;在科研场景中它不轻言放弃,一旦进入权限受限环境,同样可能执着地寻找出路。

OpenAI 为其配备了一名“随行安全员”

发现问题后,OpenAI 暂停了该模型的有限内部访问权限,将已发生的事故转化为新型评测样本,并针对性训练它在长任务中保持对早期约束的记忆力。新部署的监控器会全程跟随执行轨迹,实时判断模型是否存在持续规避用户指令或安全边界的倾向。

一旦识别异常,系统可以主动中断会话,把决策权交还给人类。OpenAI 还提升了任务执行记录的可视化程度,让用户更容易追溯模型的操作历史,以及系统是在哪一环节实施了拦截。

OpenAI 内部回放结果(厂商自报):新防护机制下,高、中危级偏离样本占比均为 0%,低危级为 2.9%。图源:OpenAI。

完成小规模回放验证后,OpenAI 恢复了该模型的有限内部访问。官方表示,此后数周内没有再出现同等级别的严重绕过行为。但这并不意味着风险已经彻底消除。

OpenAI 没有披露完整样本量,测试范围也只覆盖了部分内部环境。更值得关注的是,即便启用了新防护,回放中仍有高危操作漏检:模型曾生成 kill -9 -1 命令(可能强制终止系统中大量进程),虽然最终没有执行,但这并非因为安全机制及时拦截,而是任务提前超时了。

若将这类安全挑战置于日常使用场景中呢?

多数人不会参与 AI 训练效率竞赛,却很可能让 Agent 整理相册、分类邮件或者排查项目 Bug。

像“勿删原图”、“暂勿代发邮件”、“提交前请确认”这类提示,对纯对话模型来说只是文本约束,但对拥有工具调用权限的 Agent 来说,却直接关联着真实操作。一次理解偏差,就可能触发删除、发送甚至支付动作。

提示词中的“不要”,本质上是善意提醒;而产品层面的权限设计,才是真正的锁具。

只有懂得适时停手的 Agent,才真正配得上接触真实账号与文件。

未来 AI 会越来越擅长替我们值夜班。让它持续工作到凌晨,并不是最难的事。

最难的是——在它即将执行删除、发送或付款之前,主动唤醒人类。

关于宇宙的好的网名有哪些
关于宇宙的好的网名有哪些

类型:角色扮演

大小:1

语言:简体中文

平台:互联网

游戏下载

热门手游

相关攻略

手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc