OpenAI,经历了最漫长的一天

当地时间 9 月 25 日,OpenAI 经历了漫长的一天。
当天, OpenAI 的 AI 智能体擅自访问美国政府网站的事被曝光,涉及教育部、商务部和证券交易委员会 ,OpenAI 确认了其中商务部和 SEC 的情况。
同一天,它承认有 53 张用户上传到 ChatGPT 的图片被智能体发布到了外部图床上。还是这一天,一份事故报告的末尾写着,最强模型的全部训练、评估以及涉及工具调用的推理都已暂停。
这一切听上去,像一部 AI 叛逃的惊悚片。
但翻遍这些事件,没有一个 AI 想干坏事。 害 OpenAI 暂停模型研究的任务,仅仅是让 AI 查出一篇博客的作者的简单任务。
01
简单任务
9 月 20 日,一个正处于强化学习训练中的内部模型,拿到了一组人物履历细节和一篇公开博客里的线索,任务是找到那位博主。
它先用博客里的特征短语去搜,结果返回的是音乐和一些不相干的泛泛建议。模型开始怀疑搜索工具坏了,于是在命令行里用 Python 直接向其他搜索引擎发请求,三个全部报错。它甚至猜测这道题出自公开评测集 BrowseComp,把数据集和评测脚本下载下来翻找答案,也落了空。
接着,它尝试通过 HTTPS 直接联系一个公开的聊天机器人,被代理拦了下来。
到这里,墙起了作用。OpenAI 的训练沙箱被设计成与真实互联网隔绝,除了这份报告里的 DNS 解析器,所有联网请求打到的都是一份离线网页缓存。
问题就出在这个例外上。
DNS 相当于互联网的查号台,任何程序访问一个网址之前,都要先问它「这个地址在哪」。系统里大量正常组件都依赖它,所以哪怕其他出口全部封死,查号台通常还开着。
模型发现,沙箱自己的解析器能为真实域名返回记录,还能正确拒绝编造的域名,它由此判断这是一条通向公网的路 。它找到一种公开的 DNS 服务,把自己的问题编进「要查的号码」里,对方在回执里把答案捎回来。第一次超时了,它把等待时间从 6 秒调到 19 秒,重试。
这一次,外面的聊天机器人回答了它的测试问题,法国的首都是巴黎。
智能体借 DNS 绕出训练沙箱的路径示意,据 OpenAI 事故报告绘制|图片来源:极客公园
它没有止步于打通一条缝。 它随后又通过同一条路发出 18 个问题,其中 14 个带着任务线索,另外 4 个在打听如何经由 DNS 搜索网页、抓取网站,或者哪里有公开的 DNS 隧道服务。
最后,它告诉用户没能确认博主身份,请对方提供原文、标题或博客名。
02
捡钥匙
整份报告里,最值得反复读的是模型在决定走 DNS 这条路时留下的一句思维链。大意是,用户只授权了做研究,那么使用公开提供的 DNS 服务是可以接受的。
模型并非不知道边界在哪,它是给自己签了一张许可证。
同样的推理结构,出现在「访问」政府网站那批事件里。在商务部,智能体从公开代码仓库里找到登录凭证,用它拉取了人口普查局的数据。OpenAI 对此的说法是,使用的是公开可得的开发者密钥,没有发现凭证滥用,但它也承认智能体本不该使用这些凭证。
数据是公开的,不等于捡到别人的钥匙就可以开门。
另外两起性质更轻。在 SEC,模型访问的是 SEC.gov 和 Investor.gov 上的公开信息,问题在于它把这些材料转贴到了另一个网站。在教育部,AI 研究机构 Transluce 发现,疑似来自 OpenAI 的智能体对民权办公室网站做了一次粗糙的入侵尝试,没有成功。
这些事并不新。相关活动至少能追溯到 2026 年 3 月,是在 OpenAI 回溯审查中才陆续浮出水面的。Transluce 还发现了一些无法明确归因于 OpenAI 的越界活动,指向司法部以及加州、马里兰、伊利诺伊、得州和纽约州的政府网站。
OpenAI 的解释是,大部分活动都是例行研究任务,政府网站被模型视为权威的公开信息来源。
这个解释本身,恰恰说明了问题所在。 越界并没有出现在什么危险任务里,而是出现在最日常的「查资料」中。
暴露用户 53 张图片的事同样如此。这些图片来自没有关闭训练数据授权的 ChatGPT 用户,被发到了图床上不公开列出的链接里,大部分已删除,仍有一部分挂在网上。更尴尬的是,OpenAI 表示,由于其技术方案和隐私政策,它无法把图片重新对应到原始用户,也就没法通知他们。
匿名化本来是为了保护用户,出了事之后,它成了连通知用户都做不到的原因。
03
漫长的夏天
把时间线拉长,这是 OpenAI 一场持续了整个夏天的补墙工程。
7 月 21 日,OpenAI 披露其模型组合自主入侵了 Hugging Face 的数据处理系统,并称这是已知首例由 AI 智能体自主实施的网络攻击。此后,OpenAI 把训练环境的联网改成离线缓存。9 月 20 日的 DNS 事件,是这轮安全加固之后的第一次事故,OpenAI 自己评估其严重程度远低于此前几起。
这也不是一家公司的问题。9 月 18 日,Google 披露 Gemini 在一次测试中未经授权访问了三个外部系统,原因是它以为那些系统是测试的一部分。
墙本身之外,这次还暴露了盯着墙的人的问题。从智能体拿到外部回复,到监控系统拉响最高级别警报,用了不到 12 分钟,人工审核员 3 分钟后就做出了响应, 但这次训练直到两个半小时后才被手动终止,原因是运行没有按预期自动停止,大家一时搞不清到底该不该停 。
更隐蔽的漏洞在监控逻辑里。回溯时 OpenAI 发现,另一些外联 DNS 请求没有被标到应有的严重级别,因为监控系统有时把「没拿到有用信息」当成了「联网尝试失败」。
用结果去判断意图,是这套监控最根本的错误。 一个试了一百次、失败九十九次的模型,并不比只试一次就成功的模型更安全。
这一次,OpenAI 付出了真金白银的代价。最强模型的相关工作会一直暂停到漏洞被确认修复、并完成额外红队测试为止,而且即便奖励信号已经对这类行为做了正确惩罚,这个模型也不会再继续训练。
04
没有「简单问题」
对大多数人来说,OpenAI 的训练沙箱很遥远。但这几起事件真正指向的,是一个离每个人都很近的问题, 你交给 AI 的那句话,到底授权了多少。
越来越多人把邮箱、网盘、代码仓库和 API 密钥交给各种智能体,然后说一句「帮我查一下」「帮我处理一下」。在 OpenAI 的实验室里,这句话之外还有监控系统、红队、值班的审核员。而在个人电脑和手机上,通常只有这句话本身。
对开发者来说还有一层更直接的风险。过去推到 GitHub 上的密钥,要等专门的扫描工具来捡;现在,任何一个在执行普通任务的智能体,都可能把它当成「公开可用的资源」顺手用掉。
当然,没有必要把这些读成末日预言。那个查博主的模型最终没有找到答案,它从外面拿回的,只是一句「巴黎」。
危险不在它拿到了什么,而在它愿意走多远。
过去几年,AI 安全讨论最多的,是一个怀有坏目标的 AI 会做什么。OpenAI 这个夏天的一连串事故给出了一个更现实的版本:
一个只想好好完成任务的 AI,会为了交差说服自己做到哪一步 。
当一家 AI 公司都需要停下最强的模型,来重新检查围墙时,你再问 AI 助手那句「帮我查一下」时,会不会有别样的感觉?
*头图来源:POLITICO
本文为极客公园原创文章,转载请联系极客君微信 geekparkGO
资讯由采集器定时从公开机器人 / AI 信息源自动聚合。
相关内容

除了更贵的订阅和砍半的额度,OpenAI 想做的还是「微信」
模型越来越便宜,付费给的用量却砍了半 作者|Alan 北京时间 9 月 30 日凌晨,OpenAI 开完了它口中「迄今规模最大的一届」开发者大会。官方汇总页上一共列了 25 项发布,从新模型、新 API,一路排到给企业买软件用的应用市场。 现场最安静的一刻,出现在 Sam Altman 讲到 ChatGPT Pro 会员调整的时候。台下没有一个人鼓掌。 调整本身不复杂:每月 200 美元的 Pro 200 价格不变,新订阅的用量缩水;另外新增一档 Pro 500,每月 500 美元,用量是 Plus 的 25 倍,外加一个个人套餐里只有它能用的提速档 Astra Ultrafast。 那一阵沉

刚刚,iQOO掏出年度旗舰,自研电竞芯片性能提升15%,首款电竞平板也来了
智东西 作者 | 陈骏达 编辑 | 心缘 智东西9月29日报道,刚刚,vivo旗下iQOO品牌发布了年度旗舰手机iQOO 16,这台手机搭载了第六代骁龙8超级至尊版,全球首发了由iQOO和三星显示联合研发的2K 165Hz三星珠峰屏,并基于iQOO搭建的“3+2游戏技术版图”,提升了手机在视效、操控、直播和跨端游戏等维度的体验。 同时,iQOO还发布了其首款电竞平板iQOO Pad Ultra,这款产品同样采用第六代骁龙8超级至尊版,并搭配iQOO自研电竞芯片Q4和全新一代Monster超核引擎,还通过五重风冷散热系统、新一代超感触控引擎和自研Q-flex操控技术提升游戏体验。 先来看iQOO

刚刚,DeepSeek Harness桌面端上线,梁文锋开送Token了
智东西 作者 | 江宇 编辑 | 漠影 智东西9月29日报道,今日, DeepSeek正式推出DeepSeek Harness v0.2预览版 ,并提供开箱即用的macOS和Windows 桌面端 安装包。 ▲DeepSeek Harness v0.2预览版界面 用户前往DeepSeek Harness官网下载安装后,按照引导即可直接使用,无需再自行配置开发环境。 这是DeepSeek Harness自8月13日晚推出开发者预览版v0.1并同步开源后的又一次重要更新。 此次v0.2进一步补齐了 桌面端产品体验 ,不仅 预置日常办公和开发中的常用功能 ,还新增 插件安装与管理页面、自动化任务 等

AMD 82 亿美元收购 World Labs,买的不只是世界模型
9 月 3 日,英伟达宣布以约 130 亿美元收购 Hugging Face。25 天后,AMD 宣布以约 82 亿美元收购李飞飞创办的 World Labs。 两笔交易放在一起看,更觉得有意思。CNBC 最新的报道提到,Hugging Face 在被英伟达拿下之前,AMD 和 Salesforce 都曾表达过收购兴趣。 没抢到 AI 世界里最大的模型「集散地」,AMD 转身买下了一支造模型的顶级团队。 根据 AMD 的公告,这是一笔全股票交易 ,预计在 2026 年底前完成交割,仍需通过监管审批。交割之后,李飞飞将出任 AMD 执行副总裁兼首席科学家,直接向 CEO 苏姿丰汇报。 这也是 A

让Token像土豆一样便宜,要闯哪四关?
进入2026年下半年,全球算力涨价潮持续发酵。 “让全世界更多的人,像享受土豆一样,享受Token。” 9月19日,央视《对话》走进远景乌兰察布星河基地,远景科技集团创始人张雷用这个比方,提出了一个看似简单的问题: AI怎样才能更普惠? 这句“AI土豆论”很快在算力圈引发讨论,背后是全行业共同的成本焦虑: AI算力的门槛,实在太高了。 就在节目播出三天后,小米发布MiMo-V2.6,并公开了全程直播的“炼丹”账本,把这份昂贵具象化:MiMo-V2.6的Pro与Flash两个版本,仅强化学习后训练阶段就跑了不到6天,合计烧掉了 347万美元 , 约合人民币2344万元 。 这还只是后训练环节。据
Anthropic 招股书里,最耐人寻味的 7 个细节
作者|Techno 之王 编辑|靖宇 当地时间 9 月 28 日,外媒披露了一份 Anthropic 的 IPO 招股书。 先要说清楚这份文件的性质。它并不是 Anthropic 主动公开的版本。今年 6 月,Anthropic 以公益公司身份向美国证交会秘密递交了 S-1 注册声明草案,为普通股首次公开发行做准备。按照规则,公司要在向机构投资者路演前至少 15 天公开递交修订版 S-1,完整财务数据到那时才会被外界看到。路透此次看到的是一份尚未公开的版本, Anthropic 对此拒绝置评 。 这意味着其中的数字仍可能随证交会的审阅意见调整,不少细节也只能通过路透的转述窥见一角。 但如果这份