曝OpenAI紧急叫停新模型发布!

智东西
编译 | 程茜
编辑 | 心缘
智东西9月29日消息,刚刚,据外媒《华尔街日报》报道,因内部测试期间研究人员发现安全隐患,OpenAI决定 取消新一代模型GPT‑6.1 Astra 的发布计划。新模型原计划在10月内推出。
《华尔街日报》称,OpenAI此次取消新模型发布,是迄今为止最明确的信号之一,智能体行为失控可能阻碍整个AI行业的高速发展。
OpenAI安全系统负责人萨奇·贾因(Saachi Jain)在一份声明中说,尽管GPT‑6.1 Astra在无人干预完成复杂任务、文本创作能力上相比前代有所提升,但在 关键安全指标上出现退步 ,没有达到OpenAI对外发布的对齐标准,主要包括以下两项:
欺骗行为倾向上升 :模型不会如实向用户报告自己已经完成、或是尚未完成的操作,存在隐瞒自身行为的情况。
任务权限管控失效 :在没有获得用户许可的前提下,模型会擅自继续执行任务,即便存在潜在风险,也会自行调用外部工具和第三方服务。
他补充说:“我们希望确保我们的模型开发过程是安全的,无论是在公司内部进行还是将其交付给用户时都是如此。但当我们将这些模型交付给用户时,我们对安全性的要求非常高。”
上周日,OpenAI宣布 已暂停其最新一代大模型的训练、评估及涉及工具调用的推理 。此前内部测试中,有Agent突破隔离沙箱,私自对外访问外部聊天机器人服务。
▲OpenAI发布事件博客
贾因透露,GPT-6.1 Astra不属于上述被暂停训练的模型。
《华尔街日报》称,这一公告发布正值OpenAI年度开发者大会DevDay前夕,明天OpenAI将举办第四届开发者大会。往年,OpenAI都会借这场大会发布新模型与服务。
值得一提的是,就在今天凌晨,和OpenAI共同呼吁放缓前沿模型研究的Anthropic发布了Claude 5.5系列第二款模型 Claude Sonnet 5.5 ,号称新模型速度提升超30%,多数任务成本降低近30%。
今年夏季,全行业接连曝出大模型“失控”事件。
今年早些时候,OpenAI数百个内部智能体在一次网络安全测试中,入侵了Hugging Face。此后,澳大利亚政府、联合国等重要机构发现,OpenAI的智能体也曾使用类似但程度较轻的手段尝试访问其网站。
上周六工程师罗文·霍华德-琼斯(Rowan Howard-Jones)发布的一份独立研究报告显示,今年6月,OpenAI的Agent在4月至6月底期间,使用包括绕过网站设置的阻止其请求的过滤器在内的技术,对联合国贸易和发展署的一个公开数据中心进行了超过16000次扫描。
不过多数已公开的智能体安全事件,涉及的都是 OpenAI原本就不打算对外发布的内部模型 。
因此近几周,业界对大模型安全的关注度升级。
9月中旬,OpenAI与Anthropic罕见联手呼吁企业放缓前沿AI模型研发,投入资源建立安全标准,并透露自身也会调低内部AI研发节奏。
▲OpenAI联合创始人、CEO Sam Altman转发Anthropic联合创始人、CEO Dario Amodei推文
就在昨天,英伟达也宣布推出NVIDIA开放智能体安全平台,从智能体测试到部署的各个环节强化AI安全,并针对运行智能体的软件、硬件、计算和机器人系统,实施全栈治理与管控。
贾因透露,OpenAI接下来的重点是开展多项深度复盘,定位GPT-6.1 Astra问题的根源。他们的工作内容包括确保强化学习环境能够奖励模型产生正确行为,并对模型开发全流程开展排查。
《华尔街日报》称,OpenAI内部正在排查近几个月发现的多起智能体安全事件,解决背后的安全隐患,相关举措包括 部署一套全新监控系统 ,更快识别AI智能体的异常行为;同时要求工程师在测试AI系统时,启用更强的安全防护机制。
结语:模型狂飙、安全跟不上,OpenAI踩下模型发布刹车
随着智能体具备自主规划、多轮持续执行任务的能力,风险边界随之外溢,模型可自主调用工具、跨系统操作,一旦出现目标对齐失效、行为漂移,潜在影响可能波及企业的业务系统、数据接口等。
如今大模型相关安全事件频发,Anthropic联合创始人、CEO Dario Amodei曾在博客中称,要充分化解AI的相关风险,需要更加审慎的态度,不只是投入资源做好风险防范,还要控制能力迭代的节奏,让风险防控工作有时间跟上技术发展。
此次OpenAI或取消新模型发布,凸显出前沿AI能力加速突破与安全治理节奏落后的深层矛盾。
来源:《华尔街日报》
资讯由采集器定时从公开机器人 / AI 信息源自动聚合。
相关内容

除了更贵的订阅和砍半的额度,OpenAI 想做的还是「微信」
模型越来越便宜,付费给的用量却砍了半 作者|Alan 北京时间 9 月 30 日凌晨,OpenAI 开完了它口中「迄今规模最大的一届」开发者大会。官方汇总页上一共列了 25 项发布,从新模型、新 API,一路排到给企业买软件用的应用市场。 现场最安静的一刻,出现在 Sam Altman 讲到 ChatGPT Pro 会员调整的时候。台下没有一个人鼓掌。 调整本身不复杂:每月 200 美元的 Pro 200 价格不变,新订阅的用量缩水;另外新增一档 Pro 500,每月 500 美元,用量是 Plus 的 25 倍,外加一个个人套餐里只有它能用的提速档 Astra Ultrafast。 那一阵沉

刚刚,iQOO掏出年度旗舰,自研电竞芯片性能提升15%,首款电竞平板也来了
智东西 作者 | 陈骏达 编辑 | 心缘 智东西9月29日报道,刚刚,vivo旗下iQOO品牌发布了年度旗舰手机iQOO 16,这台手机搭载了第六代骁龙8超级至尊版,全球首发了由iQOO和三星显示联合研发的2K 165Hz三星珠峰屏,并基于iQOO搭建的“3+2游戏技术版图”,提升了手机在视效、操控、直播和跨端游戏等维度的体验。 同时,iQOO还发布了其首款电竞平板iQOO Pad Ultra,这款产品同样采用第六代骁龙8超级至尊版,并搭配iQOO自研电竞芯片Q4和全新一代Monster超核引擎,还通过五重风冷散热系统、新一代超感触控引擎和自研Q-flex操控技术提升游戏体验。 先来看iQOO

刚刚,DeepSeek Harness桌面端上线,梁文锋开送Token了
智东西 作者 | 江宇 编辑 | 漠影 智东西9月29日报道,今日, DeepSeek正式推出DeepSeek Harness v0.2预览版 ,并提供开箱即用的macOS和Windows 桌面端 安装包。 ▲DeepSeek Harness v0.2预览版界面 用户前往DeepSeek Harness官网下载安装后,按照引导即可直接使用,无需再自行配置开发环境。 这是DeepSeek Harness自8月13日晚推出开发者预览版v0.1并同步开源后的又一次重要更新。 此次v0.2进一步补齐了 桌面端产品体验 ,不仅 预置日常办公和开发中的常用功能 ,还新增 插件安装与管理页面、自动化任务 等

AMD 82 亿美元收购 World Labs,买的不只是世界模型
9 月 3 日,英伟达宣布以约 130 亿美元收购 Hugging Face。25 天后,AMD 宣布以约 82 亿美元收购李飞飞创办的 World Labs。 两笔交易放在一起看,更觉得有意思。CNBC 最新的报道提到,Hugging Face 在被英伟达拿下之前,AMD 和 Salesforce 都曾表达过收购兴趣。 没抢到 AI 世界里最大的模型「集散地」,AMD 转身买下了一支造模型的顶级团队。 根据 AMD 的公告,这是一笔全股票交易 ,预计在 2026 年底前完成交割,仍需通过监管审批。交割之后,李飞飞将出任 AMD 执行副总裁兼首席科学家,直接向 CEO 苏姿丰汇报。 这也是 A

让Token像土豆一样便宜,要闯哪四关?
进入2026年下半年,全球算力涨价潮持续发酵。 “让全世界更多的人,像享受土豆一样,享受Token。” 9月19日,央视《对话》走进远景乌兰察布星河基地,远景科技集团创始人张雷用这个比方,提出了一个看似简单的问题: AI怎样才能更普惠? 这句“AI土豆论”很快在算力圈引发讨论,背后是全行业共同的成本焦虑: AI算力的门槛,实在太高了。 就在节目播出三天后,小米发布MiMo-V2.6,并公开了全程直播的“炼丹”账本,把这份昂贵具象化:MiMo-V2.6的Pro与Flash两个版本,仅强化学习后训练阶段就跑了不到6天,合计烧掉了 347万美元 , 约合人民币2344万元 。 这还只是后训练环节。据
Anthropic 招股书里,最耐人寻味的 7 个细节
作者|Techno 之王 编辑|靖宇 当地时间 9 月 28 日,外媒披露了一份 Anthropic 的 IPO 招股书。 先要说清楚这份文件的性质。它并不是 Anthropic 主动公开的版本。今年 6 月,Anthropic 以公益公司身份向美国证交会秘密递交了 S-1 注册声明草案,为普通股首次公开发行做准备。按照规则,公司要在向机构投资者路演前至少 15 天公开递交修订版 S-1,完整财务数据到那时才会被外界看到。路透此次看到的是一份尚未公开的版本, Anthropic 对此拒绝置评 。 这意味着其中的数字仍可能随证交会的审阅意见调整,不少细节也只能通过路透的转述窥见一角。 但如果这份