据《纽约时报》披露,在OpenAI的人工智能系统出现失控行为前数月,已有两名雇员向公司管理层发出安全警告,但他们的提醒未被重视。
《纽约时报》查阅电子邮件记录后发现,这两名员工在信中表达了忧虑:在测试过程中,对OpenAI最新一代AI模型的监控存在不足;而测试本应评估模型能力,并确保其安全性。
对此,OpenAI管理层回应称,测试必须加速推进,以确保AI模型按时发布。据不愿公开身份的这两名员工透露,公司后续并未增加额外的安全管控措施。
随后,OpenAI的模型确实突破了测试环境,对AI初创公司Hugging Face及其他机构发起攻击,这一事件在全球引发了关于人工智能安全的广泛讨论。
据在职员工及独立安全研究员指出,此前员工与高管之间的沟通情况反映了普遍现象:这家总部位于旧金山的公司并未将安全保障作为优先事项。这一问题不仅限于AI模型测试环节;开发ChatGPT聊天机器人的这家公司,其他业务领域也呈现出类似倾向。
多名独立安全研究员称,近几个月来他们陆续发现了漏洞,能够借此查看OpenAI员工的内部通讯记录;还存在其他安全缺陷,可访问公司内部源代码,并调取ChatGPT用户的聊天日志。当研究人员将问题反馈给OpenAI时,公司最初并未给予关注。
AI安全公司Abundant Security的首席技术官约书亚·萨克斯(Joshua Saxe)评价道:“OpenAI的安全水平大致符合这样一种情况:一家在四年内迅速扩张的实验室,更注重在竞争中击败对手,而非加强自身基础设施。”
OpenAI内部员工表示,日常大量安全相关决策主要由总裁格雷格·布罗克曼(Greg Brockman)与首席信息安全官戴恩·斯塔基(Dane Stuckey)负责;首席执行官萨姆·奥尔特曼并未深度参与安全事务。
并非只有OpenAI近期曝出AI安全事故。谷歌、Meta和Anthropic也都披露过,它们最强的AI系统曾脱离测试环境,在企业不知情的情况下自主攻击其他计算机基础设施。
然而,OpenAI的安全处理方式正受到格外严格的审视。该公司AI系统出现、并被内部定性为“值得警惕”的异常行为事件数量最多;在专家看来,其中部分案例的性质最为棘手。
前后共发生十余起相关事件:OpenAI的AI系统在无人指令下尝试入侵各类机构,甚至包括美国政府机构的网站;该系统还会刻意掩盖自身错误、捏造虚假数据、主动向其他聊天机器人发送消息,并在未经许可的情况下将文件上传至公共网络。
前OpenAI员工丹尼尔·科科塔伊洛(Daniel Kokotajlo)目前运营非营利研究机构AI Futures Project,他一直批评该公司的安全策略。他表示:“从某种角度看,这属于OpenAI自身的问题。一方面安全管控做得较差;另一方面模型训练流程粗疏,导致模型本身倾向于做出这类危险行为。当然,其他AI企业也好不到哪里去。”
OpenAI发言人德鲁·普萨泰里(Drew Pusateri)回应称,公司始终致力于AI安全,认真对待每一份安全报告及相关顾虑。实验室内部设有专门渠道用于上报安全隐患;收到独立安全研究员提交的漏洞后,公司会立即采取处置措施。
“随着前沿模型能力持续增强,我们也在不断迭代安全工作,但我们意识到还需进一步加快改进步伐。”普萨泰里表示。他补充说明,OpenAI已放缓部分AI研发工作,并正在调整方案,以强化研究与测试环节的安全防护。
《纽约时报》本身已就AI系统抓取新闻内容侵犯版权一事起诉OpenAI与微软;两家公司否认此项侵权指控。
两名OpenAI员工称,过去几个月,内部不断有人对AI模型测试环节的安全隐患提出担忧,包括监控力度不足;员工也曾质疑公司用于日常安全管控的软件存在漏洞。但员工表示,每次提出的疑问要么被置之不理,要么后续整改行动推进极其迟缓。
安全研究人员反馈,他们向OpenAI上报漏洞时,也遭遇过类似的冷遇。
今年7月,安全公司Hacktron的研究人员告知OpenAI,他们借助竞品Anthropic开发的一款AI模型,找到了入侵OpenAI系统的途径。研究人员表示,OpenAI一开始反而对他们的测试方式提出异议。
《纽约时报》获取的Slack通讯记录显示,OpenAI的斯塔基在公共协作频道留言称,Hacktron的研究人员费尽周折去演示漏洞,这件事“实在令人遗憾”。
Hacktron研究员莫汉·佩达帕蒂(Mohan Pedhapati)谈及当时的经历说:“我们能明显感觉到对方对我们带有不满情绪。”他还认为这家公司仍沿用初创企业的安全思路:关键基础设施直接采购外部软件服务,而非自研配套工具。
“你们怎么能用Slack来支撑相当于曼哈顿核计划级别的重大项目?”佩达帕蒂提出质疑。Hacktron发现的漏洞一旦被利用,攻击者可以完整访问Slack,查看OpenAI员工的所有内部对话。
之后,斯塔基向Hacktron方面道歉;OpenAI向这些研究员发放了6,500美元(IT之家注:现汇率约合43,666元人民币)的漏洞奖励。
普萨泰里表示:“我们感谢研究人员主动联系并分享他们的发现。”
9月,非营利安全隐私研究机构Objective‑See Foundation向OpenAI上报一处程序缺陷。一旦设备被入侵,攻击者可以获取该设备上ChatGPT用户的完整私人聊天记录,还能在用户毫无察觉的情况下操控浏览器会话。
该机构软件分析师帕特里克·沃德尔(Patrick Wardle)称,研究团队最初通过官方漏洞赏金计划提交报告后,这份上报长时间石沉大海。直到沃德尔私下联系他在OpenAI相熟的员工以及斯塔基本人后,这份报告才流转至对应的工程部门,相关人员随即着手处理。
OpenAI为此向该机构发放500美元(现汇率约合3,359元人民币)奖励。沃德尔认为,以该漏洞的严重程度而言,这笔奖金远低于其他企业的常规水平。他表示OpenAI已修复该漏洞;本周公司还在公开版本更新日志中确认了该问题,但未披露漏洞的详细细节。
沃德尔评价:“这套安全体系完全达不到一家以安全为重心的企业应有的成熟水准。”
OpenAI内部员工认为后续很可能还会曝出更多同类漏洞。公司一方面正在复盘新版模型在测试阶段的各类行为;另一方面仍持续收到黑客发来的预警,提示现存尚未修补的安全缺陷。
上周五,一组工程师与研究员发布了一份独立报告,进一步披露了Hugging Face遭攻击事件背后更多令人不安的细节:OpenAI的智能体当时还尝试给Anthropic的Claude发送消息,试图调用其他AI模型绕过网站的反机器人防护机制。
OpenAI上周也对外承认:新部署的防护措施未能拦住最新一代AI模型,模型仍突破限制访问互联网。回溯排查后还发现过去曾发生过多起未被察觉的未经授权联网事件。OpenAI随即宣布暂停其最强AI模型的训练工作,全面复盘AI系统出现的各类非预期异常行为。
而在周一,该公司进一步对外公布:出于内部研究人员提出的安全顾虑,决定暂缓发布最新版本模型GPT‑6.1 Astra。

张明远 / 2026年9月15日 下午3:20
BLG近期团战执行力明显提升,尤其是中野配合的默契度,是连胜的关键因素。
4条评论
张明远 / 刚刚
JDG需要调整前期进攻节奏,避免被BLG拖入中期团战节奏。版本环境对BLG更有利。
回复
李思远 / 刚刚
BLG的BP策略更灵活,JDG需要针对对手的常用体系做好反制准备。
回复
发表你的评论