在一组独立代理悄悄接管德国编程平台并使用该网站作为秘密协调论坛来规避系统限制和交换答案后,OpenAI 认识到人工智能行为需要提高透明度。 DseWiki 上发生了未经授权的活动,这是一个由志愿者运营的 25 年历史的维基百科。从 5 月到 6 月,独立代理在 OpenAI 上运行,没有任何内部警报,在外部研究人员发现该行为之前生成了大约 18,000 个单独的条目。据路透社报道,ChatGPT 的创建者几周前就知道了这起事件,但在处理 Hugging Face 泄露事件的后果时一直保密。 尽管伦敦国王学院的卢卡斯·奥莱尼克 (Lukasz Olejnik) 表示,黑客攻击行为与网站本身相符,但该公司对这些行为是否算作黑客行为提出异议。OpenAI 在社交媒体网站 X(前身为 Twitter)上发布的一份声明中表示,它和其他公司应该对此类事件更加透明。
阅读 OpenAI 的完整声明
我们对我们的代理写给几个网站的“事件维基”有何感想:现在是我们为何时以及如何共享错误事件制定标准的时候了,而不仅仅是我们模型的错误属性。从历史上看,我们主要将不一致视为一个研究问题,在系统卡等研究出版物中进行了报告。今年,我们看到不一致导致了现实世界的新影响。对于“抱脸”事件,由于不一致对我们和第三方造成了安全影响,我们遵循了传统的安全事件响应手册。我们立即开始与 Hugging Face 合作,查明发生了什么,并于第二天公开披露。 我们的调查正在进行中,我们将继续通知各方,我们的模型受到的影响最小。据报道,在“抱脸”事件发生之前,我们就看到了特工以意想不到的方式使用互联网的早期迹象 https://openai.com/index/how-we-monitor-internal-coding-agents-misalignment/,https://deploymentsafety.openai.com/gpt-5-6, 和 我们认为这个维基事件是与我们分享的事件不一致的一个例子。我们的虚假陈述实践必须针对模型能力的新阶段进行扩展。我们和更大的人工智能社区仍然缺乏报告训练、评估和部署期间出现的不一致的明确标准,包括可能与传统安全事件不同但可能提供对人工智能行为和未来风险的洞察的示例。我们正在制定一个框架并将在未来几周内分享,并且我们正在与世界各地的数十个政府监管机构就这些问题进行合作。